{"as_of":"2026-08-10T17:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0719bc71f4ab03a8b71e34fe7804f7123f23bc341ba36112d920771a956b19eb","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:15:52.926857Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:02:43.598214Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:56.092401Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":"2507.03483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-07-03T20:48:56.092401Z","title":"Bmmr: A large-scale bilingual multimodal multi-discipline reasoning dataset","venue":null,"work_id":"00f6cf72-7211-421c-b651-6f8794a5bed3","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:b268da20ddde3a031a622c668192198cf77aa8be32d6151e8d812984ffb80662","observation_id":"19eb5644-2edf-4276-bd43-6bfc7ba260a4","resolution":{"observed_at":"2026-05-10T11:58:58.884793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-08-02T23:41:45.067017Z","title":"BMMR: A large-scale bilingual multimodal multi-discipline reasoning dataset.CoRR, abs/2507.03483, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-08T22:51:28.920174Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.067017Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:b5d209c5181eafe09c87ce5933a71f5cb2df2025fc62dc0f01d455ca0408ec3f","observation_id":"043f1a4b-b753-4a0b-9e06-afe4d804ee16","resolution":{"observed_at":"2026-08-02T23:41:45.067017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":"2507.03483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-07-03T20:48:56.092401Z","title":"Bmmr: A large-scale bilingual multimodal multi-discipline reasoning dataset","venue":null,"work_id":"00f6cf72-7211-421c-b651-6f8794a5bed3","year":2025},"citing_paper":{"arxiv_id":"2606.03401","last_updated":"2026-06-02T09:42:29Z","snapshot_observed_at":"2026-07-31T19:49:58.852979Z","submitted_at":"2026-06-02T09:42:29Z","title":"Towards Characterizing Scientific Image Utility and Upgradability","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:37.254428Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2606.03401"},"observation_digest":"sha256:6f8b6756dfda67b08d32ca9b26161a153271a041343db037ea905e4421a8c4cb","observation_id":"ded2f978-9444-4286-af2a-5cfe152474db","resolution":{"observed_at":"2026-07-02T02:06:27.854608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":"2507.03483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-07-03T20:48:56.092401Z","title":"Bmmr: A large-scale bilingual multimodal multi-discipline reasoning dataset","venue":null,"work_id":"00f6cf72-7211-421c-b651-6f8794a5bed3","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:17e4a4b09a9f20eac3623c0985f15836a3666e022fc989f49c406fc1781458fb","observation_id":"6e2299a8-0fe7-4042-a0f1-785578fb7fe6","resolution":{"observed_at":"2026-07-03T20:48:56.094168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-08-06T18:02:43.598214Z","title":"arXiv preprint arXiv:2507.03483","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-09T19:04:45.512472Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.598214Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:703e9384b493d660d54cb82f7a303ad16599233464f1f9972841417e9046bddb","observation_id":"182f00bc-48d2-4ba2-9971-1b52146dab92","resolution":{"observed_at":"2026-08-06T18:02:43.598214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03483/citation-record","integrity":"/paper/2507.03483/integrity","json":"/paper/2507.03483/citation-record.json","paper":"/paper/2507.03483"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:15:52.545119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.545119Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:aeb4f27c5ed4fda4d72a853c4598bb666bb26d950f1869cacdb4d4d9a08e63fd","observation_id":"0196b675-2020-4ad9-afd8-792cc86d3ac2","resolution":{"observed_at":"2026-08-06T20:15:52.545119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T20:15:52.549797Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.549797Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:c3c698718c01d1c19ce59f2b96381c8ec6f86336aeefc7f48580af74a2dda507","observation_id":"c001efd2-9060-47e5-8216-628980107bda","resolution":{"observed_at":"2026-08-06T20:15:52.549797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:15:52.553874Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.553874Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:280320415fc079c61437866783c95518572c4cff4b22ab1316aae33ae9b579d0","observation_id":"4e837ba1-77d1-4473-a9aa-2d5a7ee160d0","resolution":{"observed_at":"2026-08-06T20:15:52.553874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:15:52.557584Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.557584Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:996b4ddb77d21409ff23ef44ea0e4a71b36136c9e32cacefb9def9a9011e8d4b","observation_id":"5e4c053a-6351-49d2-97dc-cef948232513","resolution":{"observed_at":"2026-08-06T20:15:52.557584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.561578Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reason- ing Benchmark for Expert AGI, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.561578Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ac0f7306743e68fb186ce9733f0546f266f59f6a7d8123e8dd7a692ae162654a","observation_id":"d0d01ff7-c1da-42f9-92ba-1fe13bdeb5ba","resolution":{"observed_at":"2026-08-06T20:15:52.561578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.565003Z","title":"Sci- enceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.565003Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:85a3d6cf3e8ad72e2e4941db447a63bb446d2fa7aa9dee5a108f1b6e1794f621","observation_id":"6dddc08f-5c55-4e0b-b062-4568f8cfaf57","resolution":{"observed_at":"2026-08-06T20:15:52.565003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.568687Z","title":"What can large language models do in chemistry? a comprehensive benchmark on eight tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.568687Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:b269ce6cebc1f471967b68c054c1e7b050acbe1648472d8e0c8ad0c108d85e62","observation_id":"461f4d28-97c3-4e46-83f2-50140d5ed506","resolution":{"observed_at":"2026-08-06T20:15:52.568687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:15:52.572152Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.572152Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:f813e2a8d8095ac2e9bd9f3c5493cbd7bce50e3e6d12fcec68ecccae8a625d33","observation_id":"eb3368ba-232b-4847-9056-24d3778465a7","resolution":{"observed_at":"2026-08-06T20:15:52.572152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:15:52.576901Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.576901Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:edd9b0a456630242d8f040a71a90d7a89c199b3fadcd703f130479e3aee1951f","observation_id":"d73a7183-14f4-4193-b473-f8edbb384ad2","resolution":{"observed_at":"2026-08-06T20:15:52.576901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.581244Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.581244Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:53fe6b9506a2ee6f15bce4d47adc4291ebe7f5591070492ac3ca56bb0a81f5fa","observation_id":"11ad014d-ed3b-4848-b195-3087ee8f5572","resolution":{"observed_at":"2026-08-06T20:15:52.581244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.585255Z","title":"Claude 3.7 sonnet","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.585255Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:321334c0c26ab04216732bdcda0d4a67112fc3dc18ca2b4a65a0debea7db0430","observation_id":"7a4441b2-d93b-4398-98a4-55d5c15d4457","resolution":{"observed_at":"2026-08-06T20:15:52.585255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-06T20:15:52.588780Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.588780Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:5ad4bb25f080fe5a885f087779de70c38f11d10b2f9632ed00eeb7a0c582f262","observation_id":"7d4f9ae3-d4ac-478e-8621-9658363a762f","resolution":{"observed_at":"2026-08-06T20:15:52.588780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.592208Z","title":"P-mmeval: A parallel multilingual multitask benchmark for consistent evaluation of llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.592208Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:589b628f6a72aa03386b21ee1c6a458c70738a2ce8c9fd989eeda9ce82121375","observation_id":"c54c5915-1fc4-4630-8e7d-3e80d278ea9f","resolution":{"observed_at":"2026-08-06T20:15:52.592208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.596012Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.596012Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:6f2158aefdfe139390d5d3110ea4c5ec47a6f08e4c59f6f9a226313bd75a1576","observation_id":"a43d3464-a496-4d92-8aa2-7d56843564cb","resolution":{"observed_at":"2026-08-06T20:15:52.596012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.600800Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.600800Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:6cd0238d2a1849228b6b61d6ec1d9b9d62aa10bac09bd2d86388fe57cb3d4a9c","observation_id":"1e0f301f-09f3-41a4-9887-c4b61bbd5631","resolution":{"observed_at":"2026-08-06T20:15:52.600800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T20:15:52.604524Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.604524Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:81f3ee047e6f1b5555fbeed6b79bf821bf8586d26a42af4db611284783bdbf79","observation_id":"61b533d6-b753-402f-a077-0458583cd244","resolution":{"observed_at":"2026-08-06T20:15:52.604524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04371","last_updated":"2026-05-21T08:45:38Z","snapshot_observed_at":"2026-07-06T16:03:58.984997Z","submitted_at":"2023-08-08T16:18:20Z","title":"Cumulative Reasoning with Large Language Models","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04371","snapshot_observed_at":"2026-08-06T20:15:52.608615Z","title":"Cumulative reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.608615Z"},"links":{"cited_paper":"/paper/2308.04371","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:3dc736f8b986f68d8e8ee5562a039ea67febbdd930fea03bf99a9f7e998368c8","observation_id":"11a9397a-b159-4a05-a6f6-70fb31f82779","resolution":{"observed_at":"2026-08-06T20:15:52.608615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.617862Z","title":"Multimodal ArXiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.617862Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:24260deea80183de9cfc4c9ae8dad92e7f05a69fd17da525a4b7e576ebf58f43","observation_id":"c048c313-80d1-4d7a-aaa5-70a70998b260","resolution":{"observed_at":"2026-08-06T20:15:52.617862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.622384Z","title":"International standard classification of education","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.622384Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:963d9d39e18fbf9a1abd05a9f9b0d4e5407ef6a4b0ca364558281af5c5a827d7","observation_id":"2771ed89-b22c-48f2-9a6b-6cae50a9822b","resolution":{"observed_at":"2026-08-06T20:15:52.622384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18071","last_updated":"2025-03-23T13:40:44Z","snapshot_observed_at":"2026-08-07T16:43:15.782410Z","submitted_at":"2025-03-23T13:40:44Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2503.18071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.18071","snapshot_observed_at":"2026-08-06T20:15:53.545946Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","venue":"cs.CL","work_id":"dee76de1-d059-4bfe-b8b2-2a3ab70766f7","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.625803Z"},"links":{"cited_paper":"/paper/2503.18071","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:425cb0ee9e6b49ec7ec9f64a94bf3bcd162533569e0f761898296e66f751afbd","observation_id":"19dbde4b-59d3-44ae-a3a5-bae7614a5a98","resolution":{"observed_at":"2026-08-06T20:15:53.550336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-06T20:15:52.629640Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.629640Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:db5d678562c5508e140b61ece65dd52c06a3146df268c9ea60d53fa280930d63","observation_id":"b944415a-66da-46c3-85df-3faed605457d","resolution":{"observed_at":"2026-08-06T20:15:52.629640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-07T15:49:03.741523Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-06T20:15:52.633699Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.633699Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:7b49290badf9a4eee9c6536bc2adf7be9824918c73d294dbbcab591061184e71","observation_id":"814105ab-5d6c-4ee3-92ab-bf4575a160b2","resolution":{"observed_at":"2026-08-06T20:15:52.633699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T20:15:52.637922Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.637922Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:72e285824956f52a561d99f48dd49a6e63d123b0c43bbad48da5bf796df62e30","observation_id":"31c21de8-0702-4dd8-a981-a1f2b467ffae","resolution":{"observed_at":"2026-08-06T20:15:52.637922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T20:15:52.641896Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.641896Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:10739e1e820a33c158034c62c0618b764d7f9be31a4b7de7e478dd89c7f9891a","observation_id":"b76387e4-3dff-4ef0-8212-d05f5bca5e0f","resolution":{"observed_at":"2026-08-06T20:15:52.641896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-06T20:15:52.646946Z","title":"Visualprm: An effective process reward model for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.646946Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:e83eef3d2f1887e1d75e4198ed2c145a3909e465395c17e5e3fbb4cc1a6017f8","observation_id":"e6bbca02-a527-4cb8-a7e2-05fd2c2b8596","resolution":{"observed_at":"2026-08-06T20:15:52.646946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T20:15:52.651200Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.651200Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:8fc6429f9b03d2e9fb00c78db1f52f0fe020c708b34c4d7e8a3cee77ec19ceb0","observation_id":"14180049-22fc-4abd-be0a-90ce1b3dd6bb","resolution":{"observed_at":"2026-08-06T20:15:52.651200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-10T09:50:19.291850Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-06T20:15:52.655037Z","title":"Missing premise exacerbates overthinking: Are reasoning models losing critical thinking skill? arXiv preprint arXiv:2504.06514, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.655037Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1b3795eeb50d07271515a3fb569784935e1458f1f270706444cfe8bfa10f1d68","observation_id":"f5a3d15d-6335-4ea6-8e7c-e02618a8b1c4","resolution":{"observed_at":"2026-08-06T20:15:52.655037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01779","last_updated":"2024-03-28T22:27:12Z","snapshot_observed_at":"2026-08-07T20:31:41.793088Z","submitted_at":"2023-10-03T04:01:27Z","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01779","snapshot_observed_at":"2026-08-06T20:15:52.659099Z","title":"Halle-control: controlling object hallucination in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.659099Z"},"links":{"cited_paper":"/paper/2310.01779","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:d8abfe859cdc292f9a00b4248126ec89cdfe4d680f1353b18bf10a871eb13ae4","observation_id":"9c59b816-d211-4455-b145-30517c69511a","resolution":{"observed_at":"2026-08-06T20:15:52.659099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.663171Z","title":"Hal-eval: A universal and fine-grained hallucination evaluation framework for large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.663171Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:b0103ef917286f1c958756031ac012a030ab729cfad6483b361129eb4e3baeac","observation_id":"5fd9cdcc-245b-4092-bd2c-4ce3568ad1ef","resolution":{"observed_at":"2026-08-06T20:15:52.663171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.666627Z","title":"The second half","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.666627Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:aec0681559713f87572c1586b1cf222457243c85a9f12ccf11f0c0a5e8d5dbc4","observation_id":"dff49deb-9081-4e57-a825-2d4fe27a794e","resolution":{"observed_at":"2026-08-06T20:15:52.666627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.670814Z","title":"Elevater: A benchmark and toolkit for evaluating language-augmented visual models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.670814Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:2015cd105b82454c0ddd4ea83967ade4074537bb21a39e8b6c56fcd0506408d6","observation_id":"2fb3b996-4df1-46d4-aa02-6ed8afb6f6d9","resolution":{"observed_at":"2026-08-06T20:15:52.670814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.674522Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.674522Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:f7898afae32b35017dd8d46334b90d57ed61729a7f8efd1a389efbfc3cee2666","observation_id":"59a54d08-71cd-4773-a16a-f1ba0da0294a","resolution":{"observed_at":"2026-08-06T20:15:52.674522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T20:15:52.678109Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.678109Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:34b455c75e68e7158ff0066885464182ee6dae0b6c55a2f8c9b2144b71a415b1","observation_id":"17c5c31d-b620-4493-b796-a8b6dd59cdd3","resolution":{"observed_at":"2026-08-06T20:15:52.678109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T20:15:52.681595Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.681595Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:c4ce7321107fffe21022a51a7ea558a7dded654a2f3f55936eb24d9cb9f52077","observation_id":"eec4027b-0b94-4579-b9ae-994cd9e300f1","resolution":{"observed_at":"2026-08-06T20:15:52.681595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.685339Z","title":"Gemini 2.5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.685339Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:c32a768c1495c57259feb4a86ea1e2b999199bd1fe6121ff9be0a1d87de50ffd","observation_id":"d88e2028-b93b-4ba4-aead-19819e32635f","resolution":{"observed_at":"2026-08-06T20:15:52.685339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T20:15:52.689598Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.689598Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:8c36e27753ca7c6c69b8209e70bd5edfd86dfe1637e8bd4927eaa2444df3cf03","observation_id":"a4ae9a29-feaa-4155-a224-c9d95132001b","resolution":{"observed_at":"2026-08-06T20:15:52.689598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-06T20:15:52.693320Z","title":"MathVerse: Does Your Multi- modal LLM Truly See the Diagrams in Visual Math Problems?, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.693320Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:83a65326139a2ccbfda26aa95c994edb2c12442db97624761963e6c5d60d91a9","observation_id":"57d9a831-24c3-49d7-b08c-97ae6260c925","resolution":{"observed_at":"2026-08-06T20:15:52.693320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T20:15:52.697483Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.697483Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ce955dfde3c4e08e3e45d87a2d24a0b9261ff331e5824995564a37c890ca6a39","observation_id":"717384d5-dc58-4e87-b348-d36840ac1aa1","resolution":{"observed_at":"2026-08-06T20:15:52.697483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-06T20:15:52.701699Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.701699Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:474fc943784672647d2efd6f375e4d892f85cde50fbea911f894e7d8bd139cff","observation_id":"e509b6e9-ec44-41bd-865e-d1e0d170bfc1","resolution":{"observed_at":"2026-08-06T20:15:52.701699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14011","last_updated":"2024-05-08T07:34:06Z","snapshot_observed_at":"2026-07-06T17:20:17.051503Z","submitted_at":"2024-01-25T08:22:10Z","title":"CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14011","snapshot_observed_at":"2026-08-06T20:15:52.706978Z","title":"Cmmu: A benchmark for chinese multi-modal multi-type question understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.706978Z"},"links":{"cited_paper":"/paper/2401.14011","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:039c19e32b25604f4a6536bc4013ba5f1eca09c610f6a68e6602cb5652272635","observation_id":"59c29797-7406-4cc9-8f12-44a690f1425f","resolution":{"observed_at":"2026-08-06T20:15:52.706978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-06T20:15:52.710933Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.710933Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:4ca07a7660ab87d960c286106c52e8906e7fb560f15a49e7b31e18b9183a5a03","observation_id":"8bfe9a92-6741-43ec-9626-7cc730452232","resolution":{"observed_at":"2026-08-06T20:15:52.710933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.930062Z","title":"Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehension","venue":null,"work_id":"88c2f2a3-91ce-4af8-9346-2cb37041b6dd","year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.714872Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1e885633daf3387be1d7f18821f2d1a0c07600c6aee828bf686e88e4f770b46f","observation_id":"c983e567-740d-4f0e-b249-3590d7cef571","resolution":{"observed_at":"2026-08-06T20:15:53.934789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-07T10:24:39.020859Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-06T20:15:52.718735Z","title":"Worldsimbench: Towards video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.718735Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ce2dbd6b458d23ebbdfa1242be1c0e8b1b6e702df33e7ddb2e971dbfb7fcb313","observation_id":"1a482397-f3b1-4315-9fa2-f3cf176d83b3","resolution":{"observed_at":"2026-08-06T20:15:52.718735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.724401Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.724401Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:c9d697ee9f6e0156cd881072fdcf5222a7fc44e9ad2daee69f0da5e7aa97b067","observation_id":"415e36ab-9b69-4de4-a2ac-106cb43d10e3","resolution":{"observed_at":"2026-08-06T20:15:52.724401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13111","last_updated":"2025-09-08T09:39:12Z","snapshot_observed_at":"2026-08-07T16:58:08.320439Z","submitted_at":"2025-03-17T12:34:22Z","title":"MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13111","snapshot_observed_at":"2026-08-06T20:15:52.729171Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.729171Z"},"links":{"cited_paper":"/paper/2503.13111","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:64b674689287d35c4480f3ddef11765e297b5a31684f466075c5967a603702bb","observation_id":"c03f60c5-0ec2-4492-94af-b179664f1177","resolution":{"observed_at":"2026-08-06T20:15:52.729171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-09T16:57:03.077389Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-06T20:15:52.733114Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.733114Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:8167c0603944e68df17fed09d26d0d8e3f4a784d01e35887d5ba560399587de6","observation_id":"c569df7c-8152-4629-8373-70c74568eca3","resolution":{"observed_at":"2026-08-06T20:15:52.733114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T20:15:52.737246Z","title":"Llava-cot: Let vision language models reason step-by-step, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.737246Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:7835397dfe63ed54f45c68351d2d0d71d54d7fd6b9eeef71b89df1718546e25d","observation_id":"f5e5e55d-0c93-42bc-8c6d-ac9082eba907","resolution":{"observed_at":"2026-08-06T20:15:52.737246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T20:15:52.742706Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.742706Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ee9582347855ccbdec4575329d25a0de077ec93675c516d7c76f33898b4f7d62","observation_id":"4d4fd369-42ff-48dd-aa16-8a3b2a588772","resolution":{"observed_at":"2026-08-06T20:15:52.742706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T20:15:52.747130Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.747130Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:19bd5295383ad3fd68db73dc00a2d04a9c7bf37dd6fce7b0ccff5b210ecd8424","observation_id":"8f0d0dbc-bb94-4e32-af2c-afdeb0ac4b09","resolution":{"observed_at":"2026-08-06T20:15:52.747130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.752298Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.752298Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:dfb06741f2b0a26767ad19d568e66f2e6cce68baa473ad57c9a3ed0a9c9227c8","observation_id":"ab0e998a-2ab1-49a5-a659-96c0d5b83aea","resolution":{"observed_at":"2026-08-06T20:15:52.752298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T20:15:52.756735Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.756735Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:2c54271f5420a4f6d7151a6bc6ef699218b9b0080079bdffde03a135b1d9a3f3","observation_id":"a8355300-10c5-4c64-bd8c-6442ff837d21","resolution":{"observed_at":"2026-08-06T20:15:52.756735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-06T09:12:58.062581Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-06T20:15:52.760921Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.760921Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:c7dc7134d5cb4a8368193cc7baee9b04e795666f3607652b68709df846d4c5ad","observation_id":"849056ab-8732-4605-8bed-aa8161486bed","resolution":{"observed_at":"2026-08-06T20:15:52.760921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-10T12:31:19.058935Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T20:15:52.764833Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.764833Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:f309c37833f78f7ae43eac24260b4ae809f56b09b995c60fb8303e8fb65d3915","observation_id":"7fae0959-5729-4815-b117-045361ba19bc","resolution":{"observed_at":"2026-08-06T20:15:52.764833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T20:15:52.768877Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.768877Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:7579f241539193d2e68ca19702a6c4b6b0065f15b058b423d5dc276ce609714a","observation_id":"081ce2bf-beb7-4cee-80f6-57e90bf31711","resolution":{"observed_at":"2026-08-06T20:15:52.768877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04618","last_updated":"2025-03-06T17:03:17Z","snapshot_observed_at":"2026-08-07T17:24:08.451711Z","submitted_at":"2025-03-06T17:03:17Z","title":"Better Process Supervision with Bi-directional Rewarding Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04618","snapshot_observed_at":"2026-08-06T20:15:52.772660Z","title":"Better process supervision with bi-directional rewarding signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.772660Z"},"links":{"cited_paper":"/paper/2503.04618","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:426e682763948ac999cfacedb3dc231e7e3b4d1307d0bcc50f6e63314ee6e593","observation_id":"29c5a000-9b78-4855-8090-ad9185c86536","resolution":{"observed_at":"2026-08-06T20:15:52.772660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.776986Z","title":"Bandit based monte-carlo planning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.776986Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:077ca3fcfb3a67d2eaf044825b3459e88cd33bb5326495ce1c2be7635a6d5d76","observation_id":"51cc0d4b-bd68-4089-99b2-3295328529ae","resolution":{"observed_at":"2026-08-06T20:15:52.776986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.895200Z","title":"Efficient selectivity and backup operators in monte-carlo tree search","venue":null,"work_id":"5aae205e-575e-437d-9bda-49c883768662","year":2006},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.780751Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:d5d563ab8eafcd167f21e9d233ae3e1a60603d401c4185695c0401f51a496deb","observation_id":"b15b2ea2-9412-4577-b323-58c9e367dc85","resolution":{"observed_at":"2026-08-06T20:15:53.899442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09724","last_updated":"2024-04-01T13:50:51Z","snapshot_observed_at":"2026-08-07T05:06:51.002209Z","submitted_at":"2023-11-16T09:56:28Z","title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09724","snapshot_observed_at":"2026-08-06T20:15:52.784527Z","title":"Ovm, outcome-supervised value models for planning in mathematical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.784527Z"},"links":{"cited_paper":"/paper/2311.09724","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:791013b1803fbc485efb66e92680a7322f9bee8b30dee4cb14a23b187e613343","observation_id":"d6a07ceb-aa06-48d0-9f29-7c11db37d6ad","resolution":{"observed_at":"2026-08-06T20:15:52.784527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11287","last_updated":"2025-02-11T05:41:41Z","snapshot_observed_at":"2026-08-06T19:03:24.746489Z","submitted_at":"2024-10-15T05:10:34Z","title":"Process Reward Model with Q-Value Rankings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11287","snapshot_observed_at":"2026-08-06T20:15:52.788301Z","title":"Process reward model with q-value rankings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.788301Z"},"links":{"cited_paper":"/paper/2410.11287","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:e0f0b3e6edf13ec0223cf8d285174a8fe5c6e934cf80db332dd5a08ed9d6ff1b","observation_id":"8e28e85a-a52d-48c4-81a8-bcdde58098ea","resolution":{"observed_at":"2026-08-06T20:15:52.788301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-06T20:15:52.792261Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.792261Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:93a8ed8b8b5bb621252908cfeb07b654d6c07312e0387b6e3c47de6ef33d11de","observation_id":"e9b66aa5-718f-4c68-a563-11dcb260dfc1","resolution":{"observed_at":"2026-08-06T20:15:52.792261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05910","last_updated":"2024-04-09T23:21:45Z","snapshot_observed_at":"2026-08-09T21:37:08.032254Z","submitted_at":"2023-10-09T17:56:53Z","title":"SALMON: Self-Alignment with Instructable Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05910","snapshot_observed_at":"2026-08-06T20:15:52.796856Z","title":"Salmon: Self-alignment with instructable reward models.arXiv preprint arXiv:2310.05910, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.796856Z"},"links":{"cited_paper":"/paper/2310.05910","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:329dd057e95518d679cacaf8cf067939bde7ef575e31c0fe3affc708928f3812","observation_id":"e31829f5-60f1-4b74-87bc-5d1de299266b","resolution":{"observed_at":"2026-08-06T20:15:52.796856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T20:15:52.800618Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.800618Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:9912e2003b04efbcd371ff281fca4aa496b05b32672f8a6f518051d5f08ed94d","observation_id":"1339cbfa-27d2-4f3c-b29e-0928a7dfcc23","resolution":{"observed_at":"2026-08-06T20:15:52.800618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07708","last_updated":"2024-03-14T02:02:31Z","snapshot_observed_at":"2026-08-10T12:39:18.229136Z","submitted_at":"2024-03-12T14:51:57Z","title":"Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07708","snapshot_observed_at":"2026-08-06T20:15:52.803990Z","title":"Improv- ing reinforcement learning from human feedback using contrastive rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.803990Z"},"links":{"cited_paper":"/paper/2403.07708","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:0a5d7a9c64af92e036bfb1f30789fa4e35808a9bb504772dab053f7f0897172b","observation_id":"97a9a0db-f0a4-4fdb-88dd-c2ff8fc7abf6","resolution":{"observed_at":"2026-08-06T20:15:52.803990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.06217","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Examining false positives under inference scaling for mathematical reasoning","venue":"ArXiv.org","work_id":"c2cb2c91-5303-41e4-892c-de0bc21f15fb","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.808246Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:5fe43d1285796eed4f46b00e1b63aeb93c798119fc83c93ec69702cf5cf913e5","observation_id":"d92fb749-f394-4f1a-b187-4fc6ffdfd77d","resolution":{"observed_at":"2026-08-06T20:15:53.023616Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05221","last_updated":"2024-08-11T22:20:19Z","snapshot_observed_at":"2026-08-09T16:35:57.527702Z","submitted_at":"2024-04-08T06:35:09Z","title":"LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05221","snapshot_observed_at":"2026-08-06T20:15:52.814532Z","title":"Llm reasoners: New evaluation, library, and analysis of step-by-step reasoning with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.814532Z"},"links":{"cited_paper":"/paper/2404.05221","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ed3c2d1d1b74f1dd780874d84bec6be562edd9004d6d6e934a3d9b292d4d175f","observation_id":"e3725d2b-e79d-425a-8ce4-15a9d4f1ad1a","resolution":{"observed_at":"2026-08-06T20:15:52.814532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.882730Z","title":"When benchmarks are targets: Revealing the sen- sitivity of large language model leaderboards","venue":null,"work_id":"aca06841-1bf3-4941-91a9-4e8bcbcc7317","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.818291Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:4a1ae6aece6a2ed84767ff738e73ce7ca63a58cb195cee39d0acfc4dde5a44d5","observation_id":"820699b0-56dc-44d2-a1ca-65509caa0638","resolution":{"observed_at":"2026-08-06T20:15:53.887422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.871012Z","title":"LLMs may perform MCQA by selecting the least incorrect option","venue":null,"work_id":"1f534924-9bb8-41bb-9e79-a274f849e92e","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.827005Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:a7530af28b05e88a278f3be0f506eb988a12dd55e33608c8f7e6ede57f656b7b","observation_id":"881975a4-3c79-4864-95e0-367ca9a90bc4","resolution":{"observed_at":"2026-08-06T20:15:53.874770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.830477Z","title":"Llm-evaluation tropes: Perspectives on the validity of llm-evaluations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.830477Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:e1b7f65c11a1641c3fe7fdf6f844f244b5e3d6ba2c39480356455f47bf43ea13","observation_id":"29b595b6-4567-4e63-84df-20843a84b03d","resolution":{"observed_at":"2026-08-06T20:15:52.830477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14996","last_updated":"2025-06-08T14:56:13Z","snapshot_observed_at":"2026-08-07T16:52:48.017259Z","submitted_at":"2025-03-19T08:45:03Z","title":"Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14996","snapshot_observed_at":"2026-08-06T20:15:52.834798Z","title":"Right answer, wrong score: Uncovering the inconsistencies of llm evaluation in multiple-choice question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.834798Z"},"links":{"cited_paper":"/paper/2503.14996","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:64d2b101075c9d9d97550d5261738586668c1a13c57eeec6267df332ff9614b1","observation_id":"ac13ee45-6f5e-4d40-8333-138f75f524fc","resolution":{"observed_at":"2026-08-06T20:15:52.834798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.859208Z","title":"xfinder: Large language models as automated evaluators for reliable evaluation","venue":null,"work_id":"f2ffa9c4-68dc-43fb-82f4-324287648861","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.838908Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:656ed696e6954bdd10c7dd3f05d804526e22a3a8de274f9ad2635a5dc4cdab7b","observation_id":"2cbaac74-cec4-44ea-946f-42cf9c594d4a","resolution":{"observed_at":"2026-08-06T20:15:53.863526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.847206Z","title":"Gemini 2.5 flash","venue":null,"work_id":"9a1a2896-b0bc-4fe8-ba19-a2ed4fff8ea3","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.842692Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:26b2f6d3d576bb6d3c2efd0f5593a240a6b125058fa45d1d653c8fedf599d478","observation_id":"0f38035f-23bd-4724-9d29-014052b7e437","resolution":{"observed_at":"2026-08-06T20:15:53.851010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T20:15:52.846633Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.846633Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:13f58a384995c285971174d1a1560e8b0d3f62490ccea09abc72ec435990e135","observation_id":"7d9dcc68-1485-4200-93be-794bf78da20d","resolution":{"observed_at":"2026-08-06T20:15:52.846633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.835156Z","title":"Internvl3: Advancing open-source multimodal models with native mul- timodal pretraining","venue":null,"work_id":"473dc63d-a7f6-47ca-b47f-d69cdf51abdb","year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.850191Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:b1420651568f1e5866c6676f80a80f1a9dfb6ca00ec3c1855811e84e9e99004f","observation_id":"855707f7-c8b0-46b7-b564-0ce9163f59c1","resolution":{"observed_at":"2026-08-06T20:15:53.839160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.854871Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.854871Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:afb6ce0747ba266cd85667ce53c2486dfa3b076e1b9ecb3cc41788c0e4ba9e38","observation_id":"56920f09-1579-4f22-8f5a-91d6b6520a27","resolution":{"observed_at":"2026-08-06T20:15:52.854871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T20:15:52.858559Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.858559Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1a9a9a9902ca605bcdc90263a9ce3443358ef816ea90d8e68c275924547f9590","observation_id":"1bca3adc-e7b8-4092-a8be-ad9def86939f","resolution":{"observed_at":"2026-08-06T20:15:52.858559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T20:15:52.863191Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.863191Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:cc1fc9bc637f6e352af479ddd9b78358bda2659ed79b1c6d481c779395a0f4d3","observation_id":"c39b1df0-7116-454c-8268-c435a71761fb","resolution":{"observed_at":"2026-08-06T20:15:52.863191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:15:52.867152Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.867152Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:4475208debdccde72ce7015b2f245f78ed432c7f6e08dee7d12acacf8c3582ad","observation_id":"333414fa-1cd1-44c1-88f2-de0b5dab8950","resolution":{"observed_at":"2026-08-06T20:15:52.867152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T20:15:52.871522Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.871522Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1efae5f10d50ea9f7f869b3223ad822a9743215a58ca7f7fe20b4cb3a10ccbd8","observation_id":"86989673-95a9-4fe3-87f8-8f610e120782","resolution":{"observed_at":"2026-08-06T20:15:52.871522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T20:15:52.876328Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.876328Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:46d4d783ab1f9c714f407e2041b5f1aa7408b3d74993ebe894817cfc317b679c","observation_id":"c581f00f-528b-4a66-8d94-fa23c2970249","resolution":{"observed_at":"2026-08-06T20:15:52.876328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T20:15:52.880163Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.880163Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:9150df68e8bbf10fb1f19124ba5d1e7fe9e154ee5aedb658812b08cbe7ad995c","observation_id":"57807e59-0a43-4f93-b5c0-d06b67cc9349","resolution":{"observed_at":"2026-08-06T20:15:52.880163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:15:52.884044Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.884044Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:7ad7594d306e21017a002774ded0fdfdc9417923510de2335dd50ab4ba3730ed","observation_id":"6928dccb-5ae1-499a-a476-29a0ae3c78a7","resolution":{"observed_at":"2026-08-06T20:15:52.884044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-06T20:15:52.887684Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.887684Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:22738306323cf1ce9692f725a4208224a391185b6d950f40ed939c5626a6349c","observation_id":"28faa975-416c-4b4a-abf9-c8e60afd8a80","resolution":{"observed_at":"2026-08-06T20:15:52.887684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T20:15:52.891650Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.891650Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:61265b6b856ded49ff2ca2aff1e899e6f71ea92ab7c45968cc80948c3ec3adeb","observation_id":"498d7beb-586b-413f-aca6-bce5709b0fc6","resolution":{"observed_at":"2026-08-06T20:15:52.891650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.896058Z","title":"Swift:a scal- able lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.896058Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:cf2a4fd13421f86bb9bafa4ae8de5f0f22a994b09ba657c39f44f6182a8c1b7b","observation_id":"ca9e36a5-7d26-4505-aa6e-fda642f5da38","resolution":{"observed_at":"2026-08-06T20:15:52.896058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.808344Z","title":"fact verification","venue":null,"work_id":"9ff2ade3-ec93-430a-8183-74d30b856fc5","year":2023},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.900027Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:3c7afd1ae8f849a36c74401a743b92abe2a715d92a3ab77a6acbdf27830f6925","observation_id":"430102e6-d2be-48dc-87ed-cf6aa7da7169","resolution":{"observed_at":"2026-08-06T20:15:53.812240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.796830Z","title":null,"venue":null,"work_id":"3e5f5a7f-a727-4dbf-b7b6-730feb3770d6","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.904012Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:166a75f803d8f3b691ef1b33d9cd2cf30cf3baee51498ca1aadaaad3452d4ac6","observation_id":"ecfd68ab-fee9-431c-a6db-9fa838cf3f6b","resolution":{"observed_at":"2026-08-06T20:15:53.800449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.785251Z","title":null,"venue":null,"work_id":"a564ec5e-ae8c-449f-bd65-aede1bc7cd55","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.908029Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:a954a2d52ba7e3989ce01afeb41e17da2204a805e81d3408f2656be427fa8369","observation_id":"554efa4c-683c-441d-bc93-e10c29d1600e","resolution":{"observed_at":"2026-08-06T20:15:53.789297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.771390Z","title":"the southeastern part has rich forest resources","venue":null,"work_id":"6e79263c-331e-47d2-8a6b-ce47def5deec","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.911579Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:859517ea263124f82b9dcb4012bdd1e2320f38a1135f736e2ee74c14152eedbb","observation_id":"42294d97-2459-4b35-8f87-923266aed433","resolution":{"observed_at":"2026-08-06T20:15:53.775845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.759310Z","title":null,"venue":null,"work_id":"438f2cb9-1411-49e7-984b-d646902c5994","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.915564Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:d11cdea43bc328e88eeace3d9c65f6a99ecebc5cd8d0c4f75bf8bb1b77f9377d","observation_id":"e3b84485-b1fb-4c67-8ed9-aa64db3d9c3d","resolution":{"observed_at":"2026-08-06T20:15:53.763119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.747875Z","title":null,"venue":null,"work_id":"524d0c99-dcdc-4e00-ab1a-f0b0a9317703","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.919130Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:69554547b9af72a81aa069f2fe893fbf96d146b4c87f2fcf2d0276531a6e0dc9","observation_id":"0912e1eb-79a9-48a8-a6d6-8a2c30e51ce7","resolution":{"observed_at":"2026-08-06T20:15:53.751893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.736562Z","title":null,"venue":null,"work_id":"95994f3b-b8f7-4bc2-bcb2-0a86a3618803","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.923169Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:b3a5a179cc653f0dbaca812742c4206ba23bcf8422278e1df9a0d5e1123e2d23","observation_id":"929a71a1-9ac5-4fdc-b706-9a5234b8099d","resolution":{"observed_at":"2026-08-06T20:15:53.740663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:53.725115Z","title":"F Limitations and Broader Impact BMMR is a dataset that focus on multidisciplinary reasoning for multimodal models","venue":null,"work_id":"fe2a7d26-a417-4b78-b351-07414f5c8ac8","year":null},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.926857Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ec7f1b543cc1d8f7b9d400415d96efb1920011909064337b66eb3c5d61ec5a7b","observation_id":"19e66c48-fdad-40ae-bc07-676440fc883d","resolution":{"observed_at":"2026-08-06T20:15:53.728981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:15:52.822666Z","title":"doi: 10.18653/v1/2024.acl-long.744","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.822666Z"},"links":{"citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1cb59fa1b719d775c311eeb406990dc1228ccfb56ce8dfb29d221347bb8bc0f1","observation_id":"85ad6546-f4a4-4d92-9676-795774282688","resolution":{"observed_at":"2026-08-06T20:15:52.822666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 5 inbound Pith citation observations for arXiv:2507.03483."}