{"as_of":"2026-08-18T08:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96c59c65935f6dfd91e603687f3c420fcad6d0d1de763141c28b449ae8fc7068","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:31:36.673705Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:11:51.138098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:11:00.663569Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"cited_work":{"arxiv_id":"2505.12766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12766","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning-OCR: Can large multimodal models solve complex logical reasoning problems from ocr cues?","venue":null,"work_id":"1f56692b-f9f4-4a5a-b519-0cd19e7a4e3b","year":2025},"citing_paper":{"arxiv_id":"2604.12978","last_updated":"2026-04-14T17:12:41Z","snapshot_observed_at":"2026-08-15T01:30:32.879614Z","submitted_at":"2026-04-14T17:12:41Z","title":"GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:51.138098Z"},"links":{"cited_paper":"/paper/2505.12766","citing_paper":"/paper/2604.12978"},"observation_digest":"sha256:bca85718ca92b7e73a6abdabbe117e2597e08001b129c9e2b896a829eb4fc416","observation_id":"5dade1ca-1000-4b86-8708-6d2536cc70fc","resolution":{"observed_at":"2026-05-11T09:11:00.667074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12766/citation-record","integrity":"/paper/2505.12766/integrity","json":"/paper/2505.12766/citation-record.json","paper":"/paper/2505.12766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:31:36.449612Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.449612Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:853f08de46e0543b4023b154b3fda2ab86c3c9705242f977894029be676e1896","observation_id":"4e898e83-0abc-4a92-97a5-49d6a7988c36","resolution":{"observed_at":"2026-08-15T20:31:36.449612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.479705Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"bdf216a3-eae8-4714-b415-e611ae48e675","year":2022},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.454637Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:3bd126f9cb228229de856cbcfda5ee25ce501000787406586bfa6dff881caa03","observation_id":"f0310bbd-8149-442c-b476-7ecb8b67f4d5","resolution":{"observed_at":"2026-08-15T20:31:37.484551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.465929Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning","venue":null,"work_id":"a12bb352-7df6-4995-8eb7-60d23590fa9e","year":2021},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.459084Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:65bc1257734aa50ccfc772b85d32e233efa52b67f0a338362a40b7c9655034a7","observation_id":"47eba2d0-4ebc-4b2d-9214-692f035a5915","resolution":{"observed_at":"2026-08-15T20:31:37.470776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.452619Z","title":"Onechart: Purify the chart structural extraction via one auxiliary token","venue":null,"work_id":"c017da98-2e4e-4fe0-9525-c1fc7f908551","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.464033Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:825ce176ead9ca8a8d5ec5b015d114230cb9573f2c632204e9d118fa0190e6c3","observation_id":"a3b8a5c6-b2ab-4ff1-9338-5c64f034be4b","resolution":{"observed_at":"2026-08-15T20:31:37.456499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T20:31:36.468772Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.468772Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:0c3fd8be532a50e70655e7b65a14749040d5d2fa2351e1bf890e81f7ed96c235","observation_id":"1edd40f8-57b2-448e-bdb9-ed62261577db","resolution":{"observed_at":"2026-08-15T20:31:36.468772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.439267Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"9ee6b202-1cfb-488e-950f-44fd247402a7","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.474441Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:58afaddff85d98b5b97d4423bf6c712455c4ae947aae7fc7aec3c8281fbd4d99","observation_id":"d7bbec18-b5fd-41fa-97ec-b988064f9b9d","resolution":{"observed_at":"2026-08-15T20:31:37.443532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-15T20:31:36.479795Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.479795Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:63830c218e6f363e75a991f844302bd0fe7499c16158de779d56780994866014","observation_id":"e0b87790-3eff-4ca2-93cb-3059c250311e","resolution":{"observed_at":"2026-08-15T20:31:36.479795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-15T20:31:36.486216Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.486216Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:a817d7dd1862a9e3995035541f089f6e951f78257c2c215bce04b698212b4a93","observation_id":"fa295075-0556-4fdd-9c27-5e5fe8c4f06f","resolution":{"observed_at":"2026-08-15T20:31:36.486216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-15T20:31:36.491246Z","title":"mplug-docowl2: High-resolution compressing for ocr-free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.491246Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:fc2ef74ef1d85a40db37c476387c89fead4ac79948704661dce9efb911f0f26f","observation_id":"347854c3-2afa-4c36-812e-761718bb78d7","resolution":{"observed_at":"2026-08-15T20:31:36.491246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T20:31:36.500944Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.500944Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:f614c646745761a3d1cb9017d8f25ed06f4b9c7103a620ce5b7300854029b110","observation_id":"76aa7660-cc27-4fa7-8983-518bea5fd6e6","resolution":{"observed_at":"2026-08-15T20:31:36.500944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-16T13:57:47.881881Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-15T20:31:36.506036Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.506036Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:bdf9c7ca4736fbcdc82c003cbd50249e32fb02f026420861b30658c679c84552","observation_id":"0e6110f5-c63c-467d-9361-79217ce2c16e","resolution":{"observed_at":"2026-08-15T20:31:36.506036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.403299Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"bfb8ea81-a6d0-4ab4-86c1-7ba0e42a69c4","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.513878Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:37047d4c71866c77bef8aa8612879432d4e43bee3d065a35113af3a91792a929","observation_id":"096892fe-06d3-441d-8eff-bc3abe7fd460","resolution":{"observed_at":"2026-08-15T20:31:37.424399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14295","last_updated":"2024-05-23T08:15:49Z","snapshot_observed_at":"2026-08-16T13:50:19.823615Z","submitted_at":"2024-05-23T08:15:49Z","title":"Focus Anywhere for Fine-grained Multi-page Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14295","snapshot_observed_at":"2026-08-15T20:31:36.519704Z","title":"Focus anywhere for fine-grained multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.519704Z"},"links":{"cited_paper":"/paper/2405.14295","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:11b993507f52fb0ef950089a25c2152b12edf7b13127ad51617ab8c53eda3b9d","observation_id":"74d3a0f9-77a2-4ba7-b166-6ca7cef8d207","resolution":{"observed_at":"2026-08-15T20:31:36.519704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.366057Z","title":"Mmc: Advancing multimodal chart understanding with large-scale instruction tuning","venue":null,"work_id":"987b2ee8-10e9-4578-b76e-194dea656080","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.524813Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:871eafa6bbeeef3ce822ef7ec08a765809d12d568153fabd7badc3a733b4b844","observation_id":"edf02ff3-4d44-46d6-8a90-5b240bf5f2c3","resolution":{"observed_at":"2026-08-15T20:31:37.378581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.331710Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9020052c-17b8-4f96-8583-0bf80964b200","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.531578Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:5c1da48aa2fb8157f9bdfe22e9fb695d9887e333bba581c194ea9f253f002ec1","observation_id":"028230fc-9476-4a55-a5db-4e189afedf76","resolution":{"observed_at":"2026-08-15T20:31:37.345907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:36.537271Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.537271Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:add0d2549b75fe8e0d45ca44da3cf8ed660daa4d2caf1a591d4b820356a36175","observation_id":"01a93eae-8f7c-4358-b461-cb0b5dce8b8d","resolution":{"observed_at":"2026-08-15T20:31:36.537271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.222137Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"668c9f25-c12b-4bcc-a96c-5b9f01e34b17","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.541759Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:c71d973da8af4158c98321b9414deb3cfc452a2f009c825640b62cce684a2713","observation_id":"041c2c6e-6720-4b88-abc1-4d057104c833","resolution":{"observed_at":"2026-08-15T20:31:37.260264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-18T07:34:13.234486Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-15T20:31:36.546422Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.546422Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:0f10a8416f44118d0fae0dee78032010d548e01859307a763982401c7bb4da2a","observation_id":"38bb003f-b811-44fd-894f-1a7d08ef9f89","resolution":{"observed_at":"2026-08-15T20:31:36.546422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.165647Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"a6412351-4f68-44c8-bc2b-89586f2af20c","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.550750Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:cd466ec9c9489b3d3d51afccd418fd849e4d6eb8fdf3c8c56b59329ff504ae39","observation_id":"f956029f-b1a5-4fab-b568-ccd13c9d57a9","resolution":{"observed_at":"2026-08-15T20:31:37.196376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16352","last_updated":"2024-09-11T08:23:58Z","snapshot_observed_at":"2026-08-16T14:15:25.610938Z","submitted_at":"2024-02-26T07:17:25Z","title":"MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16352","snapshot_observed_at":"2026-08-15T20:31:36.555576Z","title":"Mathgenie: Generating synthetic data with question back-translation for enhancing mathematical reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.555576Z"},"links":{"cited_paper":"/paper/2402.16352","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:09e30faa52f73d1982b819154259907dbfc57ef17c77bfb4d2ce8ad423034626","observation_id":"28531fba-c90d-422f-a967-cafcc9bee302","resolution":{"observed_at":"2026-08-15T20:31:36.555576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08196","last_updated":"2024-10-10T17:58:40Z","snapshot_observed_at":"2026-08-16T13:10:35.066220Z","submitted_at":"2024-10-10T17:58:40Z","title":"MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08196","snapshot_observed_at":"2026-08-15T20:31:36.562481Z","title":"Mathcoder2: Better math reasoning from continued pretraining on model-translated mathematical code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.562481Z"},"links":{"cited_paper":"/paper/2410.08196","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:e28c91bc026df8ae0e21808d48f696be3b82ad71f80c2ae0a4bb2c9469c44410","observation_id":"dbae85ca-7c13-41da-bc19-49eadac494a0","resolution":{"observed_at":"2026-08-15T20:31:36.562481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.151977Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":"89a54613-83c2-4e52-a390-417ca1042ff2","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.573654Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:6ebc0abb411ecb30a66c90ded1bbe50bc2a0a44affa9db0ee65d3ef8a9c01c32","observation_id":"1540bb76-157e-493b-86b8-84f3145a3d91","resolution":{"observed_at":"2026-08-15T20:31:37.156732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.139108Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"3cea2ae0-cfaa-4642-9612-3fe749c7c659","year":2022},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.579098Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:37f845ab7b28fd01085d7ef750007b137d40374505dbf1526fc39ae777d5e60f","observation_id":"6dc2d162-4b3d-4398-8e12-eb5de8065b3d","resolution":{"observed_at":"2026-08-15T20:31:37.143623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.126761Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"89ff821c-27b1-43cd-b84d-57d2a18e406d","year":2021},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.584922Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:00f4682ac54ddd4dae6e0d6d6c7f19ede163a211f78e27a817ec54e6fd732774","observation_id":"786414d7-3b4b-4132-9100-d08dd49d2ef4","resolution":{"observed_at":"2026-08-15T20:31:37.130656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:36.589136Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.589136Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:75c4fb77940f72f71c09419d1f152153b0d9d6b0a981fdb4c684237a2042718e","observation_id":"05e07651-8e08-4917-849b-0d9a5d371654","resolution":{"observed_at":"2026-08-15T20:31:36.589136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.101796Z","title":"Towards vqa models that can read","venue":null,"work_id":"929cc7a7-6e64-4d01-aaa5-ab4f6b208eb8","year":2019},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.594518Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:4a09da577ebffe732f44132f97d37c707b4aa4a8589b685d051eecc50267f60a","observation_id":"154a248a-4893-4a57-a533-c88f53a68975","resolution":{"observed_at":"2026-08-15T20:31:37.106263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-17T14:39:35.607934Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-15T20:31:36.598636Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.598636Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:c6552a4981d16c7a3d4dbb4710432ad7511a78153b02a0f8d072e8c7a02daf1a","observation_id":"784c6e98-c911-49f1-8058-a0620f5ce0b2","resolution":{"observed_at":"2026-08-15T20:31:36.598636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.086089Z","title":"Contextual: Evaluating context-sensitive text-rich visual reasoning in large multimodal models","venue":null,"work_id":"5d6dffcb-8358-40c7-ab7d-52791d2dee6c","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.603135Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:a246db7254657f0dea75e3262232a553fc118a791d0ab559ae56aee77376940b","observation_id":"e82d1835-91d0-4a76-96b7-a9fb8970244e","resolution":{"observed_at":"2026-08-15T20:31:37.090992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-15T20:31:36.609414Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.609414Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:aab62cbea94c446d7f43b6f1341ae2a5b28465c9a3cd07a252524f2c63065f5f","observation_id":"104371b7-565b-4a82-a4f9-d4aaa8b3a135","resolution":{"observed_at":"2026-08-15T20:31:36.609414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T20:31:36.615071Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.615071Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:a31d12075dd86bc177e9cb49d7f7366ab3bb71da142b922cd28e786c40b4b225","observation_id":"2381fb54-50f9-4f49-9dc1-d820695f5bb7","resolution":{"observed_at":"2026-08-15T20:31:36.615071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.073183Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"1c29b857-86ed-44cd-8b62-a8ba4c2a7592","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.619496Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:d589cdde6795017d90e5e3152758a179b8a245d4a185048c7cabf27f28e83017","observation_id":"66f9c24f-d165-45a6-ab4e-ab777082572e","resolution":{"observed_at":"2026-08-15T20:31:37.077729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-15T20:31:36.623999Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.623999Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:8cd54bd3a83ad71f04b6f2acf65ffb673b420b6245579483943770bd2a4fc03b","observation_id":"6141f1d2-1314-4115-9085-0329bb18c23e","resolution":{"observed_at":"2026-08-15T20:31:36.623999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12185","last_updated":"2025-04-27T11:31:23Z","snapshot_observed_at":"2026-08-16T14:17:19.436574Z","submitted_at":"2024-02-19T14:48:23Z","title":"ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12185","snapshot_observed_at":"2026-08-15T20:31:36.630121Z","title":"Chartx & chartvlm: A versatile benchmark and foundation model for complicated chart reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.630121Z"},"links":{"cited_paper":"/paper/2402.12185","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:b54dd41c8e5771922147f2bcceb9c29bcde0878c40a953c774e8467e75125d46","observation_id":"5e8e4e41-ade1-42fe-9cb1-8d47ed0b8958","resolution":{"observed_at":"2026-08-15T20:31:36.630121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15915","last_updated":"2024-06-19T03:58:32Z","snapshot_observed_at":"2026-08-18T07:28:12.497784Z","submitted_at":"2023-12-26T07:20:55Z","title":"ChartBench: A Benchmark for Complex Visual Reasoning in Charts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15915","snapshot_observed_at":"2026-08-15T20:31:36.635245Z","title":"Chartbench: A benchmark for complex visual reasoning in charts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.635245Z"},"links":{"cited_paper":"/paper/2312.15915","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:c966a0e94c6c11308f5ed5b574d3b3adcf71095997e08b2abd33450d28d50b4c","observation_id":"bc6e46c5-4558-4b8e-b9aa-5211e98293bf","resolution":{"observed_at":"2026-08-15T20:31:36.635245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00812","last_updated":"2024-01-08T16:22:42Z","snapshot_observed_at":"2026-08-17T00:44:39.938669Z","submitted_at":"2024-01-01T16:51:20Z","title":"If LLM Is the Wizard, Then Code Is the Wand: A Survey on How Code Empowers Large Language Models to Serve as Intelligent Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00812","snapshot_observed_at":"2026-08-15T20:31:36.640042Z","title":"If llm is the wizard, then code is the wand: A survey on how code empowers large language models to serve as intelligent agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.640042Z"},"links":{"cited_paper":"/paper/2401.00812","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:4f69b9eb5c997b8cddbc66f764a3c160f070990674e7f50d5862fccdcbce47a9","observation_id":"4f33518c-4841-4518-97d9-2af007e2bba8","resolution":{"observed_at":"2026-08-15T20:31:36.640042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-08-17T11:15:53.544014Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02210","snapshot_observed_at":"2026-08-15T20:31:36.645575Z","title":"Cc-ocr: A comprehensive and challenging ocr benchmark for evaluating large multimodal models in literacy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.645575Z"},"links":{"cited_paper":"/paper/2412.02210","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:feb72f4f8bab161f921674802b5b7898439abe1456780e54acf18742363ff4cc","observation_id":"1e8e66b1-1f2e-478f-b609-8a51f5b3f20c","resolution":{"observed_at":"2026-08-15T20:31:36.645575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.060689Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"80b2f8b9-a231-48bb-9ee8-268b7232f9f0","year":2023},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.650427Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:20d1ce7c0e2985bfb4b0f8e6ca86112a3fe7f5afebafe86f378fbb659cadea98","observation_id":"ac2968f2-de27-417c-af0b-3a2764584527","resolution":{"observed_at":"2026-08-15T20:31:37.065030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.047822Z","title":"Exploring the capabilities of large multimodal models on dense text","venue":null,"work_id":"3e115344-052e-46d6-904b-84347bfe402c","year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.654661Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:a4ac57c2c55d8fda61f3221259f2d99c0da4f7fc895c1f73c75745c18cf0a1e4","observation_id":"d59324d4-2907-4833-a643-93d1a6f209fa","resolution":{"observed_at":"2026-08-15T20:31:37.051841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20535","last_updated":"2024-12-12T18:45:33Z","snapshot_observed_at":"2026-08-16T13:47:32.770185Z","submitted_at":"2024-05-30T23:20:25Z","title":"Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20535","snapshot_observed_at":"2026-08-15T20:31:36.659746Z","title":"Unveiling the impact of coding data instruction fine-tuning on large language models reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.659746Z"},"links":{"cited_paper":"/paper/2405.20535","citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:4bef8f69bf3be899f4ca5a1088a0a7c16672e100fe4f62623ed6c43b2f21f432","observation_id":"c43f4e5d-04f6-473d-acc8-a7322714040c","resolution":{"observed_at":"2026-08-15T20:31:36.659746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:37.030407Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In ECCV , pages 169--186, 2025","venue":null,"work_id":"ffd591c0-8cd1-4930-86b2-cfe61b5e6860","year":2025},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.664683Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:e3f5a1536314fa779cebac343fe39e770443256ccd04e737c706243bf789de1e","observation_id":"f4c93a76-ec00-46f5-b44c-a038b50c953b","resolution":{"observed_at":"2026-08-15T20:31:37.038092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:36.673705Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:31:36.673705Z"},"links":{"citing_paper":"/paper/2505.12766"},"observation_digest":"sha256:b197a872800aa62b20adaf47414366fa0a85fd489ef0951a8eb99a3944885bc5","observation_id":"e740d921-a8e9-4ef2-bcff-3851a9807674","resolution":{"observed_at":"2026-08-15T20:31:36.673705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12766","last_updated":"2025-05-19T06:45:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T06:34:19.769452Z","submitted_at":"2025-05-19T06:45:18Z","title":"Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.12766."}