{"as_of":"2026-08-10T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:130a6a8fc1c9fd0ee1a980d1cc291fc148e06ac0aa8895bfdd3c09fd48b882d6","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:13:26.851065Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:31:15.525331Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:25:52.598353Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"cited_work":{"arxiv_id":"2507.06183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06183","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"697de7fb-db93-4c0f-a1df-85f2fd21d294","year":2025},"citing_paper":{"arxiv_id":"2604.05557","last_updated":"2026-04-07T07:58:55Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T07:58:55Z","title":"EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:31:15.525331Z"},"links":{"cited_paper":"/paper/2507.06183","citing_paper":"/paper/2604.05557"},"observation_digest":"sha256:a2acc8216ce76ca3005abea4aa38a85792f243a94b23b480871877e27b4eff22","observation_id":"c81f5110-650b-476d-88aa-b2734b237dd2","resolution":{"observed_at":"2026-05-11T00:25:52.617911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06183/citation-record","integrity":"/paper/2507.06183/integrity","json":"/paper/2507.06183/citation-record.json","paper":"/paper/2507.06183"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:13:24.132881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.132881Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:264fb60bd3c85127a7567f8be8f9f9ac20ac4b1aaafc47077ef95127c0792845","observation_id":"6da5d4b8-7592-4a38-9053-b9b525308c80","resolution":{"observed_at":"2026-08-06T19:13:24.132881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:27.781518Z","title":null,"venue":null,"work_id":"99a005c4-0c57-42c3-a72a-cfd60e9bc483","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.213162Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:13391c410bb9366fa3f01a500d4310e6f96483f3b3efb9c25cbcd3bc0525085a","observation_id":"5d27ca47-af39-4d2e-8e17-8919808a8380","resolution":{"observed_at":"2026-08-06T19:13:27.873009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12596","last_updated":"2024-03-19T10:03:07Z","snapshot_observed_at":"2026-08-05T02:21:19.684454Z","submitted_at":"2024-03-19T10:03:07Z","title":"Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12596","snapshot_observed_at":"2026-08-06T19:13:24.333743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.333743Z"},"links":{"cited_paper":"/paper/2403.12596","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:24ae7dbdee9de4f39c2674baa18cbfa7f60334ae28bd64b7db7edce448c241c4","observation_id":"19b79cb6-d350-4e1a-b55f-207d2b621769","resolution":{"observed_at":"2026-08-06T19:13:24.333743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-06T14:11:19.997270Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-06T19:13:24.426698Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.426698Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3065b002f5ce0ecf9000dbae3c26689f05b5780cd1b6e9af42429d7817952f03","observation_id":"651599da-b75b-4bf5-a8a6-0d9e8928bf6b","resolution":{"observed_at":"2026-08-06T19:13:24.426698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:13:24.545409Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.545409Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:c4de48f082d37887b84fcfa9bd116b154f9fad3b5beddd118c1ef88869b26d43","observation_id":"e3cac431-4703-4012-a7d0-1aba6291043e","resolution":{"observed_at":"2026-08-06T19:13:24.545409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:24.670393Z","title":"Farhan Ishmam, Md","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.670393Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3395b09e1d5dd77a665471359492a61f3ff2aece1ed59536444976d71c58cd96","observation_id":"88c3bd8a-2ae0-4809-8960-838b84349693","resolution":{"observed_at":"2026-08-06T19:13:24.670393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11150","last_updated":"2024-11-17T18:52:06Z","snapshot_observed_at":"2026-08-09T04:53:16.291432Z","submitted_at":"2024-11-17T18:52:06Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11150","snapshot_observed_at":"2026-08-06T19:13:24.765236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.765236Z"},"links":{"cited_paper":"/paper/2411.11150","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:69724c10b8a6859cfb7098dcdea6208f29376285285df96969523b2f0afccca9","observation_id":"38dfd1a9-4b6d-44c1-b93d-2e265a96ae96","resolution":{"observed_at":"2026-08-06T19:13:24.765236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T19:13:24.886671Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.886671Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:258707f9f598f0d9f476a5022d9296ffea5044e1b8f9ce0036d4ba3ab3e6aa99","observation_id":"eed876b4-30a5-41f5-aa5c-ebc3e83ca83d","resolution":{"observed_at":"2026-08-06T19:13:24.886671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T19:13:24.964823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.964823Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:8994331d44e99ed43c13410c92b5d628aa6193368eb6bb263f4d775bb67bb63d","observation_id":"ff1b53f2-dcc8-4d63-bc0f-25b7544b3dcb","resolution":{"observed_at":"2026-08-06T19:13:24.964823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-06T19:13:25.075905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.075905Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:0785b2dcdf4691bf0bbc0252c11c6941f160952ba07a9afd451b33a69b485977","observation_id":"b4289eba-bdfa-4cda-9eb2-9d3971879692","resolution":{"observed_at":"2026-08-06T19:13:25.075905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T19:13:25.111434Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.111434Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:bc4e26925de16bbbd8f3a0ff8038eab3cb18fb197428c7693d8450c61df89ca1","observation_id":"6baaecf6-9a99-4e9e-94b2-f2c15aff8955","resolution":{"observed_at":"2026-08-06T19:13:25.111434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T19:13:25.235115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.235115Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:f7283d762d8fc7de8423f84ef59ae239e418c67f8b625193d608358970d31143","observation_id":"d31e54cf-6ef2-420c-9a96-2ed9844b3045","resolution":{"observed_at":"2026-08-06T19:13:25.235115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09413","last_updated":"2025-01-10T19:41:43Z","snapshot_observed_at":"2026-08-09T10:42:35.127499Z","submitted_at":"2024-07-12T16:37:59Z","title":"SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09413","snapshot_observed_at":"2026-08-06T19:13:25.301379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.301379Z"},"links":{"cited_paper":"/paper/2407.09413","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:831c9616b007f8b4f420f7013c749fd27d3ffc12bf2c16e519a593d0772f6532","observation_id":"176e75ca-64bb-44ce-bbe3-d5ae04c98d91","resolution":{"observed_at":"2026-08-06T19:13:25.301379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T19:13:25.320183Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.320183Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:a5f110f25f5c209dd490881f8c9ba0c6b440a3a1e197e834e4c9d98f3fe654a7","observation_id":"10d6402f-023e-44e9-8f6c-cbf7789d6985","resolution":{"observed_at":"2026-08-06T19:13:25.320183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T19:13:25.450751Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.450751Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:f0d96d8876c5bbd0b6d2b50e73465bdf08efc4449d8cd4319c17129249ed7c2a","observation_id":"a293879e-2f35-481d-8f63-f527c0635758","resolution":{"observed_at":"2026-08-06T19:13:25.450751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18860","last_updated":"2025-02-28T04:18:19Z","snapshot_observed_at":"2026-08-07T17:48:07.298744Z","submitted_at":"2025-02-26T06:05:29Z","title":"Exploring Rewriting Approaches for Different Conversational Tasks","version":2},"cited_work":{"arxiv_id":"2502.18860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18860","snapshot_observed_at":"2026-08-06T19:13:27.202442Z","title":"Exploring Rewriting Approaches for Different Conversational Tasks","venue":"cs.CL","work_id":"d8284311-d7bf-48e1-8507-7b5a0e321b0a","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.559058Z"},"links":{"cited_paper":"/paper/2502.18860","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3eece2775a1374d350882b872f30c3e5da4cf33967dd5ee4fe1bb8fb1745569a","observation_id":"de13ff66-f632-4326-be44-0280c4f4aa6b","resolution":{"observed_at":"2026-08-06T19:13:27.260471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T19:13:25.672059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.672059Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:7017ee6bca3a5583e3a5aec1b4e5202d5915bee542bba059d2eefc10e86a0b08","observation_id":"007578da-c4f2-4f92-89fe-3b8418d904da","resolution":{"observed_at":"2026-08-06T19:13:25.672059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-06T19:13:25.782023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.782023Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:667c4c39895ca8692bd00de17f23d6c48edd21c10e6e5f1df3e215948adc3673","observation_id":"7f3dd424-524f-45f1-b19c-3ed16265bb52","resolution":{"observed_at":"2026-08-06T19:13:25.782023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:27.585479Z","title":null,"venue":null,"work_id":"36f0d124-d744-47dc-8cb4-64dba47164cb","year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.915671Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3db5c03c1c3612b4ab6c8e90d863dcc1b96355bb0aa6f1cc820968ae34c21a92","observation_id":"2c086010-ccc6-4df4-bad9-24af0fb845d8","resolution":{"observed_at":"2026-08-06T19:13:27.670426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T19:13:26.028106Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.028106Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:50234debc080eee5f7c339905d645d9ef7a3ac3ccd7cd3d88dd9f925b5ef47ee","observation_id":"c2e00931-b974-435b-9879-eb8708346140","resolution":{"observed_at":"2026-08-06T19:13:26.028106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-06T19:13:26.141905Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.141905Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:ac24ece99223821b441de63a484af538dc6a092ae5040b0a4c63177a7fdbdab0","observation_id":"a23e7867-472e-4edc-8f2a-5adf0d707c99","resolution":{"observed_at":"2026-08-06T19:13:26.141905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03397","last_updated":"2025-05-29T13:20:34Z","snapshot_observed_at":"2026-08-09T04:49:57.329689Z","submitted_at":"2025-02-05T17:32:29Z","title":"SPRI: Aligning Large Language Models with Context-Situated Principles","version":2},"cited_work":{"arxiv_id":"2502.03397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03397","snapshot_observed_at":"2026-08-06T19:13:26.994234Z","title":"SPRI: Aligning Large Language Models with Context-Situated Principles","venue":"cs.CL","work_id":"ce7072ec-e194-449a-b3a1-2de6f28bd06b","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.256671Z"},"links":{"cited_paper":"/paper/2502.03397","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:a2e5051a25a8e335e5d31984b15d608aea9f0d5d1afdabcd45e6a0505e8bd56c","observation_id":"da7a07fe-dd6e-4d25-8be5-d100c8cd1546","resolution":{"observed_at":"2026-08-06T19:13:27.061026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T19:13:26.374962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.374962Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:c300379ed161ad60093001f536b65d5dc55167eb15c48967995612ab92d243af","observation_id":"9766eb6b-7fdc-418d-82cd-7f5121d6651e","resolution":{"observed_at":"2026-08-06T19:13:26.374962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T19:13:26.528077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.528077Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:cc485d81aeeb29e6dee4618899d945362928b6981808f21198b19744fdc786dd","observation_id":"f79664c0-fd49-4a2b-9e86-14d2de44c813","resolution":{"observed_at":"2026-08-06T19:13:26.528077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:26.732433Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.732433Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:efe69e739af1d3ca7b81da90815f02aec6a57d9ad708d3afd665a77ae1382af1","observation_id":"4232198f-c475-4031-a872-c21921279274","resolution":{"observed_at":"2026-08-06T19:13:26.732433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:26.851065Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.851065Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:7d1d7843a4869af6c231c1e2f4b055bd7cc60f6636d801d61826ea7f478c359c","observation_id":"a0195551-95c0-4e78-b3de-2f939d32a89e","resolution":{"observed_at":"2026-08-06T19:13:26.851065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:43:45.375394Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2507.06183."}