{"as_of":"2026-08-15T20:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c060944bd78c363f11306fedf652e663c549c77846a0c417df5cc9da6fc1367d","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:41:03.076855Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:14:03.671614Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T05:55:31.163509Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24120","snapshot_observed_at":"2026-08-06T19:14:03.671614Z","title":"Csvqa: A chinese multimodal benchmark for evaluating stem reasoning capabilities of vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-14T16:12:55.915203Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:03.671614Z"},"links":{"cited_paper":"/paper/2505.24120","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:dd61ab98f82817540e1b71ceb336d3711764e7c78c47dc72f674636fb267094d","observation_id":"135949bd-3881-4ccf-9c25-8f809311f889","resolution":{"observed_at":"2026-08-06T19:14:03.671614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"cited_work":{"arxiv_id":"2505.24120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24120","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Csvqa: A chinese multimodal benchmark for evaluating stem reasoning capabilities of vlms","venue":null,"work_id":"02416d8a-256a-4cfe-a0c0-fa6915a0b13b","year":2025},"citing_paper":{"arxiv_id":"2605.02378","last_updated":"2026-05-04T09:18:19Z","snapshot_observed_at":"2026-08-12T17:20:44.773767Z","submitted_at":"2026-05-04T09:18:19Z","title":"Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:21:30.235583Z"},"links":{"cited_paper":"/paper/2505.24120","citing_paper":"/paper/2605.02378"},"observation_digest":"sha256:fc6af4cb006983370b51ceab75ecc503a4053b386988fbeeb1bd67b0555d8557","observation_id":"429530aa-4830-4ffc-a5c8-fdadb6c92953","resolution":{"observed_at":"2026-05-09T05:55:31.166191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24120/citation-record","integrity":"/paper/2505.24120/integrity","json":"/paper/2505.24120/citation-record.json","paper":"/paper/2505.24120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:59.070452Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.070452Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:75841334fcea01ba30aef10d907096326685e7d1dc70cce3a36561c20c857288","observation_id":"a7584910-2c37-4e9a-b185-661879891cde","resolution":{"observed_at":"2026-08-07T12:40:59.070452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.765133Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":"21d9e59a-a90f-4933-8aa7-2f209705e162","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.118262Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:04ea68b31449269bd7e0be5baa4ee8597a08e7b362884580c982a1b43d603560","observation_id":"c7f311c7-8fad-4b1b-8402-395389ae472a","resolution":{"observed_at":"2026-08-07T12:41:09.813861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.652272Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"4b94f710-c0a7-4f63-abaf-a9c020df5c4b","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.202715Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:90253a48cd0e3e74d0b2123c39698996ccf36903c7fba9b661343ef0c0260057","observation_id":"89ecddcb-d994-480e-8a5b-2eabb2e6abc4","resolution":{"observed_at":"2026-08-07T12:41:09.703189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:40:59.273403Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.273403Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:dd6a1646f3ca1fcf9690bd34a5b19dc1d621e4d2b18656626705c95fa54de746","observation_id":"94fc0825-f2b2-4750-b2e2-1a5f9fdb828f","resolution":{"observed_at":"2026-08-07T12:40:59.273403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T12:40:59.348853Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.348853Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ee216d6ecb899e80969bec6584b9e5dff367ead0858dc9ed6a95396ba1838fb2","observation_id":"30fdd865-079d-4720-a636-45aff8245f09","resolution":{"observed_at":"2026-08-07T12:40:59.348853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.512432Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":"b4643a6f-e331-47a6-af54-3f18b4248810","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.418298Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:082c588c558271303fa9b9fda5b5230898e4d72419c18b994ee7319bf49d5c3c","observation_id":"c7d9aefb-fa90-4664-b2b6-5d030929f230","resolution":{"observed_at":"2026-08-07T12:41:09.582667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.372942Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":"13b99ca3-f51f-4a2a-8cca-7f4826117187","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.496657Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:b3db99a0581e28eeaeab32b5d2427babae7c0db9cd9e2d31770de5ac365910c5","observation_id":"161e185d-2897-4d8b-a607-9c89c2732e88","resolution":{"observed_at":"2026-08-07T12:41:09.441409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.233483Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"57c537ec-b3b3-476c-918e-739714c3f491","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.588916Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:3976df361327bf756e792820b3ca355cd89c52c681387bd02b20059d366da53b","observation_id":"324b1f69-6911-4cc9-b3fa-04e331ba0a3d","resolution":{"observed_at":"2026-08-07T12:41:09.301657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.105773Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"b239221f-f072-415f-91de-072252c7671d","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.657293Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:104f934835f7ac3637e4baf018814e711590cba54a2c4d49da1148e730bccd11","observation_id":"4b54aee7-b2fb-4eac-b9a5-a85a64adee3d","resolution":{"observed_at":"2026-08-07T12:41:09.154599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.959379Z","title":null,"venue":null,"work_id":"59290041-b083-4caa-8b5a-0ccfd613e19b","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.737185Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:993bf9e99c9907764983337f5b7c9966422aeb127d05326872a5d470c2f2d1ad","observation_id":"3b68a956-1007-41cf-af05-323095274103","resolution":{"observed_at":"2026-08-07T12:41:09.028912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.808141Z","title":"V Jawahar","venue":null,"work_id":"e9aa0384-74fb-445e-bc6f-7120a5af446a","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.885061Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:16b3782710faa85243b2ad2611e0b0eb218602c8197572875a9a61fc06ca2c76","observation_id":"691bd1e8-04a8-46f7-b709-c11d53c7ca57","resolution":{"observed_at":"2026-08-07T12:41:08.888367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.664962Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"b7b00275-b931-4f66-8f26-4913aebd3f74","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.011399Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f3a986fa387131fbdc0ef8818c2b7f20539bf265582df0856f7844ac636b551b","observation_id":"5ab11a5d-6aa8-4048-8acc-13bb2133af01","resolution":{"observed_at":"2026-08-07T12:41:08.731263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.514776Z","title":"Lxmert: Learning cross-modality encoder representations from transformers, 2019","venue":null,"work_id":"3930c5eb-ec32-4ab2-9223-f9300987598b","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.089071Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:34178e8b42c743cd98b43b6bed488671a57f6c9cc052bb6cf45ade01d882da2b","observation_id":"3c39f7e8-b013-4221-8c2f-f992ec631666","resolution":{"observed_at":"2026-08-07T12:41:08.599235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.367305Z","title":"Uniter: Universal image-text representation learning, 2020","venue":null,"work_id":"da806789-e856-43e6-b844-a56639e92370","year":2020},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.145387Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4456b11e371cb7b10dbf25f91b6d04a6cd67b5d681497102b9a93e50cf321067","observation_id":"e6834180-8224-4b54-951f-a16af1736e98","resolution":{"observed_at":"2026-08-07T12:41:08.441957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:00.211295Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.211295Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:190e02ad41e79778fdcbab66376a5bf0ec53e41fdd79157b20bf2d944223a78b","observation_id":"edf10535-f2d9-4a8d-af74-9a019feafb9a","resolution":{"observed_at":"2026-08-07T12:41:00.211295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.202285Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"1701cbb5-66c6-4a22-a91b-c0df5312d1a5","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.304151Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ecb220ce6f37760182889d99eff149f08451ba2a349aca3f2bbe40775c48dd41","observation_id":"e307d979-e9d1-4bfc-a8de-6c5589e7d12e","resolution":{"observed_at":"2026-08-07T12:41:08.262751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.963567Z","title":"Evev2: Improved baselines for encoder-free vision-language models, 2025","venue":null,"work_id":"72a92b0a-aa5a-473e-864d-7b92153276a8","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.398803Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:926b974f218a730dc2f643a2ddd58bde2b53f80ee2b915f066ded122b433d1a4","observation_id":"0165464b-00b6-4e8e-a48f-96a31ff68147","resolution":{"observed_at":"2026-08-07T12:41:08.072117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.801138Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training, 2025","venue":null,"work_id":"be85d071-3eaf-4b26-a9e9-a9b0aed2195c","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.520998Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:c7bbc3506cd4461ed141109e5df35d76a80061086cfeccc69a8946d423a1354b","observation_id":"e2ff3864-8d3d-4561-aa19-d46c5f3a310c","resolution":{"observed_at":"2026-08-07T12:41:07.866112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.664863Z","title":"Introducing Gemini 2.0: Our New AI Model for the Agentic Era","venue":null,"work_id":"26cff343-1964-40e1-81ae-4ad1913a6e7c","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.644759Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:7433bb5eecd8f6aa077f16028ecb47042e3dc1c461c58fcd7ca812844f26ccf7","observation_id":"95b64913-819f-4659-ad65-d74794211a08","resolution":{"observed_at":"2026-08-07T12:41:07.721855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.514401Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"9953ff0b-aeb0-493a-85b4-63b426b86540","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.733515Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:98ca861539fef7203616bf922220e5e4d1fc076abaeca0f6db1f5ee01e685978","observation_id":"bdf30c32-9d80-4129-8d5f-a9364fd3e3b0","resolution":{"observed_at":"2026-08-07T12:41:07.594072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.339267Z","title":"A diagram is worth a dozen images, 2016","venue":null,"work_id":"b0a6c732-866e-4980-9f5c-aee4c367cc15","year":2016},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.823620Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:aef3b321aa2566345922b8d7105e18891308de107421c12b314ac9915eebd2b8","observation_id":"ab5f2dc8-7eb7-4aff-80dd-9076505a8771","resolution":{"observed_at":"2026-08-07T12:41:07.426138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.138076Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"bc403341-a01b-4bb3-8c58-94fad7f2558d","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.934581Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f5529dc3147bfceee2e67a6639152133c0f03ca561e1dd6a0f9df57351afa060","observation_id":"d901f0a3-432b-4f3b-aebf-19d4b261882e","resolution":{"observed_at":"2026-08-07T12:41:07.206904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.984988Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":"3e454fc9-bba4-425c-a2f1-e0aa858f3979","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.029385Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4942edbdabada051ffda4d9c0fa90831c50fede3d42ccd802a0f19c8bd9b8044","observation_id":"3f998ecc-864c-4531-a960-a465f0fd37ed","resolution":{"observed_at":"2026-08-07T12:41:07.060454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.847644Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":"bef36cdc-e570-41c0-a350-2ec2d7451b33","year":2022},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.115297Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:77246435f50edab2799476f028759e351ae4e16e375d26e05034b178afa3b51d","observation_id":"08c6473d-8e3c-4986-b1da-3893616464c5","resolution":{"observed_at":"2026-08-07T12:41:06.897367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.687490Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":"cc155905-5a01-4e04-8411-4746e51d7175","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.212066Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:032870d5c54eefbb6e091200605f4a48083ed29b5b3343e429ae85d3ff4d6de8","observation_id":"bf849b6d-5d5e-4054-a099-03bda40f6d56","resolution":{"observed_at":"2026-08-07T12:41:06.764386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-13T08:24:02.836306Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:41:01.334554Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.334554Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:c84ef2b37942ab8b92e2ec863bf43fa26e1755248938afa01eefb02bb2b9204e","observation_id":"df31dd7b-4de3-468f-8f15-7c3087c86cca","resolution":{"observed_at":"2026-08-07T12:41:01.334554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.547998Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":"af767149-df20-4eae-8f80-9e23038495ca","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.400126Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:3910cdd55faa27c7d0514b7b2aa830d531c7e77cc8facf52d19f8551033adf6f","observation_id":"7df63926-5e1e-41ba-b9f6-9a9c46e755e6","resolution":{"observed_at":"2026-08-07T12:41:06.610441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.403625Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset, 2024","venue":null,"work_id":"f8522ce3-1662-4b2e-a5c3-576d378cb20d","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.467755Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ef727560b10774902f9a31646456619fdcfc856cfdd2978540078dd5cee6b188","observation_id":"68aa9c35-5de9-4e43-9aee-38970d0c5ab7","resolution":{"observed_at":"2026-08-07T12:41:06.468702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.263494Z","title":"Claude-3.7, 2025","venue":null,"work_id":"906301df-b726-428f-8354-ddde41363364","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.540750Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ca9b0bf3030061201dcc40c3eea69c634e40e9576478ebc2e2c3f78f114c1454","observation_id":"6b2e37e9-dc90-4229-b1fd-7aba4120cf33","resolution":{"observed_at":"2026-08-07T12:41:06.326033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.103356Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":"56b96389-bec8-4be8-ae56-090e88b26d59","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.641120Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:e54a41abc63096183cb64622e6a64f67ba59446412ba3abcbeab339055cd7e58","observation_id":"510321dc-36d3-4e2a-9f78-94bb6aa88056","resolution":{"observed_at":"2026-08-07T12:41:06.178864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.951119Z","title":"Mineru: An open-source solution for precise document content extraction, 2024","venue":null,"work_id":"66e5a6cb-9821-4039-90f5-a175724daf05","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.733700Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:6152c88e92877e59a5d3547c6a92ebab05e07fbc9c07e8ac70d8a1ee610aa9fe","observation_id":"170d1a4f-c702-4868-bd5f-03b805dbf84e","resolution":{"observed_at":"2026-08-07T12:41:06.014990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.789969Z","title":"Deepseek-v3 technical report","venue":null,"work_id":"f11bd128-e26d-4776-b0b5-de8f93d4e115","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.833051Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:637bb6054022c3e3d82321865310ff48680c400f6a1e27e652dcc611e116aa80","observation_id":"4c60abfe-3b64-409d-8ce5-e5c6e6f7704e","resolution":{"observed_at":"2026-08-07T12:41:05.843258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.605114Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"5c3228bb-e52b-4424-9227-e43fbadf6601","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.909165Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:0ccd8d7392c509b7fdb44a080d5a88cf627cc65f90fb25ea20c54657fa4c5cc8","observation_id":"fef5838e-27b0-4f96-a1fc-0e97b6ef2156","resolution":{"observed_at":"2026-08-07T12:41:05.706057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.352084Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":"49b50a8d-dd06-4498-bab8-ffb55a9505ae","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.994475Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:cf7425801d42e881bb4ddb91ca232c0d0f530823506166e6723bfd9e6c84f4ec","observation_id":"85c4e7d7-c828-42a9-822b-530d57871178","resolution":{"observed_at":"2026-08-07T12:41:05.449469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.168415Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":"c23c0e1b-4172-4005-981c-89f527145276","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.078331Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:25fd0985d09c9f68117ba64b35e468d91b4aeeab80d52140248a7a978ebf3105","observation_id":"b1515deb-5dbb-41e9-aa5b-4c50b36a65f6","resolution":{"observed_at":"2026-08-07T12:41:05.254171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:02.241977Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.241977Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:0293b5cbad89375abdf96eb4e2fa8cc6bc8c0755171a42b7623b2a16529de451","observation_id":"288caf5c-3887-43dc-a5c0-798a40f0870f","resolution":{"observed_at":"2026-08-07T12:41:02.241977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.002873Z","title":null,"venue":null,"work_id":"c77fd29d-771a-4799-b5d8-eff903e27be3","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.315018Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:7bd88c92baabbba32b5300c3c2414c68840b3031ace2e332bbeff03e16d8314f","observation_id":"132f83f7-0961-4137-8bbb-9dbd4ccda514","resolution":{"observed_at":"2026-08-07T12:41:05.072111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.847437Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"e56de388-5476-448b-88f6-592a8545457e","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.379786Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:8da3bb92e65cac7e0da3fdc349b17aaf8997faf26a3fa5d74105864986875784","observation_id":"e3752dbd-0ef9-45a2-9bbd-02c598537319","resolution":{"observed_at":"2026-08-07T12:41:04.921260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.645448Z","title":"Building and better understanding vision-language models: insights and future directions, 2024","venue":null,"work_id":"de1ee567-bc5c-497c-bb0a-1d03ce9839f8","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.482049Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4cdc0aab5187cebd03ddf39aaac2b2ef52b66c29249387cc8128cffe863366da","observation_id":"0533e597-c71e-438c-af5f-70a61bf93df6","resolution":{"observed_at":"2026-08-07T12:41:04.758949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.414395Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"226fbdf6-3051-43ce-a79a-981f6460b78e","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.594606Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:83dbbc5e8986d751ef9533b78d3414bb2457bf5df087e163f5d940a1b5008b9a","observation_id":"dba9b979-683c-4a3f-baa4-df085e00bf06","resolution":{"observed_at":"2026-08-07T12:41:04.535501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.179955Z","title":null,"venue":null,"work_id":"1da9eed2-69a2-4de4-904e-b5f5c489f370","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.668534Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:b9020a1a6445aca8f11ad3b563b23f043244b0a88fcd29abae71db1afa0f2ca7","observation_id":"34071225-9ce5-4881-8e4e-cdaae9a96577","resolution":{"observed_at":"2026-08-07T12:41:04.279722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.996870Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":"1e1d724d-d1d0-4ba2-8507-5b55993c918e","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.742793Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:adaa0a191f4f5147fe7f5065c5e611316193bc9fedf3bbfcdb6fb469de6e4fb0","observation_id":"f8920688-1ab2-4d0b-a3c3-4934be1addb0","resolution":{"observed_at":"2026-08-07T12:41:04.124055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.764697Z","title":"So the final answer is \\boxed","venue":null,"work_id":"0b2b0596-15ba-434b-a0df-eedb32b46142","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.858561Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f5455979478ded27a27bb3f541d300ecf13a738bb556117ea3253fed4bcc44df","observation_id":"eb4b8d66-110c-4d78-81af-ba890d089ee8","resolution":{"observed_at":"2026-08-07T12:41:03.865748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.537882Z","title":null,"venue":null,"work_id":"d4512d92-d51e-49f0-afc7-e9571e8868d7","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.974741Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f59a74c7e0616a350b98d37f2291ed0306f239391c7778f4757aad9a831c5aee","observation_id":"1724ab91-8c2a-4e98-b23e-3b69f20ed704","resolution":{"observed_at":"2026-08-07T12:41:03.646708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.271903Z","title":"No,\" please identify the main unreasonable aspects or obvious flaws in the solution; if","venue":null,"work_id":"efc4d3b6-c847-45db-af82-327071c05ea5","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:03.076855Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:85953c95a45348a2f094904c6060fb3df8df6000117ce88655188e27711f5d57","observation_id":"8fd73f73-ea3a-4c2e-8e8b-760cf06a0ba5","resolution":{"observed_at":"2026-08-07T12:41:03.400314Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2505.24120."}