{"as_of":"2026-08-09T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d5923e24c9012cd1b4e8d690155680cbf8b9193a3fd793bd7e81dfbb9a1cca0","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:07:36.844173Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T09:54:33.563266Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11571","snapshot_observed_at":"2026-08-01T09:54:33.563266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27304","last_updated":"2026-07-29T17:11:52Z","snapshot_observed_at":"2026-08-05T11:12:14.452671Z","submitted_at":"2026-07-29T17:11:52Z","title":"Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T09:54:33.563266Z"},"links":{"cited_paper":"/paper/2506.11571","citing_paper":"/paper/2607.27304"},"observation_digest":"sha256:299fa646f44667271309b2924320b40f54e9f3c96552a1139fed05b53deeaa4d","observation_id":"9f88081b-4638-42e2-99c6-e46901bbed90","resolution":{"observed_at":"2026-08-01T09:54:33.563266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11571/citation-record","integrity":"/paper/2506.11571/integrity","json":"/paper/2506.11571/citation-record.json","paper":"/paper/2506.11571"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T04:07:31.587700Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.587700Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a1f93ed03901ad44ad85688c557e1a0f5e1fd4cc9d57068ee090d6f6d3d877cd","observation_id":"0abaabf4-c43e-48f3-8d8c-ed11ae2f1b6c","resolution":{"observed_at":"2026-08-07T04:07:31.587700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:31.660752Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.660752Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a91c358d4c12538dfd91f04a6ff9335bd024f291759fb00ea64e2e1445043d97","observation_id":"de2de84e-4f9d-4c43-bdca-87a18ce0ff6b","resolution":{"observed_at":"2026-08-07T04:07:31.660752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T04:07:31.703713Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.703713Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:3a433317b59847043abd7789fc8fa9330b21e03425f6ea6870c212c2d36a47c7","observation_id":"7637cb9b-dc85-4776-8ff2-9efccd7b9cd2","resolution":{"observed_at":"2026-08-07T04:07:31.703713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-07T22:17:44.862677Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-07T04:07:31.778408Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.778408Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:ca8ceda80ceb76b5b3de5e4ccfa1cf4dcca5f590725f53bc58c6d129eb8bb8e1","observation_id":"adb9539c-bbe9-4d46-bc61-7e061c22ee24","resolution":{"observed_at":"2026-08-07T04:07:31.778408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T04:07:31.820419Z","title":"M ˆ3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.820419Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:86796a9c09eea9abdd99c5fdd0be6f983dad32c7f93f2d7c663e20b62bd3a2a7","observation_id":"de2f71a6-6d3e-42c6-bc3f-951120f45647","resolution":{"observed_at":"2026-08-07T04:07:31.820419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-08-08T00:04:35.148181Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-07T04:07:31.881851Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.881851Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8973ac6a424e9f7650ade4a9b8fa3ddfcbb2aa01d09766859a0b648dcae6b7f1","observation_id":"6eee8200-8caf-4adc-98e2-211589b90ad5","resolution":{"observed_at":"2026-08-07T04:07:31.881851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-08T00:04:37.857776Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-07T04:07:31.956173Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.956173Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a05a13bad8976b35f61c361f1fbddcd94c62047065ad3c63cbe4787db4f8df6a","observation_id":"bbef4c86-23a9-4ba7-b7a3-cc1c5e026a43","resolution":{"observed_at":"2026-08-07T04:07:31.956173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-08-08T08:08:54.459593Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:07:32.061606Z","title":"Video- of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.061606Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c9cd864c14b0a38cf5b0e0a5ce75acce00351c9104cf48d37479dfba52f25bfd","observation_id":"90ecb6a8-ce9f-4510-9908-270fc34ff20f","resolution":{"observed_at":"2026-08-07T04:07:32.061606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T04:07:32.177092Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.177092Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:282aa732fa124c1dd4410322863580b9c09c3dc79fb9d8bd7deae89a6e0677c9","observation_id":"3a649fa7-a297-4640-82a1-1d40ae8fa644","resolution":{"observed_at":"2026-08-07T04:07:32.177092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:32.289278Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.289278Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c0e3719fb5aa25ee7d725d8a97964e969c2b584152604651da1f890be4ea5b59","observation_id":"a7ef88ad-7914-4c91-a6e4-0f7584eb693b","resolution":{"observed_at":"2026-08-07T04:07:32.289278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T04:07:32.364515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.364515Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9462de09707813476b8b4bdc8b374cf7b0624ac93d553794ffbe2e49d0b7e64b","observation_id":"aa453ad4-0ad9-4b46-8019-78d046e0a629","resolution":{"observed_at":"2026-08-07T04:07:32.364515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:07:32.480638Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.480638Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c363d3ddb662a607e2eba4accdd76da0b1bcf34cb8cb1dd1a698214c9dab16d9","observation_id":"d0a20dea-c999-4157-9586-0d4a6ec543f5","resolution":{"observed_at":"2026-08-07T04:07:32.480638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T04:07:32.555893Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.555893Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:078ca9bcc57c9faebfe022344c66e1e3ad7679d42e6c2b3a98f236a9413fb8fa","observation_id":"73d92c24-9872-40ad-a9a1-082c9a2b7a66","resolution":{"observed_at":"2026-08-07T04:07:32.555893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02301","last_updated":"2023-11-24T07:07:03Z","snapshot_observed_at":"2026-08-03T03:23:08.919296Z","submitted_at":"2023-09-05T15:06:37Z","title":"CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02301","snapshot_observed_at":"2026-08-07T04:07:32.651474Z","title":"Ciem: Contrastive instruction evaluation method for better instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.651474Z"},"links":{"cited_paper":"/paper/2309.02301","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:4147286a9fa508305d3e3cbda350d500bdbb3f0bb18c028581dbe741fca56787","observation_id":"0ff9ea26-f393-4506-9922-25216861501e","resolution":{"observed_at":"2026-08-07T04:07:32.651474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:07:32.738113Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.738113Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:977d2c0796a9a4d02bdb5a11c3bafbe37c307f92495457cb3a9ddbf5fb3880c3","observation_id":"57369070-914b-467a-9d5e-4de52cf965ce","resolution":{"observed_at":"2026-08-07T04:07:32.738113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:07:32.813269Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.813269Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:7a7c2ba32601a6a0c0e2d3243234d5161400be4414fd8da9e959d276f79d0cf7","observation_id":"80a94db2-df0c-498d-a628-6311cf99e159","resolution":{"observed_at":"2026-08-07T04:07:32.813269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:07:32.918115Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.918115Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:fcacba61df548be27b4954b326208179d2b649bfeb1d84cdcd38503e5fbbc96a","observation_id":"35009f1b-316b-4e07-a07c-a50ae55b903a","resolution":{"observed_at":"2026-08-07T04:07:32.918115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T04:07:33.024804Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.024804Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:f35d7e5414d5290ba5982b2422a6e0fb3c50a02e74200fd3d55e53ba9890fe25","observation_id":"9876737f-06d9-4d91-8603-06bd20891a76","resolution":{"observed_at":"2026-08-07T04:07:33.024804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T04:07:33.115300Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.115300Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8c1d54f0b8b2711114e4ab9a46388c08fe7a78387a2a38ee3812450f2a98038b","observation_id":"9a2ee76d-092a-4c18-a14f-371f0b13bfe2","resolution":{"observed_at":"2026-08-07T04:07:33.115300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:42.210715Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ad5e7418-e57b-44ce-acb8-a3b5fdea9712","year":2022},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.208153Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:41eb96b60e70572896522c04d1520b26b64df844ffd81a8aca128a069c4f2fcf","observation_id":"b759e0a0-aa7d-4e6b-bd61-b01086fb387b","resolution":{"observed_at":"2026-08-07T04:07:42.342580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03321","last_updated":"2024-10-04T11:18:41Z","snapshot_observed_at":"2026-08-08T00:04:38.954111Z","submitted_at":"2024-10-04T11:18:41Z","title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03321","snapshot_observed_at":"2026-08-07T04:07:33.318843Z","title":"Visual-o1: Understanding ambiguous instructions via multi-modal multi-turn chain-of-thoughts reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.318843Z"},"links":{"cited_paper":"/paper/2410.03321","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:96e89d23bf44e4c55a4f0879b3224dd6a4ad3cf721dcda71aa2a48ff69b760f1","observation_id":"70c288f9-a8eb-4fdc-b88e-b5b704dabdd5","resolution":{"observed_at":"2026-08-07T04:07:33.318843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T04:07:33.434821Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.434821Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:1f53d6753a75816fdaff78605124407bab3ce311e9f2aacc045af91a614b8657","observation_id":"a3e949cd-5a64-4d0f-8c61-d0672c991c69","resolution":{"observed_at":"2026-08-07T04:07:33.434821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T04:07:33.560796Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.560796Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8a0653c295236901b2577df06e97f8df14504b73d36542458b31296c72a488e2","observation_id":"5f578a40-6dee-4156-92a5-2592e763fa5b","resolution":{"observed_at":"2026-08-07T04:07:33.560796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:07:33.622232Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.622232Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:48977846ce6a8598d60f3f153076c5166598c11ed7e4cdbe61ee9f1679bc0eee","observation_id":"c6091be3-7e48-42a5-8e95-8f6c51e6a581","resolution":{"observed_at":"2026-08-07T04:07:33.622232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T04:07:33.722511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.722511Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:6019a14324ce353f47d7dac61d4a1bb39e9dd98d4b1c958c310bc467ea2d4e40","observation_id":"9024d70c-e031-4c04-90c2-80499c3da584","resolution":{"observed_at":"2026-08-07T04:07:33.722511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-09T04:46:07.618992Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T04:07:33.839250Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.839250Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:cfda7f9ea64190a174590147ae287a1900333a437e80b9d544f4ba7ccb07b504","observation_id":"0c4133bd-d41a-42d7-8080-f873a69e81af","resolution":{"observed_at":"2026-08-07T04:07:33.839250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.895799Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"5115828d-a831-4b7b-99e1-f4af6a9cefae","year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.917505Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:99f7bf91beba726b1596c569d485513e391b818920f2ee9de9d0dc50cb11d7be","observation_id":"d38dc04e-cd60-4b4d-9a3f-f55c27fbb8e2","resolution":{"observed_at":"2026-08-07T04:07:42.037028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T04:07:34.024686Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.024686Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:5864245b986a1c28f0b0e01c7e72a749037b6653eb596ff0764a07ccf5dc478e","observation_id":"2edb0dae-c5a2-4436-b1b9-2868fed6b484","resolution":{"observed_at":"2026-08-07T04:07:34.024686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:34.166022Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.166022Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:fa691eb967ad4ddc83eef67cb9c2c22787c942501c9e2ae8e299e5e5d6275424","observation_id":"0793f6ff-3665-447c-b54b-3f85c43aa745","resolution":{"observed_at":"2026-08-07T04:07:34.166022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:07:34.276313Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.276313Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:72746f45d876c78e6287a95728e97b7ffaf1915d92a824cd60f8173606a5f984","observation_id":"2642020f-54ce-45c5-b412-27e43624b0ba","resolution":{"observed_at":"2026-08-07T04:07:34.276313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-08T08:03:26.182607Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T04:07:34.362773Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.362773Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:5290de03ec2419ed8340cda05193c276253700308e48765ed848a35b7be4ba66","observation_id":"1165e788-0faf-4ce7-b2d3-b886ed25850a","resolution":{"observed_at":"2026-08-07T04:07:34.362773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T04:07:34.464471Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.464471Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:93157c4eab721ef9c643848369c230d7d9374c19084e7343311d20b7814ad161","observation_id":"b10a50c3-9317-44c1-8011-5dd93ad91905","resolution":{"observed_at":"2026-08-07T04:07:34.464471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T04:07:34.579200Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.579200Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:1ad18a9a1f07cabe5923e3534c3cb40c3381460778060483e2b6102a81069c68","observation_id":"64848bed-8331-43f6-a7f8-50025735980f","resolution":{"observed_at":"2026-08-07T04:07:34.579200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T04:07:34.668498Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.668498Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:278d925be3cec42cbdd1f6c1f25c59538d881f52cfbea8d00971125626176fb3","observation_id":"f848019f-2edc-47ec-a455-f1c34aded2ed","resolution":{"observed_at":"2026-08-07T04:07:34.668498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T04:07:34.753888Z","title":"Tree of thoughts: Deliberate problem solving with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.753888Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:74732203cfa31d74c2698aee8cd2e72b539807d66884bb70d8cb11fd7541c756","observation_id":"ab18994c-87b4-42b1-a5fe-574d3fcc4437","resolution":{"observed_at":"2026-08-07T04:07:34.753888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:07:34.797292Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.797292Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:0e42419f2c6c2b159c62f4a21192646f301b641442833b2c78b558a1caa85d9f","observation_id":"907799d7-17df-4531-9005-ab4ee4715382","resolution":{"observed_at":"2026-08-07T04:07:34.797292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:07:34.864725Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.864725Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:00cea1f1ee858820a5cb597ac9332edc49bd3b0038b267767e4c0e540f9fbed4","observation_id":"3cbee560-f79c-4c3e-850a-a752a3295f19","resolution":{"observed_at":"2026-08-07T04:07:34.864725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.718993Z","title":null,"venue":null,"work_id":"0c776764-e2d0-4d97-90bc-258efde89c09","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.953774Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:b88c612b7a0b80a3be038bcd7c7f6cbd9247d398ca092fa3f1ffd0913b30ddde","observation_id":"20999872-3733-4c93-b6a4-1859a808f77e","resolution":{"observed_at":"2026-08-07T04:07:41.794677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.612525Z","title":null,"venue":null,"work_id":"6824b123-4653-41bc-aa7e-70bad4fb6cff","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.041699Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:53cceffd9f34a3df7400732a71d2e3df2b0a3464498a9ca056f0c03e36bf4ae8","observation_id":"5f681d69-358f-4b4a-bfa6-f689294ea924","resolution":{"observed_at":"2026-08-07T04:07:41.652440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.430787Z","title":null,"venue":null,"work_id":"6f0883f5-e602-44ff-a68c-18a970ea30d5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.156688Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:e9b40c05d69d60eacc98e9af32df725c0d67dd84b21c38162ee51c6c35843198","observation_id":"98dcbe5b-8481-4df7-a5c6-8d29ffa9a212","resolution":{"observed_at":"2026-08-07T04:07:41.516516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.252722Z","title":null,"venue":null,"work_id":"406f973a-3e13-4415-9a88-bd9017c7b554","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.228622Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:32868c18f8a257ba9b0938b0c0db554a4f89d39100b42667ab162a3dfb7fe179","observation_id":"f842e7a6-5627-4b8f-b46b-b6a0001c49c9","resolution":{"observed_at":"2026-08-07T04:07:41.348976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.029245Z","title":null,"venue":null,"work_id":"fe8ff26e-482b-48d6-8b92-97bd577bad10","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.271391Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:01c9955b2ad434b82257318f2fdac5bdac694a6875a47d9df06e4a06961ba8df","observation_id":"31826df4-9b47-4a54-976c-26c18e42758d","resolution":{"observed_at":"2026-08-07T04:07:41.133657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.790676Z","title":"The screen visible in the image is small and not a touch screen","venue":null,"work_id":"46f60906-771e-4259-80a0-1b7b851d4a05","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.356982Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:acde5909b62f5dce26e03c242ae0083e1cce6db5e38e90444769ae47fc71d574","observation_id":"aeb8bcfc-5433-4087-b4dc-e468a5675797","resolution":{"observed_at":"2026-08-07T04:07:40.932629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.541714Z","title":"This option is speculative and cannot be confirmed from the image alone","venue":null,"work_id":"733785b8-3ce9-4783-8319-0cbdcaed0d6d","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.443459Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8bb0c148cc19b58769e2dda586aafe3291c56cdaf398d7f0740c7c3b2f054315","observation_id":"3176c547-2f17-4fcb-bf8b-c8dfe69166b4","resolution":{"observed_at":"2026-08-07T04:07:40.667712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.266255Z","title":"This option is likely correct","venue":null,"work_id":"11d0130a-e97d-4fca-b944-42ab12dfed75","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.521699Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:4c980a0f25c8d9f1b45e5b88787e2ff80f17ef1d5a1b7951d31a794ae5f3095d","observation_id":"85f92ca6-d4c5-419e-9a24-4d2b0a23fd56","resolution":{"observed_at":"2026-08-07T04:07:40.401958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.048226Z","title":"The image does not show any indication of this technology","venue":null,"work_id":"14a83b98-b396-451d-bc10-c5d5fac85ca8","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.582676Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:ce25c075e6a69352a5dbebe4cb9cbe806d9e9d21b27c1a1815da3d9c6e64bcea","observation_id":"223a4946-abc7-4129-9639-9c05df960629","resolution":{"observed_at":"2026-08-07T04:07:40.194944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.856500Z","title":"<vcues_2>The screen visible in the image is small and not a touch screen</vcues_2>","venue":null,"work_id":"3c41129b-28c7-4295-bc40-1a1c4fcce147","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.669343Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:3f9c57a5849bf0b1b6dbe895fa10caa3a688bcdf138018d8f71a7992406fa515","observation_id":"9ef69d52-90a2-4fa2-aef9-a1de3c5d9348","resolution":{"observed_at":"2026-08-07T04:07:39.964892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.692821Z","title":"</vcues_3>","venue":null,"work_id":"d57e7715-b730-4883-87e4-d6ee5a4d94d3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.723483Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:553333a894406b6e7a4b9fdbca7101b8f44b44c575b003e05620d7265f6d6184","observation_id":"ca1fb7ff-5e97-4513-9931-84e7dfb958d2","resolution":{"observed_at":"2026-08-07T04:07:39.782624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.483079Z","title":"This option is likely correct","venue":null,"work_id":"d6bf1933-ed0d-4715-9d17-0509389e36d6","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.756741Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:aa8da0c5162b98cc43d33ee6206dd6c9f5eab1161c09932c3e9d413dcc2cab7e","observation_id":"03bc4ae7-ed92-4abf-b66d-ce84abb40fbf","resolution":{"observed_at":"2026-08-07T04:07:39.570953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.334910Z","title":"<vcues_5>The image does not show any indication of this technology</vcues_5>","venue":null,"work_id":"c97de924-3f6c-47ac-a2f6-b5e15ef8cd9d","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.811204Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:66bebe3838b6247c611ec03c9d94068a4d783b0f69ea9f0c5b910be4a1865564","observation_id":"93890703-e101-4190-9a39-d083b9789e5e","resolution":{"observed_at":"2026-08-07T04:07:39.399955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.211011Z","title":"<vcues_2>The screen visible in the image is very small and not a touch screen</vcues_2>","venue":null,"work_id":"f3a6cfbc-367d-4129-a87f-d3150b7e2663","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.883434Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:7af24694e4b91544b9eabb10b24550f7fdf7533a9db5215b448a0f89c44b40cb","observation_id":"86ef2ce4-a475-454c-a7bc-9a658381ebf6","resolution":{"observed_at":"2026-08-07T04:07:39.293227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.034946Z","title":"Therefore, this option is incorrect","venue":null,"work_id":"365cd7ce-146b-46dc-9487-0027fb748af5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.976409Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a97e79e89f60e6e175a3591464409b31ed5b2f4ddab27bb9b987e75da130bd32","observation_id":"a5ad5350-509d-4b95-a5f8-da23aa4ca87d","resolution":{"observed_at":"2026-08-07T04:07:39.113386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.921478Z","title":"This option is correct","venue":null,"work_id":"ff9f7d91-490e-4c65-8879-9109541d1d8f","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.012004Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9a9a8c665b3d788ed2d2c4d0b36086bd82200761db3ec462d2c72e1df588515a","observation_id":"47154189-fc59-433a-811a-67dce248275b","resolution":{"observed_at":"2026-08-07T04:07:38.971452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.726498Z","title":"new_option","venue":null,"work_id":"ea8d07b6-0dd6-42ef-8b6a-1d99831d8a3e","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.086645Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a360060a814ad86092a1346f9594ff75e106026f358d4d308374b2be23145836","observation_id":"c073b7ea-f187-44a0-936e-fbcc93b2c171","resolution":{"observed_at":"2026-08-07T04:07:38.796243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.605671Z","title":null,"venue":null,"work_id":"a6f8f3a2-554b-4f2c-8a15-01eeb6acced6","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.188559Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:1466c86c385eae3abaff368dc396447d587ce117e374d2ca57607ad621a5bbd6","observation_id":"c9f65da7-5d69-429c-b231-0e8f3e28b1f1","resolution":{"observed_at":"2026-08-07T04:07:38.666183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.496005Z","title":"The presence of dirt could be from the environment it has traveled through, such as dust, debris, or even road salt in some areas","venue":null,"work_id":"fe1c55ce-f949-400c-8a8b-885b4aa73ad3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.276358Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:7a7153386efb29d9f75c6d76cf44fd81624f7c78b3261f0fce4ba5590cef5cb7","observation_id":"b7d41924-d39f-4128-ac98-7de16039e3d0","resolution":{"observed_at":"2026-08-07T04:07:38.554796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.327996Z","title":null,"venue":null,"work_id":"2c47a5b8-6bd0-4be4-bcfb-91f035d051a9","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.364831Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:5dbe0972a977a47eb0807e678765534537ecf78309ba6bf6546db46f365d596b","observation_id":"b4f9552f-97e2-435e-adae-3957608376dd","resolution":{"observed_at":"2026-08-07T04:07:38.421824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.077527Z","title":"The train was caught in a rainstorm: While rain can cause dirt to accumulate, the image does not show signs of recent rain, such as wet surfaces or water streaks","venue":null,"work_id":"322746d1-7874-431e-bcb5-183701e6f0c3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.449471Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:0515b6b9c774c66819a379a4e71e3b86bcf90a87f7de5957734285ad68876d36","observation_id":"72575578-c4d6-4e54-93ac-36c4e9d7c5c3","resolution":{"observed_at":"2026-08-07T04:07:38.195822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.827434Z","title":null,"venue":null,"work_id":"7682a491-9e11-4198-b56b-af999c17f58b","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.536880Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:4c9273d77fa968b4ae2d2569ff73d5bb1607a69e2f3618ff7af5a099d6958847","observation_id":"655077ef-3a7b-479a-b7ff-2410614e6255","resolution":{"observed_at":"2026-08-07T04:07:37.953934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.565642Z","title":null,"venue":null,"work_id":"04cbbc95-8574-4c28-b308-42bd0291544f","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.603461Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:df6971de673cb8778e26becc7338840737a119563b3f85f8b2b4edc8d1207ff8","observation_id":"f339e64e-a48b-4402-ab33-5d9271709600","resolution":{"observed_at":"2026-08-07T04:07:37.681408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.456603Z","title":null,"venue":null,"work_id":"17d99966-b923-45bb-8f0f-d43073a1e1d4","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.704682Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:21b26c37f55d390f72402ae0196de68928aec8a5c2dd5fc8947a74a8ed7b074a","observation_id":"d9a69d1d-bb67-4fcd-9848-5b7df5cd8ab2","resolution":{"observed_at":"2026-08-07T04:07:37.501653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.360351Z","title":null,"venue":null,"work_id":"3ef94acb-ac0f-4729-bbf8-032733e21167","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.792454Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:44a6ebf01b8c657d3a977fe0a08c976146f6e8d8244b86f8b1089e43c7076a8e","observation_id":"885b32cd-a831-483a-838a-0b01f99498e6","resolution":{"observed_at":"2026-08-07T04:07:37.393645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.291326Z","title":"Given these observations, the most reasonable inference is that the setting is a small residential room, likely a bedroom in an apartment or a small house","venue":null,"work_id":"9382c88d-abbf-4c58-ac37-b615e383e6d5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.844173Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:343c101e6776830c74bb7a392a5757648d2eddccd9486388eee19423077e28ad","observation_id":"958fcb89-84a5-4a7d-8d98-5019d2c34456","resolution":{"observed_at":"2026-08-07T04:07:37.321432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2506.11571."}