{"as_of":"2026-08-19T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:276e108e21459714db32dee84364e62206fb60311de403c1d99004e332f566b9","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:15:15.817164Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27069/citation-record","integrity":"/paper/2607.27069/integrity","json":"/paper/2607.27069/citation-record.json","paper":"/paper/2607.27069"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:15.817164Z","title":"Answer the user’s question with exactly yes or no,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.817164Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:899f0db0b2522d39a913b7d8671888044717a1480e0540f6d095413320d15929","observation_id":"8e0bfdb3-974d-4d23-8dd3-16b606184075","resolution":{"observed_at":"2026-08-01T10:15:15.817164Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01195","last_updated":"2026-06-25T08:08:57Z","snapshot_observed_at":"2026-08-18T03:11:21.013808Z","submitted_at":"2026-03-01T17:26:02Z","title":"VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01195","snapshot_observed_at":"2026-08-01T10:15:13.651651Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.651651Z"},"links":{"cited_paper":"/paper/2603.01195","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:6a67f2b61e5dad2d67d20d5354767f57145f4f89ee7f53f0d6a74734ad01d21c","observation_id":"1168729e-5579-40e5-b34d-a050c68b2c76","resolution":{"observed_at":"2026-08-01T10:15:13.651651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:13.884949Z","title":"InProceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2901–2910","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.884949Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:1c539c09914f44725c68e6b262ff050176f9127310f006b371c335c44e9944f7","observation_id":"3b248b6f-ecdf-477f-89a8-990184a7a99e","resolution":{"observed_at":"2026-08-01T10:15:13.884949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-16T08:21:59.637725Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30220","snapshot_observed_at":"2026-08-01T10:15:13.957224Z","title":"Lan, Z.; Sun, L.; Walter, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.957224Z"},"links":{"cited_paper":"/paper/2606.30220","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:519d120da777c8ac57bdffe46fc772f5ca31776b4cf8b87130d98043682149f5","observation_id":"08613a70-6534-43ac-805b-5d14fc85d25f","resolution":{"observed_at":"2026-08-01T10:15:13.957224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22903","snapshot_observed_at":"2026-08-01T10:15:14.125422Z","title":"Leng, S.; Zhang, H.; Chen, G.; Li, X.; Lu, S.; Miao, C.; and Bing, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.125422Z"},"links":{"cited_paper":"/paper/2605.22903","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:c17285ea2a5bdebf1260f483a068910f986eea2002fcbe8726e80bf29db27e7c","observation_id":"7f2c230e-7d58-4dee-82b8-89759e04746b","resolution":{"observed_at":"2026-08-01T10:15:14.125422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-01T10:15:14.442236Z","title":"Ma, C.; Lu, K.; Cheng, T.-Y.; Trigoni, N.; and Markham, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.442236Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:6de529fdd4aef7518f299689dd2e5722061923b90a83043c0a29ee10637f395d","observation_id":"eea224a7-5399-4fc2-b1aa-ddb2fa4920a9","resolution":{"observed_at":"2026-08-01T10:15:14.442236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13438","last_updated":"2024-10-30T00:47:52Z","snapshot_observed_at":"2026-08-16T14:08:41.960623Z","submitted_at":"2024-03-18T17:38:29Z","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13438","snapshot_observed_at":"2026-08-01T10:15:14.614006Z","title":"Mistral AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.614006Z"},"links":{"cited_paper":"/paper/2403.13438","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:6aa4b3dc745b9d23c08134b512f216d792c2b9fd03c48a02fdb0305b59c6a989","observation_id":"98600053-1438-4679-9a6c-dc231412800f","resolution":{"observed_at":"2026-08-01T10:15:14.614006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-01T10:15:14.765305Z","title":"Naeini, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.765305Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:4eaad9f137febf686852924264b255b61c57b37b4904f3af580fb6955c2bcfdf","observation_id":"cebd976f-5f52-466e-9950-90c4b60ec826","resolution":{"observed_at":"2026-08-01T10:15:14.765305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13246","last_updated":"2024-10-10T22:22:52Z","snapshot_observed_at":"2026-08-16T13:41:35.302169Z","submitted_at":"2024-06-19T06:15:26Z","title":"GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13246","snapshot_observed_at":"2026-08-01T10:15:14.867090Z","title":"Reich,D.;Putze,F.;andSchultz,T.2023.MeasuringFaithful and Plausible Visual Grounding in VQA","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.867090Z"},"links":{"cited_paper":"/paper/2406.13246","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:84d36095060c8714dec601f82dab5b693c9f1925ee6223969000cb0746f0be76","observation_id":"d3f68a67-cd91-4ec1-9a5d-9f541d4ee56c","resolution":{"observed_at":"2026-08-01T10:15:14.867090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10400","last_updated":"2026-06-09T04:18:38Z","snapshot_observed_at":"2026-08-06T05:17:07.543850Z","submitted_at":"2026-06-09T04:18:38Z","title":"Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10400","snapshot_observed_at":"2026-08-01T10:15:15.155395Z","title":"Sun, Z.; Shen, S.; Cao, S.; Liu, H.; Li, C.; Shen, Y.; Gan, C.; Gui, L.-Y.; Wang, Y.-X.; Yang, Y.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.155395Z"},"links":{"cited_paper":"/paper/2606.10400","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:a635dee453a2c4dcbaa16361dbd6999e581ee68a5c24350883af5350e8b32a8a","observation_id":"193d6c46-f062-4760-a173-b2c248592447","resolution":{"observed_at":"2026-08-01T10:15:15.155395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-01T10:15:15.290623Z","title":"arXiv preprint arXiv:2309.14525","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.290623Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:110e9419b791c57bc563713c563ad3559b79131f32cff4cbdc6004c3d57bbbb5","observation_id":"0aa24aef-0ac6-4617-a9cc-c80b05177381","resolution":{"observed_at":"2026-08-01T10:15:15.290623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:15.617807Z","title":"In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 10006–10030","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.617807Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:f5c8ad90835ae0849519977aa67ed748f39a1ff35206489cff1c8ddae6b99162","observation_id":"e1bb9bd4-c957-4048-83b3-0806ae941311","resolution":{"observed_at":"2026-08-01T10:15:15.617807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:15.755818Z","title":"Zhang, L.; Zhai, X.; Zhao, Z.; Zong, Y.; Wen, X.; and Zhao, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.755818Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:f511b2c4a6d259ab1f7b903c524d1205522380720211e3fb16488d45fcafed42","observation_id":"f188f55f-56df-40ad-9229-32b1756dc62c","resolution":{"observed_at":"2026-08-01T10:15:15.755818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12966","last_updated":"2025-04-17T08:05:10Z","snapshot_observed_at":"2026-08-16T13:59:25.255308Z","submitted_at":"2024-04-19T15:53:27Z","title":"Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12966","snapshot_observed_at":"2026-08-01T10:15:14.321927Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":305,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.321927Z"},"links":{"cited_paper":"/paper/2404.12966","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:69af699377c73a85413a7b40d0f3d5d16ea44b642452091b7867f49d80837081","observation_id":"c2086dd0-2351-4715-afb8-78ceb86bcb96","resolution":{"observed_at":"2026-08-01T10:15:14.321927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:13.773475Z","title":"In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 6904–6913","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.773475Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:8880e364d45d9b67466fa537abd8602b6d2e8da54d5bb1db5892545302b0bf38","observation_id":"22d0b39a-7582-4bea-97f2-ddfd707ce5f3","resolution":{"observed_at":"2026-08-01T10:15:13.773475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:15:14.996997Z","title":"InProceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 4035–4045","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.996997Z"},"links":{"citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:ebd79ecd11d7ac99c372636e494d97c1bda160c71d8771b0ea86ed42acda4dc4","observation_id":"72c2bec2-a363-4cf9-a891-f2409f179eb4","resolution":{"observed_at":"2026-08-01T10:15:14.996997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T10:15:15.472902Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 5238–5248","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:15.472902Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:cf4495d1185d54881266b1e795651186e18c681a1b630ae31779b48b644725a4","observation_id":"bb3fffac-79a5-45e3-b67a-4b6078f3cd32","resolution":{"observed_at":"2026-08-01T10:15:15.472902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T10:15:13.210865Z","title":"Bai, S.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.210865Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:7c52944abd1c77882214faedec2b96265855d576526583100db67236e38a02a3","observation_id":"218e5e27-d651-4439-8ef7-02f67f59a569","resolution":{"observed_at":"2026-08-01T10:15:13.210865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-01T10:15:14.197516Z","title":"Li, B.; Zhang, Y.; Guo, D.; Zhang, R.; Li, F.; Zhang, H.; Zhang, K.; Zhang, P.; Li, Y.; Liu, Z.; and Li, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.197516Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:09f0488d0a731e383d896ead6a10d1087faf026f67ed0b8b16ac18092f716a92","observation_id":"40f0d550-8e54-46f6-b874-2eac523f2d90","resolution":{"observed_at":"2026-08-01T10:15:14.197516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T10:15:13.302565Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.302565Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:b41286944d68d8597c01cbf2aaa063779c48576988738e37095cbf26ad54dbe1","observation_id":"a4adac75-17eb-4a8e-b376-7290f0f57112","resolution":{"observed_at":"2026-08-01T10:15:13.302565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09068","last_updated":"2026-07-10T03:27:25Z","snapshot_observed_at":"2026-08-16T21:18:02.516888Z","submitted_at":"2026-07-10T03:27:25Z","title":"OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09068","snapshot_observed_at":"2026-08-01T10:15:13.431093Z","title":"arXiv preprint arXiv:2607.09068","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.431093Z"},"links":{"cited_paper":"/paper/2607.09068","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:cfa50d4d43f0277702911d23c9430a6716fca1af7bcab5c12d25363c9433296c","observation_id":"648f2f6d-4656-425a-8dcc-5e55166b7ba3","resolution":{"observed_at":"2026-08-01T10:15:13.431093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T08:12:25.993259Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.27069."}