{"as_of":"2026-08-09T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44d36cff7930307bbc46e2c651b0014946e906cfe05235b933dcd66edba1bb17","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:26:40.248532Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T18:44:39.545911Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T20:22:37.758436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"cited_work":{"arxiv_id":"2603.25629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.25629","snapshot_observed_at":"2026-07-28T02:22:29.380900Z","title":"Viveiros, Nuno Gonçalves, Matthias Lindemann, and André Martins","venue":null,"work_id":"b0fdcc0f-485d-4270-b392-4b3cada121c9","year":2026},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2603.25629","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:ef027da9eb814e35abbf8b1f3747b94ceaeff8abae21227bb7e8991c28f82fe8","observation_id":"a70af675-1270-4a9e-ace8-9c0e89ccf863","resolution":{"observed_at":"2026-07-28T02:22:29.380900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"cited_work":{"arxiv_id":"2603.25629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.25629","snapshot_observed_at":"2026-07-28T02:22:29.380900Z","title":"Viveiros, Nuno Gonçalves, Matthias Lindemann, and André Martins","venue":null,"work_id":"b0fdcc0f-485d-4270-b392-4b3cada121c9","year":2026},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2603.25629","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:0e8893661ef9264e970dd19faaf6b824cdf5772103188f50f43ac75af50c8c61","observation_id":"f8b9bd99-aa85-4f0e-add6-fd726dfdc066","resolution":{"observed_at":"2026-07-28T02:22:29.380900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.25629/citation-record","integrity":"/paper/2603.25629/integrity","json":"/paper/2603.25629/citation-record.json","paper":"/paper/2603.25629"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-02T17:26:40.207854Z","title":"Zixu Cheng, Jian Hu, Ziquan Liu, Chenyang Si, Wei Li, and Shaogang Gong","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.207854Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:043dff7cb7a298b1da011f4f320ba586c8cc72ead3604e240f71fa803f5bfeda","observation_id":"7dfb11d0-2d14-4cd9-9f00-8f05c7dfaa48","resolution":{"observed_at":"2026-08-02T17:26:40.207854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11495","last_updated":"2025-03-14T15:21:44Z","snapshot_observed_at":"2026-08-07T17:03:39.921455Z","submitted_at":"2025-03-14T15:21:44Z","title":"V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11495","snapshot_observed_at":"2026-08-02T17:26:40.211189Z","title":"Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, and Haoqi Fan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.211189Z"},"links":{"cited_paper":"/paper/2503.11495","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:57f88e56d2f81daf4b9534dfba4bb83353dc0f40610a223d9affa22cb519fbbf","observation_id":"39ea0772-cfc9-4060-adbe-f6b28a0d1bf0","resolution":{"observed_at":"2026-08-02T17:26:40.211189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-02T17:26:40.214524Z","title":"Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.214524Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:ab4a5ff3c8ce7c01cd1e99cf4bc887d211fea62e6618f4f7fd752d2f733e2508","observation_id":"34760635-e39c-4819-bdab-7211fd9dd975","resolution":{"observed_at":"2026-08-02T17:26:40.214524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-08-02T17:26:40.218017Z","title":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.218017Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:ad1da38586efc724714279e18bde4097613aaba93b25f8be9e491ac089ce1417","observation_id":"20a982e6-b6f7-48bf-8490-633de6942003","resolution":{"observed_at":"2026-08-02T17:26:40.218017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-02T17:26:40.224520Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.224520Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:53a5c1e19d46c926627a9c0ab20c0ffcb45c93ed74beedd084d24f1c6c73ce65","observation_id":"c7f4292c-f835-46d4-b316-10d68ac0fde5","resolution":{"observed_at":"2026-08-02T17:26:40.224520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:26:40.227360Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.227360Z"},"links":{"citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:7b0741f5a0cc213fe065c8d0e0d6b659eec379c018c3458e9b1c82c8a72054da","observation_id":"ee3c044d-1219-42ba-8dc7-352223b70764","resolution":{"observed_at":"2026-08-02T17:26:40.227360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:26:40.233139Z","title":"Leandro von Werra, Younes Belkada, Victor Sanh, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.233139Z"},"links":{"citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:88dfbf908e9fa20f2fb5219b71eaec729033895ca271493b98a652b0abb0dcd5","observation_id":"b37f35ba-83c9-4e7d-908f-7ad364e1554b","resolution":{"observed_at":"2026-08-02T17:26:40.233139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-02T17:26:40.235934Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learn- ing.arXiv preprint arXiv:2504.08837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.235934Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:46cf728526d0aaf48f1e0c1a769d8c612e0321248b1db4bcadd5ed7e3fbb4be1","observation_id":"b11b1173-b446-4e5b-b7eb-bbc462e91b67","resolution":{"observed_at":"2026-08-02T17:26:40.235934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-02T17:26:40.239147Z","title":"Yijia Xiao, Edward Sun, Tianyu Liu, and Wei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.239147Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:a9678b4bdcb5f9117960c24e5f1f663af2ebb4b34bd7e412fdd420cfcd29258d","observation_id":"cc98f7b9-99a6-49ed-a866-90b9366f1cf1","resolution":{"observed_at":"2026-08-02T17:26:40.239147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-02T17:26:40.245636Z","title":"Zhuosheng Zhang, Aston Zhang, Mu Li, Hai Zhao, George Karypis, and Alex Smola","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.245636Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:66904b81d117fb607ebcc68fde9d09c3953991cfe02ed8549107f6b9372cb305","observation_id":"6ac3b28f-567d-46aa-8f8c-37e292b33e0e","resolution":{"observed_at":"2026-08-02T17:26:40.245636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T17:26:40.248532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.248532Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:7fb45e6ce374ab3666e2601c46ef87320440b1be28a37d73115661393a1a9506","observation_id":"dcc206f7-9f28-4832-923d-3791a8b20e3d","resolution":{"observed_at":"2026-08-02T17:26:40.248532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T17:26:40.230131Z","title":"10 Published at ICLR 2026 Workshop on Multimodal Intelligence HaoShao, ShengjuQian, HanXiao, GuangluSong, ZhuofanZong, LetianWang, YuLiu, and Hongsheng Li","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.230131Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:df144b825fa37d0a3bf2630f8f110c1d44615f4af402a546dfe8f5a47fff9a36","observation_id":"366b5311-e7c5-4968-94cc-2a4901b21c4a","resolution":{"observed_at":"2026-08-02T17:26:40.230131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:26:40.200210Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.200210Z"},"links":{"citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:a934dc76b74ead8f171666f5edf7728c0b0a35d1cf5bfb69db5e5cc602ad4c46","observation_id":"4bfd699b-590c-4ff2-8be5-65c9770d4140","resolution":{"observed_at":"2026-08-02T17:26:40.200210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-02T17:26:40.221157Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.221157Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:16d1f7814628178410fe1161321dc7c44df319247a50a8eb2faf57f042a8a74b","observation_id":"c04b29d3-3bd4-40c5-8945-af92eb728b70","resolution":{"observed_at":"2026-08-02T17:26:40.221157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-02T17:26:40.242308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.242308Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:db1e37a9ca93e971722791d4add2bc6b8b5cbdaac2a9b3ed3f00ab6df1ab040f","observation_id":"f2604c88-dbb9-4d53-9a3b-464ea3601a12","resolution":{"observed_at":"2026-08-02T17:26:40.242308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T17:26:40.203991Z","title":"Chameleon Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.203991Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:213963bc148060ac371d99a4342dc1fe0ea58ab4eaaad31291439f8703a0229e","observation_id":"37ed16fc-c74c-417b-9cd9-827b47c4d3f5","resolution":{"observed_at":"2026-08-02T17:26:40.203991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 2 inbound Pith citation observations for arXiv:2603.25629."}