{"as_of":"2026-08-10T08:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2529f7926075d7ffca1b026dfe50fb22d3e93d0f4c06bc7ac436aa5cd81a474","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:19.034618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:aaf45d9984d9f0ef2f9994394073eb601dfe0c1408614ddf9d5aee36768f2ee0","observation_id":"c4752a49-937d-4f37-8801-70f4bc348d93","resolution":{"observed_at":"2026-05-16T02:56:42.239118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:53176766c101c5164dcc5c431cbee433997d3a2e0f4d0366cbe62f299be30b46","observation_id":"5d2ab2cf-19a8-45c1-8e0d-6a1e5c44ce3f","resolution":{"observed_at":"2026-05-11T13:10:21.236393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:dfab41f428aaaeb4644f6cc4206e5f9c437c0166e9f7d14285112e85b2c650eb","observation_id":"1d2ef04f-9865-412b-9b35-1307004e607b","resolution":{"observed_at":"2026-05-11T05:26:05.692676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:525ef5ce91402b4c4f52d6bf830fd8815bc8bbc3a6af133b4800b772bccb802c","observation_id":"5684eb9b-6dd6-4071-a5a2-23d709b86867","resolution":{"observed_at":"2026-05-22T01:05:52.086561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T12:29:19.034618Z","title":"Preprint, arXiv:2312.14135","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24354","last_updated":"2025-05-30T08:46:23Z","snapshot_observed_at":"2026-08-07T12:22:24.010971Z","submitted_at":"2025-05-30T08:46:23Z","title":"Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.034618Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.24354"},"observation_digest":"sha256:57ee9b49de3832bd518862830a509f8b9db685a90fafae9c505c8bbfec79c497","observation_id":"71f3e515-41de-4d7a-b0bf-ad75ebc445e9","resolution":{"observed_at":"2026-08-07T12:29:19.034618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T11:04:14.241662Z","title":"Wu and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.241662Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:400097920c8ad18fbcefd9c0d8fbb9c73e82376e7db674e2ef6bfcfd4be9b642","observation_id":"7599ee8d-24d9-4414-ba22-ad3aa2d74bf5","resolution":{"observed_at":"2026-08-07T11:04:14.241662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T10:41:23.231324Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.ArXiv, abs/2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-10T06:40:52.289910Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.231324Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:2249aa679df7107a2868e3db89e7a0b2d361a5934f8fcc543fee15c5df3bffb7","observation_id":"858d4b93-a6c5-4dbe-9a08-d68c203ae2d6","resolution":{"observed_at":"2026-08-07T10:41:23.231324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T13:24:39.885634Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.885634Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ce895e00bc6dd03c35d080794ec72a613fcce9d0e77b448dc4f5eef7141ecafd","observation_id":"e3c446d9-6703-4203-825c-4baea7897aba","resolution":{"observed_at":"2026-08-05T13:24:39.885634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-08-07T17:13:19.123990Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:cfd1775e2c2a924c63e4ffa9f365c96fec83d3a897b8bb71bf59825b720544a0","observation_id":"e64e0d55-fe91-403e-8dc5-24610c1afd0b","resolution":{"observed_at":"2026-05-18T13:36:25.246023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T21:11:47.804851Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:6846aaf3af336d246f9be4862261b38835a94d19a7dbcf14dbdb345549a12b4e","observation_id":"a052efc3-2ef7-4196-8175-27680ac2b9d1","resolution":{"observed_at":"2026-05-21T21:14:22.807207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T14:42:58.310244Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:58.310244Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:190a0cca5c01478c478b8a2ea552a0c0b17d97737c3bf44ba982d7c7ab805f79","observation_id":"e7edd0ef-5bc5-42cd-8a8d-baaa308ee84a","resolution":{"observed_at":"2026-08-04T14:42:58.310244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T08:15:57.799831Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:57.799831Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:e5445e4fd49f003f8eaf257c103c2abe3d27e0fbca8e5998f40be9751667c74d","observation_id":"0bead9c2-52c2-44ea-9125-0979bab87762","resolution":{"observed_at":"2026-08-04T08:15:57.799831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-03T17:09:38.165356Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.165356Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:315b19e9ad55abd7fc83bc67769ac8eedee5071477b389fd287c7e74aee9f970","observation_id":"978dc477-32ba-4afb-8e4c-f600cbfa318b","resolution":{"observed_at":"2026-08-03T17:09:38.165356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2602.13310","last_updated":"2026-05-07T08:00:36Z","snapshot_observed_at":"2026-08-03T02:11:51.693223Z","submitted_at":"2026-02-10T03:53:25Z","title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:53.694506Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2602.13310"},"observation_digest":"sha256:a3f313d0df10cd4afd56eb486d40f642e3c0fc94cd057d6856bf9a3bfe336b69","observation_id":"92a875fa-dc60-4fdb-91e4-ed1ceac05f94","resolution":{"observed_at":"2026-05-16T03:30:33.046213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2602.23622","last_updated":"2026-05-19T03:38:52Z","snapshot_observed_at":"2026-07-06T22:47:15.482910Z","submitted_at":"2026-02-27T02:59:34Z","title":"DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T12:04:08.487678Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2602.23622"},"observation_digest":"sha256:2b16ecc90772b678719cc2eb52ba8e30d2c281c6ff754e84dd5875c937f2221b","observation_id":"1c20257b-e448-47cf-bad4-28b558dd828a","resolution":{"observed_at":"2026-05-21T12:05:04.972295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.arXiv preprint arXiv:2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:42cb263609f323126dd38b792f7ad28c203eda322cb128c23adf65fe292512d2","observation_id":"1e1dfc9c-74da-4b71-a0dc-5347b54124fa","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-02T17:26:40.239147Z","title":"Yijia Xiao, Edward Sun, Tianyu Liu, and Wei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-10T08:37:15.527817Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.239147Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:8cd42950c563eaf2c450c8b40ec61c8736a5520bd5fb4da2e7f3d189842a8228","observation_id":"cc98f7b9-99a6-49ed-a866-90b9366f1cf1","resolution":{"observed_at":"2026-08-02T17:26:40.239147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:ebae616c518e68071a56fa8cb6b206c5a780bf05fbf976bfa87af7ee22d88643","observation_id":"40ed16f7-83f2-455c-a1fc-4d451d3d4b24","resolution":{"observed_at":"2026-05-11T00:00:51.617866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.08065","last_updated":"2026-04-09T10:27:32Z","snapshot_observed_at":"2026-08-02T09:58:21.644966Z","submitted_at":"2026-04-09T10:27:32Z","title":"Multimodal Latent Reasoning via Predictive Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:26:27.683269Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.08065"},"observation_digest":"sha256:deafffafd62dadeda918acb34da7dcb33c7b0fd4a867d8c901638b7aa4a0891c","observation_id":"7eb14478-c1d8-4d8c-9be8-ebd448c8b100","resolution":{"observed_at":"2026-05-11T06:46:52.537656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-07-06T22:57:31.046146Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:98033e7bd8810578aa8c9f95c13f10ca8ca3be511eb68350e00373856a00c940","observation_id":"d99eb290-4d03-4448-8e02-44676820aed7","resolution":{"observed_at":"2026-05-11T07:16:10.605697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-08-08T08:04:53.159613Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:c466f994504432fe7338203bdabf24db30c4e5d72951a3486540b5ff30713bdb","observation_id":"83b8a0dd-9add-4223-8527-8a5659dfeeff","resolution":{"observed_at":"2026-05-11T06:51:18.794113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:2c13b392c5aa568e7049b0e3e6f2e0f8c3f6994ebd0a4544addb9a7339b63868","observation_id":"d3c74dd9-a762-4006-bd93-04f769f35297","resolution":{"observed_at":"2026-05-11T09:25:58.822046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"V*: Guided visual search as a core mechanism in multimodal llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:862c484417548c16ca6fb34cae687cddfd8571bb6a1f7e401876927deedabc6d","observation_id":"983d9ea9-53f7-41d6-abae-b8d9662b0c16","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:e6928c624fe1ff76ab59ea44af63c90c9c35041686a7ecb8031ebe008654b0dc","observation_id":"814f6ec7-7150-4d8d-9bf2-18e47e7f8447","resolution":{"observed_at":"2026-05-10T09:43:49.502913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.22875","last_updated":"2026-04-28T04:48:22Z","snapshot_observed_at":"2026-08-03T02:43:56.733861Z","submitted_at":"2026-04-23T22:33:15Z","title":"SketchVLM: Vision language models can annotate images to explain thoughts and guide users","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T21:32:08.503584Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.22875"},"observation_digest":"sha256:f0755785344f328334c7562b44d38fefd64433973cbfbc7fe07330d44d1a1e26","observation_id":"ea694479-978c-4604-9b46-9c67c71b600d","resolution":{"observed_at":"2026-05-09T21:33:27.942692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:5eb679678a73347d2bda276d1d84dcb221c62dde74da9ee80bafe912af676dcf","observation_id":"d44ab193-c2c8-4f94-9ecf-b6b415bbd7b6","resolution":{"observed_at":"2026-05-11T21:41:17.052295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.07817","last_updated":"2026-05-08T14:49:10Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:49:10Z","title":"GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:03:52.566413Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.07817"},"observation_digest":"sha256:132fe370fe4933e047bd499a14d824b1bbc6c0bb8a642ebfc786e089c63aadf5","observation_id":"4d1a14b4-c409-4d27-8502-8d53df71a759","resolution":{"observed_at":"2026-05-11T04:00:54.650794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:54293cc2118c2462799f806907c24335f442a3d67888dfaefa32e7de777af2a2","observation_id":"ccad97df-3074-475e-b73f-7de3b8ff1d3e","resolution":{"observed_at":"2026-05-20T12:03:15.473753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-07-12T16:34:33.771955Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:32.238241Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:ed61108c39b034afe386d32999091d5c710309b04d312059f342bd4d090af47f","observation_id":"e89677b3-b613-488c-9467-a4394c408300","resolution":{"observed_at":"2026-05-20T10:53:13.123588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-12T16:34:34.452430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-07-12T16:34:33.771955Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T16:34:34.452430Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:988514f2dae4f3863f8b5f3bbe655064063c7b12fc8d57bb7efec688e501fffe","observation_id":"a867bb2b-1d00-4b86-9775-0b198c98424d","resolution":{"observed_at":"2026-07-12T16:34:34.452430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.28741","last_updated":"2026-05-27T17:01:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:01:39Z","title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T12:53:40.783281Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.28741"},"observation_digest":"sha256:47fa80780dc572fa47f31b75ea5baed2a9ddfd9e804dba27c27619bd15060ff4","observation_id":"d5408f8a-eebe-4ad9-a88a-24da1b98dd3f","resolution":{"observed_at":"2026-06-29T13:03:26.884105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.03054","last_updated":"2026-06-02T02:44:27Z","snapshot_observed_at":"2026-08-02T04:55:02.222478Z","submitted_at":"2026-06-02T02:44:27Z","title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T10:38:41.735204Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.03054"},"observation_digest":"sha256:7312769e5ceb88e2a9c3bac4f764a54c2983dd5e4082e31bb1327d2afaad6db1","observation_id":"22009e46-56ed-46c6-ab6a-b1cf6c9a5d9a","resolution":{"observed_at":"2026-07-02T02:46:28.939546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:b508a0c66519646bd91022daaad6caa312add44609e5cc52c4f48d7b2a9339a0","observation_id":"79c455c0-6e7c-4123-848c-947c636d6fd2","resolution":{"observed_at":"2026-07-01T22:26:17.951269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:eb28059b56f57b7f7e3e9c8a37e5e06f804ca4b4c7c192e504531c09d4a04d69","observation_id":"02a06411-4ac5-46f5-9891-ef32db2a3b91","resolution":{"observed_at":"2026-07-03T23:49:02.271066Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.21968","last_updated":"2026-06-20T09:49:52Z","snapshot_observed_at":"2026-08-06T02:34:44.129324Z","submitted_at":"2026-06-20T09:49:52Z","title":"Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T12:54:06.319322Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.21968"},"observation_digest":"sha256:e17f4c22b7b23a3925d97359a33ed4c762364d5f9719b895dbb65bbf0ccb375b","observation_id":"8497a1cf-e8ba-4d0d-a171-6b6a1eee502d","resolution":{"observed_at":"2026-07-04T07:49:38.554498Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.23581","last_updated":"2026-06-22T16:47:00Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:47:00Z","title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-26T07:13:19.593093Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.23581"},"observation_digest":"sha256:1ba9f1127a33b673352f3cd6c2b6ba9f3b5ede4f34c6ce5a1cfbf91dbb143e17","observation_id":"3b1d8caa-5deb-486b-8c29-6611a5ad14b9","resolution":{"observed_at":"2026-07-04T12:09:48.891429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-01T16:48:36.519393Z","title":"Xu, G., Jin, P., Wu, Z., Li, H., Song, Y ., Sun, L., and Yuan, L","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-10T05:53:59.744780Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:36.519393Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:3a69ffbf377186c753e2d664b2f9ee5430f4cd548c6dc41b319122d0b4795d62","observation_id":"e17be238-b3bf-460a-8f63-3713f499ddcd","resolution":{"observed_at":"2026-08-01T16:48:36.519393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-31T02:56:58.290582Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.290582Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:0d8e736373470a81ed013f28854a13f8a0f303cadfbab094626f7c0d06725c9c","observation_id":"54c1de77-47be-4752-be6a-b354061bc3c3","resolution":{"observed_at":"2026-07-31T02:56:58.290582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T02:46:49.732380Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.arXiv preprint arXiv:2312.14135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00013","last_updated":"2026-06-24T13:23:33Z","snapshot_observed_at":"2026-08-06T23:11:31.052908Z","submitted_at":"2026-06-24T13:23:33Z","title":"What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:46:49.732380Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2608.00013"},"observation_digest":"sha256:0897ff72ec707fc34e3d2d8acc775f948ff4280a07846a9573fa71f0a035fc29","observation_id":"3c555d85-f35f-4299-851a-8fcf9e14a703","resolution":{"observed_at":"2026-08-04T02:46:49.732380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.14135/citation-record","integrity":"/paper/2312.14135/integrity","json":"/paper/2312.14135/citation-record.json","paper":"/paper/2312.14135"},"outbound":[],"paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2312.14135."}