{"as_of":"2026-08-09T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4364d79a18edce102b71749f22095e25085f3de00a808306ed50ab8500277bd8","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:15:21.942968Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03025/citation-record","integrity":"/paper/2509.03025/integrity","json":"/paper/2509.03025/citation-record.json","paper":"/paper/2509.03025"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.075015Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.075015Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:6acc519ce08ad9c86caf195002faf5fe8aa96db39fc6b6344046e313ca547cb7","observation_id":"9fd290ec-c49a-40cd-b8f8-6719d6653d6c","resolution":{"observed_at":"2026-08-05T11:15:19.075015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.174853Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.174853Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:03ed49b8d880c44f34f297089a941b52017ed5c1fb85e89220f3af055f5056c9","observation_id":"e45fc0c7-f005-4cff-9752-54d6a36ae26c","resolution":{"observed_at":"2026-08-05T11:15:19.174853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T11:15:19.240348Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.240348Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:5b487433720d5e107b7ebb3cb970d42d9912dd89557afa7d005e78f81fcc4ebc","observation_id":"c5f706e8-2913-4c18-b3fa-61d69a653ed0","resolution":{"observed_at":"2026-08-05T11:15:19.240348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T11:15:19.314821Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.314821Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:14b5cc3c1d5c7e79f0e192df67c180e2710a5a6a1944e7f02f0cb265109b3a9c","observation_id":"140fb18e-6e13-4e70-a939-961a84c4f13c","resolution":{"observed_at":"2026-08-05T11:15:19.314821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:26.736541Z","title":null,"venue":null,"work_id":"1ccda979-f3b3-48f7-a110-023ab15e9cdd","year":1946},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.380664Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:84c0fe833cc1df608e73c5653e5314fcac7fbe460a0b8a43c0d61b199b6554e4","observation_id":"cd8921a2-197e-4cf1-9d0a-57d397894c8e","resolution":{"observed_at":"2026-08-05T11:15:26.764748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-05T11:15:19.424872Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.424872Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:48f225ab21cff302f26659296d0a0084056d486b6270cba67bdfcbaa366e154d","observation_id":"35a7840b-e8c0-432e-bf23-50501b317411","resolution":{"observed_at":"2026-08-05T11:15:19.424872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08696","last_updated":"2022-03-10T02:28:59Z","snapshot_observed_at":"2026-08-09T05:29:46.140161Z","submitted_at":"2021-04-18T03:38:26Z","title":"Knowledge Neurons in Pretrained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08696","snapshot_observed_at":"2026-08-05T11:15:19.454823Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.454823Z"},"links":{"cited_paper":"/paper/2104.08696","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:788f5307f01e93367bb82b62fc82f0b2b54bfc68e21dfc414d1dacb694e610e0","observation_id":"44ec3d41-53c9-4d3c-8cf3-2c365e167fb9","resolution":{"observed_at":"2026-08-05T11:15:19.454823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T11:15:19.504122Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.504122Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:6f7655492352c34cf9a2d55cd1f94f1df2377dd7a10ab3eaeab3de2bc7329b2d","observation_id":"17eee560-6975-4853-a26b-84775a191a84","resolution":{"observed_at":"2026-08-05T11:15:19.504122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.565754Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.565754Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:9cf11ea49ba3920db3ed3dd7b7512e05cdaa7e83f2e5ebdaa31822bc762ebdbf","observation_id":"59f77bcd-852c-426f-9682-fe5aca9f3dda","resolution":{"observed_at":"2026-08-05T11:15:19.565754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-07T23:50:29.977330Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-05T11:15:19.605919Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.605919Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:f3ac470aca8b077754654d56332c30ac74092d400a0c9fa362a8b66c43957579","observation_id":"d7359f5e-7531-4a10-af42-269294a0aa84","resolution":{"observed_at":"2026-08-05T11:15:19.605919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09141","last_updated":"2021-06-16T21:36:36Z","snapshot_observed_at":"2026-08-04T12:39:52.869889Z","submitted_at":"2021-06-16T21:36:36Z","title":"Probing Image-Language Transformers for Verb Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09141","snapshot_observed_at":"2026-08-05T11:15:19.644943Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.644943Z"},"links":{"cited_paper":"/paper/2106.09141","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:79e556f8709fcbe5ef18d1118e80dd73bab860abad0298b5d523c128c79817ba","observation_id":"1782759a-7914-4003-aa50-63b0dcad429e","resolution":{"observed_at":"2026-08-05T11:15:19.644943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.694872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.694872Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:2fe1ceced215abb75460c6b47466ca7fd4d53c59152fa56386da435daf96832b","observation_id":"0db8c516-3916-4fea-9e08-cb79509663a9","resolution":{"observed_at":"2026-08-05T11:15:19.694872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T11:15:19.754749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.754749Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:daa73972f197b58db564566f35eb1958f79042a25290289f1e2fc30e96b12196","observation_id":"0611921d-785c-4fd9-8f12-d12affa32ca2","resolution":{"observed_at":"2026-08-05T11:15:19.754749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:26.479948Z","title":null,"venue":null,"work_id":"a9f415f4-0916-4745-8166-52db8b87556b","year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.804814Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:f9364c7513f142f9d4f5bcba17cf763796d040ff5fec332ece19af9e4e27eabc","observation_id":"1a6324c4-8b7e-40c2-8468-3355e158e5e2","resolution":{"observed_at":"2026-08-05T11:15:26.514743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.854741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.854741Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:5445feefe69dba095ad12cf5f000224cb801e29a3267b578a227ceafafce5b39","observation_id":"faca7dc7-0aac-4bb6-a22c-8eb1a89a9a9d","resolution":{"observed_at":"2026-08-05T11:15:19.854741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T11:15:19.883714Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.883714Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:c6705e21cfcb868bdcf6c5b3b5a0f9ef488a8e2682bd9b42b6a819aaeed5ccdd","observation_id":"b2259f4f-248c-46b6-8d3b-3d7633350378","resolution":{"observed_at":"2026-08-05T11:15:19.883714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-05T11:15:19.944745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.944745Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:e4107e65c2c345c6a65aa9c28742f370d5455f695bcc164321568845e9c56163","observation_id":"f00b1747-322d-42c3-bb09-34d3a32b087e","resolution":{"observed_at":"2026-08-05T11:15:19.944745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:19.994745Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:19.994745Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:448bec6d508bb893cca33db97587a18bf6118f311ef8f136984292b6df72cc1c","observation_id":"38e01bcd-ac2a-4ab4-b67f-4f7cdd981f9f","resolution":{"observed_at":"2026-08-05T11:15:19.994745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-05T11:15:20.044747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.044747Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:4245e69b86d374ef3e0dceb491f6dd4073bb6b9b8e4b99cd333f254a89f683ab","observation_id":"f8be3dd9-6ea5-4dbe-bf08-433eb8793830","resolution":{"observed_at":"2026-08-05T11:15:20.044747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:26.239080Z","title":null,"venue":null,"work_id":"0ebbafc6-123a-4cb3-8f75-1f11c59f76a5","year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.094747Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:9175b3a1cda9bd2f0f6208c828eab1c353318e1c4f7501bb85818b333272d26d","observation_id":"144a6987-07ee-4b8c-b105-220ba8b7da46","resolution":{"observed_at":"2026-08-05T11:15:26.264750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:20.160134Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.160134Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:fca07a0937aa3565c09f6800f91a599db165eb42b0b30e9e8b7bdf592052efc8","observation_id":"169ebd7b-e84c-4887-862f-b6acefb25a32","resolution":{"observed_at":"2026-08-05T11:15:20.160134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:25.956596Z","title":null,"venue":null,"work_id":"f5201d2c-2eeb-4002-8822-63e24431e9fe","year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.202021Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:6e4c1c2135009403ad4743a7c729a2607d579b4c0f0c9f0509f491dc3a942672","observation_id":"2928d33c-cad8-4816-bf5a-895bed7b7a40","resolution":{"observed_at":"2026-08-05T11:15:26.025278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:20.240136Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.240136Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:1a63130342159613e5d35e12f77d8887b4c83c03d3526fe67db8162cdc9cd2a7","observation_id":"c54c8f8d-a42c-4b8e-8b60-b067497164a0","resolution":{"observed_at":"2026-08-05T11:15:20.240136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:20.270789Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.270789Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:53ead81603122c08781733af90fb07cdf510cdd82d53eb98e2c1f62187e2c337","observation_id":"48882dc4-c906-4319-960a-5922bcdc8ce2","resolution":{"observed_at":"2026-08-05T11:15:20.270789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-05T11:15:20.314879Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.314879Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:dbfc5dfc4d3a6cb2061048ba007f62a357591d51664c6b0c538a058666f53979","observation_id":"c3df7717-3dd9-4829-b436-27c4197ecb02","resolution":{"observed_at":"2026-08-05T11:15:20.314879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T11:15:20.386250Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.386250Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:b952b5ff252561de85c713237f7a4d95963a18f63db026e95aa2ae4674881025","observation_id":"6b519b3e-4458-4a35-8011-0fae9ce3e2aa","resolution":{"observed_at":"2026-08-05T11:15:20.386250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T11:15:20.468023Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.468023Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:f09c3a0f5899927cdb87ef4efa0038ed8c1455d8fcd720b2931818b7e1412964","observation_id":"37df8272-efe6-4b51-ae33-154245d5e5fc","resolution":{"observed_at":"2026-08-05T11:15:20.468023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T11:15:20.517348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.517348Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:bf0aa354fb1403c6a9700bb7301f20aab02357b44a997cea960dfa05565f664e","observation_id":"824d05ef-06ee-4c1c-bf5a-f50d716ff2d9","resolution":{"observed_at":"2026-08-05T11:15:20.517348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:20.584749Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.584749Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:d464092d1447ad346ba7a18633aa41a821ddc09b8fa697bfb9f3c4091a45ba53","observation_id":"99ec4232-a442-4270-bb3f-e9012b2d1265","resolution":{"observed_at":"2026-08-05T11:15:20.584749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T11:15:20.624737Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.624737Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:3e5d6cb92da21fe1734d6c0f0890aeaacd1a04257d17549e02a963934256525b","observation_id":"f0130519-1925-4915-80d6-1e6b840dbdb8","resolution":{"observed_at":"2026-08-05T11:15:20.624737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:20.664746Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.664746Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:cac55b8f274bf95aaa8ccaa98b04f70a956bf5436cbdac2224ee61f0b5929a7b","observation_id":"e4549958-45fc-402d-a459-108e2fd2e9cb","resolution":{"observed_at":"2026-08-05T11:15:20.664746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T11:15:20.714796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.714796Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:9356aee6d62caa8ec118631891e86fc801fca179ef833ad1294fea3fa7f025bf","observation_id":"bd5cfdaa-f2c7-4aef-ad97-981d4e6fc309","resolution":{"observed_at":"2026-08-05T11:15:20.714796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16449","last_updated":"2024-07-18T04:39:29Z","snapshot_observed_at":"2026-08-04T12:23:29.672549Z","submitted_at":"2024-06-24T08:42:42Z","title":"Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16449","snapshot_observed_at":"2026-08-05T11:15:20.794862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:20.794862Z"},"links":{"cited_paper":"/paper/2406.16449","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:3e50f14255084c0f953d9ed929a1ba303bf05e4da5c6f7d69825ed2170658c3e","observation_id":"d8c9da9f-a4d6-47db-b73e-c87f540b507f","resolution":{"observed_at":"2026-08-05T11:15:20.794862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:15:25.511718Z","title":null,"venue":null,"work_id":"d9440832-36b5-4572-97d1-325d91b3e142","year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:21.744255Z"},"links":{"citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:a436fc72e72f28d7267676533e5eb31d8b9e5377622a4072088273d9f5781046","observation_id":"27605e66-b1cd-447e-b041-819fd3917b42","resolution":{"observed_at":"2026-08-05T11:15:25.564740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09429","last_updated":"2025-05-30T07:27:55Z","snapshot_observed_at":"2026-08-06T05:50:24.482366Z","submitted_at":"2024-08-18T10:07:02Z","title":"Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09429","snapshot_observed_at":"2026-08-05T11:15:21.804745Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:21.804745Z"},"links":{"cited_paper":"/paper/2408.09429","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:d0ad3591e3338f94b4444d383e611c64ddfd521adc156d854302411b4a08be27","observation_id":"aab9b760-309d-4689-8ab9-86a6933752ee","resolution":{"observed_at":"2026-08-05T11:15:21.804745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-05T11:15:21.834742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:21.834742Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:75e8e8f005a433ae31cb4558f7791dc96eba2afe9eab824ab6276490aa3b0233","observation_id":"1e0ac97f-52f7-46b0-b257-9ae5d5429c48","resolution":{"observed_at":"2026-08-05T11:15:21.834742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T11:15:21.874924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:21.874924Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:bda87930adde58a76bb8a523d7c373f59b41bc95b40fe4577371aa7c60f9014b","observation_id":"c65b3636-dcb0-4787-afdd-3a7af49d5da9","resolution":{"observed_at":"2026-08-05T11:15:21.874924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-05T11:15:21.942968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T11:15:21.942968Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2509.03025"},"observation_digest":"sha256:16ff04268cc0ab4175ca9a0c67d95391f4f7b014bed0f9bd23e7d5c938b357fd","observation_id":"a5ee6cef-278a-4026-9b39-706473484ed7","resolution":{"observed_at":"2026-08-05T11:15:21.942968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03025","last_updated":"2025-09-05T07:49:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:57:32.906442Z","submitted_at":"2025-09-03T05:17:25Z","title":"Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2509.03025."}