{"as_of":"2026-08-09T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56810bc92b7be90fb842bafbe4be9ad72b61f656f039e6dbabfa26de98804a38","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:45:28.622401Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:31.045973Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-07T14:45:28.622401Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17812","last_updated":"2025-05-23T12:29:00Z","snapshot_observed_at":"2026-08-08T23:31:25.609762Z","submitted_at":"2025-05-23T12:29:00Z","title":"Seeing It or Not? Interpretable Vision-aware Latent Steering to Mitigate Object Hallucinations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:28.622401Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2505.17812"},"observation_digest":"sha256:0fd2bd3c22293b6e672bb720b7c24b27c0fd74a78c6196947d3aeb8e163e0555","observation_id":"26f19368-69be-4297-ad00-dc9f67a84f3a","resolution":{"observed_at":"2026-08-07T14:45:28.622401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-07T00:53:23.816759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12609","last_updated":"2025-08-18T08:18:50Z","snapshot_observed_at":"2026-08-08T12:21:50.848317Z","submitted_at":"2025-06-14T19:10:22Z","title":"Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:53:23.816759Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2506.12609"},"observation_digest":"sha256:3366ac9abee5a93611d8f4dfd56306384c9f3e0c9c5f3dfacb43f26c3aff5ad9","observation_id":"e6765169-2bf6-441f-932a-d0bc6ad9374f","resolution":{"observed_at":"2026-08-07T00:53:23.816759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T20:58:25.290792Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-07T20:59:53.220701Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.290792Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:c48d9b6432c7cb0c72652b056f8e333b4d54415b9c7073dce16914c08af02c6e","observation_id":"65ddff21-ce30-45c1-9483-4fd7cbd0887b","resolution":{"observed_at":"2026-08-04T20:58:25.290792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T21:11:47.804851Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:1c54b67e5b1dafd69732691c189130a099b2fbd7aa909d15ad98e4334c583e64","observation_id":"faa9854e-6bc5-4828-aed1-bb21b25fe44d","resolution":{"observed_at":"2026-05-21T21:14:22.812861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T14:42:57.009415Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:57.009415Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:c322e2956f44248d7b3aa5040ba913619a19afb9b60013c06c9bed54c93363f6","observation_id":"6e7dfff8-e5c2-4649-a669-34d764219291","resolution":{"observed_at":"2026-08-04T14:42:57.009415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T09:47:23.806393Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.13698","last_updated":"2026-07-14T06:18:50Z","snapshot_observed_at":"2026-08-07T12:08:13.873562Z","submitted_at":"2025-10-15T15:57:17Z","title":"Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T09:47:23.806393Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2510.13698"},"observation_digest":"sha256:3aa16cc0aec7a7a50b340b4822915b08f4e6048d085598bd5e15250e1b9c217c","observation_id":"3102a7f9-dd18-4a0b-b788-6034d468655c","resolution":{"observed_at":"2026-08-04T09:47:23.806393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T08:14:36.218482Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.218482Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:8505713ff821072e634bb328f63d2b99a50520ca28797b03c35f739e5c708731","observation_id":"863d9f65-ccbb-4e1e-9ae2-fd0b085c9787","resolution":{"observed_at":"2026-08-04T08:14:36.218482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:04.983299Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:63522b7281fcbd36220ff7b732d4a9cddbcfa475b9f0eb2dad6bc0ce3689141d","observation_id":"465b55ba-ba7c-4563-a593-04e432d62705","resolution":{"observed_at":"2026-05-21T19:54:20.254402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-03T21:44:00.054831Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:44:00.054831Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:340dc6e2fe1c945ef083064b0fa6fe6ef920a5b62c58cfa09ef6fbcaf450e572","observation_id":"d1d25e1a-0373-4e3b-a027-a3115dc80d91","resolution":{"observed_at":"2026-08-03T21:44:00.054831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2511.17722","last_updated":"2026-04-02T18:08:31Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T19:18:41Z","title":"Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T20:05:20.393575Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2511.17722"},"observation_digest":"sha256:c13274bf85715dbf8405085177aedb19cbdb5a584abe62d04483f8e82a2b26cd","observation_id":"36680381-e702-4798-bef3-21fc87835478","resolution":{"observed_at":"2026-05-17T20:10:11.265815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2602.17419","last_updated":"2026-05-07T12:09:13Z","snapshot_observed_at":"2026-07-06T22:46:26.082843Z","submitted_at":"2026-02-19T14:50:58Z","title":"EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T21:05:11.117495Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2602.17419"},"observation_digest":"sha256:c70ea96c4f4868cd2464bbd1d2338cc6429f1f6c130655b40af3c190d95a983d","observation_id":"837504ba-23fd-4c0a-827d-e9080d9327e1","resolution":{"observed_at":"2026-05-15T21:06:38.105307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2603.14184","last_updated":"2026-05-20T12:33:19Z","snapshot_observed_at":"2026-07-06T22:49:06.164294Z","submitted_at":"2026-03-15T02:21:05Z","title":"Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T11:56:29.743281Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2603.14184"},"observation_digest":"sha256:d878285685ce823b529cee817ddcb123ecde3ad2b310af9ab3d5b57ebec53e29","observation_id":"019e877f-d788-46fd-a323-8e61986d8f3c","resolution":{"observed_at":"2026-05-21T12:00:04.294537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2604.10039","last_updated":"2026-04-11T05:23:19Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T05:23:19Z","title":"Counting to Four is still a Chore for VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:06.327888Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2604.10039"},"observation_digest":"sha256:0156803acb8c992efe2a0ec1a8fe8aadda92ce1f706a5d6cebe104b2b83d6b78","observation_id":"34e3fb74-d1dc-4b4e-9f29-d0e0bfefbb2d","resolution":{"observed_at":"2026-05-11T10:06:03.269739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2604.14363","last_updated":"2026-04-15T19:26:30Z","snapshot_observed_at":"2026-07-06T23:02:09.426599Z","submitted_at":"2026-04-15T19:26:30Z","title":"The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:27.762910Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2604.14363"},"observation_digest":"sha256:63c186cea4f22af74a454a255d253a9c957ea68686bae98fe1c99b65f87bb5f3","observation_id":"f38698a3-d098-4a92-b8b8-cbf920c25201","resolution":{"observed_at":"2026-05-10T13:35:26.794760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-02T23:37:34.955988Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:3f5223f01a371ecef78de17e01bc9b16aac36104179ac3845a12dcbf99de4aef","observation_id":"2c89199c-f754-48a0-8a7c-b8b831309cbb","resolution":{"observed_at":"2026-05-10T00:44:48.397647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-08T23:09:28.589207Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:c47676303e1e2a3820b79e8e579fa6073a8338c73ef613cc1342ee96dd2fd945","observation_id":"96e39971-fcc6-44f3-9e74-9d7d8f9df146","resolution":{"observed_at":"2026-05-09T23:09:26.685247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2604.25273","last_updated":"2026-04-28T06:29:27Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T06:29:27Z","title":"Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:56:52.714346Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2604.25273"},"observation_digest":"sha256:c3270105e8e10a7949bb7c831bd9feed354dfc3740e759756b1743a0a330b02b","observation_id":"15b448f1-d203-4a4e-871d-8f668ec1eb7d","resolution":{"observed_at":"2026-05-11T23:31:13.605771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:7358ef6550d86b12d73f17217a52b814c7a21185a38a62a15a05a0ae32be4755","observation_id":"4566a0c8-e827-4395-bf5d-cb8ec66cd7a8","resolution":{"observed_at":"2026-05-11T19:26:10.066217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.18359","last_updated":"2026-05-26T13:49:58Z","snapshot_observed_at":"2026-08-02T17:52:26.858372Z","submitted_at":"2026-05-18T13:12:50Z","title":"RAVE: Re-Allocating Visual Attention in Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T11:10:58.225078Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.18359"},"observation_digest":"sha256:c034d399fb4c0bf9da75b3c372e6e3cf2343259161cd04697c1431b4c9ec7bd7","observation_id":"a3d5c165-df40-40d4-9ac9-b47f11a0ca60","resolution":{"observed_at":"2026-05-20T11:13:13.468869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.18359","last_updated":"2026-05-26T13:49:58Z","snapshot_observed_at":"2026-08-02T17:52:26.858372Z","submitted_at":"2026-05-18T13:12:50Z","title":"RAVE: Re-Allocating Visual Attention in Large Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:36:56.248838Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.18359"},"observation_digest":"sha256:70b0e7c3fcad22ab34132393d49d9f5c75e146580bcc9e0893e5077ce81fbafc","observation_id":"8f45ea5d-edad-4a0f-9064-b4ea98aaa6fe","resolution":{"observed_at":"2026-07-01T14:55:48.355460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:023cc119b6dc13bd69f524fa470e3e2cf5fb4e93fa91543ea1b7343ed06efc0a","observation_id":"145b7c44-0cda-4d95-90c0-ff50baaa55d8","resolution":{"observed_at":"2026-05-22T07:14:42.456705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.25244","last_updated":"2026-05-24T20:04:19Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T20:04:19Z","title":"Inference Time Optimization with Confidence Dynamics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T11:12:46.757296Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.25244"},"observation_digest":"sha256:3f107c057a3685075bcbd195188542313f8393ac884dd68024c84d41b9674f28","observation_id":"941f5569-b466-421a-8c5b-ffb153b9be89","resolution":{"observed_at":"2026-06-30T11:14:37.619616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.25799","last_updated":"2026-05-25T12:49:15Z","snapshot_observed_at":"2026-07-06T23:35:41.527169Z","submitted_at":"2026-05-25T12:49:15Z","title":"Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:28:35.155099Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.25799"},"observation_digest":"sha256:33be393606e052fd36988decb620da0606a1bdf98baf7c1ad6e3124d5000641c","observation_id":"f7cf9279-2f32-40c9-be26-fe63dbc86178","resolution":{"observed_at":"2026-06-29T22:34:01.800634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.03712","last_updated":"2026-06-02T14:34:01Z","snapshot_observed_at":"2026-08-04T19:48:56.728719Z","submitted_at":"2026-06-02T14:34:01Z","title":"When Graph Tokens Sink: A Mechanistic Analysis of Graph Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:27:09.779776Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.03712"},"observation_digest":"sha256:92ec9efc717c9e5561da0e78a679088bdec1eec232ad4d4ea7577e68f9e3c1c2","observation_id":"a41cd955-68d3-41d9-a696-11c4074591a9","resolution":{"observed_at":"2026-07-02T01:56:27.409378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.05843","last_updated":"2026-06-04T08:18:31Z","snapshot_observed_at":"2026-08-07T20:51:53.666102Z","submitted_at":"2026-06-04T08:18:31Z","title":"Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T01:54:13.927736Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.05843"},"observation_digest":"sha256:4c3dd750c8ffd308746c7cb4d4d7877a619b8cb6857f92fac6a41adfd0cca783","observation_id":"b37d17ce-7aef-4aaa-8d64-58ba4f066f4e","resolution":{"observed_at":"2026-07-02T12:46:56.644022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.09303","last_updated":"2026-06-08T10:10:55Z","snapshot_observed_at":"2026-07-06T23:48:39.574979Z","submitted_at":"2026-06-08T10:10:55Z","title":"Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.745646Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.09303"},"observation_digest":"sha256:f237cf5fbad884206aed9bf325002f5726dee353956e6a939c12097115cebfb8","observation_id":"b039fe84-d7ec-463f-a462-d74ffb2c4031","resolution":{"observed_at":"2026-07-03T00:47:30.634436Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:979815cc33afd6e9119132af2e225eb926eb18d40908487cd47e14497538010c","observation_id":"afb174be-9df7-440c-af56-d881b879226d","resolution":{"observed_at":"2026-07-03T01:57:32.316937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:97461cfb30c60ba39fd177754523a37bfa187ee940544d01f02ef037d21d5955","observation_id":"f663055d-df4d-4e1e-b486-d9cf7ee7eb4a","resolution":{"observed_at":"2026-07-03T11:28:04.108386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.14782","last_updated":"2026-06-16T10:51:58Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-10T10:09:59Z","title":"Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:29.131570Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.14782"},"observation_digest":"sha256:8fb7ee8650c73f1e026466619205c4637e50f4728025df0ea893e91c34f2f775","observation_id":"d90ea871-600b-40cf-900d-1c1f81e05318","resolution":{"observed_at":"2026-07-03T09:17:49.042253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-06-18T10:52:49Z","snapshot_observed_at":"2026-08-04T07:49:21.370818Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:f06e2eac7275302add051855cccb2937ff0027fd17b7121c12b72f51adbe691e","observation_id":"dbfcec07-4c4c-43c2-92b9-4538d13d9812","resolution":{"observed_at":"2026-07-04T03:19:31.048584Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:88feaa554cdbfbd6c0c016446a0fea8b65815833502d868a2e677c8285fe0adb","observation_id":"5082a377-8813-4fe3-ac05-7b19dd3bb3f9","resolution":{"observed_at":"2026-06-30T06:04:21.286659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2606.31054","last_updated":"2026-06-30T02:46:10Z","snapshot_observed_at":"2026-08-07T17:43:53.022630Z","submitted_at":"2026-06-30T02:46:10Z","title":"ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T06:51:01.371390Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2606.31054"},"observation_digest":"sha256:18c77f00619a082e2e19dda5b55e515e0010763996cb8948de5b6ff0eca966f7","observation_id":"9d60cd50-a443-4612-955b-80f85d85c4cc","resolution":{"observed_at":"2026-07-01T06:55:29.486668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2607.00434","last_updated":"2026-07-01T04:45:41Z","snapshot_observed_at":"2026-08-08T21:41:10.025868Z","submitted_at":"2026-07-01T04:45:41Z","title":"Information-Regularized Attention for Visual-Centric Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T15:12:43.475802Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.00434"},"observation_digest":"sha256:0f9e6345f0c52b30dce0c5a9ad5e2b05413a46fd4d13aa7d575e956628e4481e","observation_id":"669815dd-0801-42ec-8b36-de554e29f9db","resolution":{"observed_at":"2026-07-02T15:17:07.247821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-14T05:37:19.632869Z","title":"arXiv preprint arXiv:2503.03321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T05:37:19.632869Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:7131b3501c149a5401004686300efb124da3d54c4ef6801d360c82012c6e9b1a","observation_id":"6ff1c143-7362-4272-bccc-416129289b67","resolution":{"observed_at":"2026-07-14T05:37:19.632869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-02T07:01:19.935203Z","title":"arXiv preprint arXiv:2503.03321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:01:19.935203Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:a59a9eff3fa85c1c9de5666e0b7f99bfcd7a5f57203e61991f77c8c3bfacceda","observation_id":"e2cba484-7271-45db-ada6-1c7465442908","resolution":{"observed_at":"2026-08-02T07:01:19.935203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-01T23:29:00.730157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.730157Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:82c0c6b38bbf836dba50e473453498b49a998c43f852e9602018f4b24ac0506a","observation_id":"dfaf8944-d82a-4aba-bcd1-997dde3b7c7d","resolution":{"observed_at":"2026-08-01T23:29:00.730157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-01T16:48:35.906973Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-07T08:03:33.617792Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:35.906973Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:426ea0080ff78ef9a3b9368bb6fcc4f48b4165e1a495b3eb446f85c82d7fef6e","observation_id":"a9d423ba-0d22-4dc5-b4a2-33fed6b76e9e","resolution":{"observed_at":"2026-08-01T16:48:35.906973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-01T13:25:54.711000Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19139","last_updated":"2026-07-30T16:07:04Z","snapshot_observed_at":"2026-08-03T13:02:29.806237Z","submitted_at":"2026-07-21T14:29:59Z","title":"Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:25:54.711000Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.19139"},"observation_digest":"sha256:a647b4fcbc562a7328c0cf28666e606f05a33ee08b92dd3cd06a1f4d170d3c9e","observation_id":"b5b66a19-8b7a-43b8-b13f-0909d0cc1a4a","resolution":{"observed_at":"2026-08-01T13:25:54.711000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-06T23:28:37.236788Z","title":"arXiv preprint arXiv:2503.03321 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04483","last_updated":"2026-08-05T06:16:53Z","snapshot_observed_at":"2026-08-08T23:11:45.598472Z","submitted_at":"2026-08-05T06:16:53Z","title":"Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:37.236788Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2608.04483"},"observation_digest":"sha256:4fd688a859b87930b289b0a379d72a30d9c765a271d3011ef9e24aecb65742dd","observation_id":"cd3f7e0f-08b8-4be6-bc56-4994d17e9b8b","resolution":{"observed_at":"2026-08-06T23:28:37.236788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.03321/citation-record","integrity":"/paper/2503.03321/integrity","json":"/paper/2503.03321/citation-record.json","paper":"/paper/2503.03321"},"outbound":[],"paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2503.03321."}