{"as_of":"2026-08-11T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36033edba5cd52bbf3ccca895c5cfd44a41402d79002e11393d5302e464473dd","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:01.636998Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T14:03:01.974171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Image tokens matter: Mitigating hallucination in discrete tokenizer-based large vision-language models via latent editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:f0fd042bf244b04c51a50a227c9d8c794d188a78832ad9cc993f3fa0031a84a7","observation_id":"8cf7a9e4-c225-45e5-afff-a84c3271eeba","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":"2505.21547","doi":"10.48550/arxiv.2505.21547","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image tokens matter: Mitigating hallucination in discrete tokenizer-based large vision-language models via latent editing","venue":"ArXiv.org","work_id":"6946dc00-f4df-488f-bf2c-d6ea3e167010","year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T16:51:48.705876Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:aa3df175bdc84a32f3189a1791b3a34de7b9c5d83657b55f5e3e93a46f765471","observation_id":"e63476e1-3440-4969-808d-cdea61c1ca4f","resolution":{"observed_at":"2026-05-13T16:52:59.443243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-07-13T12:10:53.720348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T12:10:53.720348Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:3b09d2256dfa1aa59187803c1aae5dcc011bc392674b10982b19887effd13f56","observation_id":"4eb6bd6e-b563-46a8-808c-58cbcfca0bcb","resolution":{"observed_at":"2026-07-13T12:10:53.720348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":"2505.21547","doi":"10.48550/arxiv.2505.21547","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image tokens matter: Mitigating hallucination in discrete tokenizer-based large vision-language models via latent editing","venue":"ArXiv.org","work_id":"6946dc00-f4df-488f-bf2c-d6ea3e167010","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:18328fece9243a5aa107101753463effc97a1d217b3422ceb516ee6aea326d1d","observation_id":"12eb500d-62b4-4d9f-aa2d-6fbc85357130","resolution":{"observed_at":"2026-05-11T16:36:09.558238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21547/citation-record","integrity":"/paper/2505.21547/integrity","json":"/paper/2505.21547/citation-record.json","paper":"/paper/2505.21547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-10T17:40:26.307742Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-07T14:27:57.565665Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding.arXiv preprint arXiv:2311.16922, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.565665Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:a6e56e0bf515b0de6a608afd0a328270f8c0e4151c7d3d0cdb1fd98d223bfd7f","observation_id":"a7f89ee4-6ae8-4666-9856-2852cbe51c38","resolution":{"observed_at":"2026-08-07T14:27:57.565665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:57.604423Z","title":"Self-introspective decoding: Alleviating hallucinations for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.604423Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:9e4e3539b7c049e997bbfb22ee416da520a1ddc600960587d061ada586497d85","observation_id":"8bdb6fa9-9fb7-48a6-a6a5-c6fd77b1ae55","resolution":{"observed_at":"2026-08-07T14:27:57.604423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:57.704646Z","title":"Code: Contrasting self-generated description to combat hallucination in large multi-modal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.704646Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:39817b45c875bc4d8abe90351dc573c36d4791b528aedf1a67cfd5a508003af1","observation_id":"d9c433d7-ed2d-4c60-b5d8-1a83c34e7f3b","resolution":{"observed_at":"2026-08-07T14:27:57.704646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:04.852389Z","title":"Ibd: Alleviating hallucinations in large vision-language models via image-biased decoding, 2024","venue":null,"work_id":"82e612c5-3d11-4a61-8105-f5c3788c699c","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.806804Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:0c43be8fdb1dc8528f750e00e1e7e958eeee230783acf1ffc7476494342b9abb","observation_id":"75c75daf-7572-4fd2-b662-d86aae846d75","resolution":{"observed_at":"2026-08-07T14:28:04.918305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:04.664409Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation, 2024","venue":null,"work_id":"496a7acd-2e5c-4336-9fad-e072dc4379f0","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.890438Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:6a3f700392eaef7dfb6f99615fa7511d31ed95f3014d66edf4ca7187a69eba9a","observation_id":"8440c6d4-441b-4cdf-a847-ad540deb911f","resolution":{"observed_at":"2026-08-07T14:28:04.766887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-09T16:06:26.088504Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-07T14:27:57.965731Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations.arXiv preprint arXiv:2410.02762, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:57.965731Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:0fec350221b71bf651e0244f4488b1923ccddd2777f70d5a33bf808234f0ca06","observation_id":"1ee8520a-95e1-46a6-ac0b-586354530e1f","resolution":{"observed_at":"2026-08-07T14:27:57.965731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:04.518078Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":"5cab2866-fc09-413c-8231-852ff7a496e2","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.039395Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:939e927797560ba9e40441c51ade62ddc203d2145ac0f8adb3056deca346833c","observation_id":"07c61a33-34b3-4c26-9db9-c3e3c10531b7","resolution":{"observed_at":"2026-08-07T14:28:04.583561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.114629Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.114629Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:e5785ff5378f733ce736ecba3f3e0a4553a9a2f94d0fdf7426a6b257b767d817","observation_id":"13b8ce95-fa5b-4c07-a743-d632b306e3b6","resolution":{"observed_at":"2026-08-07T14:27:58.114629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:04.354909Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation, 2024","venue":null,"work_id":"2f169de4-ff02-48dc-9e89-73e4b9133f7e","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.188791Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:3d3dc0d5eba4bf4089c3477082e1d322e80ab23ae7241119a7f5cf148ffaf74f","observation_id":"3182d595-a4d8-424d-bfef-505b1a909d52","resolution":{"observed_at":"2026-08-07T14:28:04.429668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12448","last_updated":"2025-02-18T02:29:51Z","snapshot_observed_at":"2026-08-07T18:10:30.041732Z","submitted_at":"2025-02-18T02:29:51Z","title":"From Principles to Applications: A Comprehensive Survey of Discrete Tokenizers in Generation, Comprehension, Recommendation, and Information Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12448","snapshot_observed_at":"2026-08-07T14:27:58.245006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.245006Z"},"links":{"cited_paper":"/paper/2502.12448","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:af86ec56b66ffe92e0be7f0b5c39fab47e8c2858e9ea88fdbdaf57617a641212","observation_id":"b2986500-72c7-4e5e-b484-e5994d4dc16c","resolution":{"observed_at":"2026-08-07T14:27:58.245006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.344157Z","title":"Show-o: One single transformer to unify multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.344157Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:e978dde688a6514683db6f2ee5bf108188b792962e99f2b040f8f2c4b9bdc64f","observation_id":"fc5a5d7e-765c-44c6-bbe2-f544bc5bb212","resolution":{"observed_at":"2026-08-07T14:27:58.344157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.461152Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.461152Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:63378b7e8710eb61572f16f01309efabf12986f97ce4fa45d0bd386b923b68e2","observation_id":"c99a107e-aab5-4161-bf49-fc6faf62405d","resolution":{"observed_at":"2026-08-07T14:27:58.461152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.537656Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.537656Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:60bba0c050e890a2372f2d65f6c3539f877925908d4539f4ae386014c86c6ca6","observation_id":"71138f3d-3b55-4a3d-810b-bbe80cdb98c7","resolution":{"observed_at":"2026-08-07T14:27:58.537656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-09T14:32:31.404668Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-07T14:27:58.571076Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.571076Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:2484e60443a5dd73cff0a3eac1a99187d4c7a108a78723fc8ebc60f6c8f5f29f","observation_id":"ca3c074a-5b51-4347-af22-492564f5c003","resolution":{"observed_at":"2026-08-07T14:27:58.571076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:04.108999Z","title":"Analyzing and mitigating object hallucination in large vision-language models, 2024","venue":null,"work_id":"57de2594-8d68-4d9f-b319-7bd252524e40","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.666211Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:3780e9cb40bab64c52091dc7bc3b5aadc53f258ce1dcd3701c9b0815a2aa2dee","observation_id":"fa528f55-91e4-4b5c-92d6-3152234f2932","resolution":{"observed_at":"2026-08-07T14:28:04.156595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.979765Z","title":"Visual commonsense r-cnn, 2020","venue":null,"work_id":"37248dfd-4f30-4591-b1bb-5989ad63b593","year":2020},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.745015Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:06ba428c6f27869256de74745b4f230fc673aa4d9e08dae1da58864513b1dfce","observation_id":"f1ab180f-d3cb-4eb6-aa88-90abf58f5909","resolution":{"observed_at":"2026-08-07T14:28:04.015454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.843833Z","title":"MacQueen","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.843833Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:b4b08d22c04a2d825f975d726e3cbe6969f56d2cd098026e180c6266f6c0a0fb","observation_id":"3dc14a1c-bff5-4318-8d7c-d8b166c3f94e","resolution":{"observed_at":"2026-08-07T14:27:58.843833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.850606Z","title":"Object hallucination in image captioning, 2019","venue":null,"work_id":"58f8b646-5a82-4eb7-a44d-207722a7c0db","year":2019},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.918563Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:07d5430c9c2c53d675c7dcc39c6c58437bfe216a5d1614307bb58907bedf0fe7","observation_id":"daa1d573-0ee2-45df-82a6-c733af7d3eac","resolution":{"observed_at":"2026-08-07T14:28:03.903963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:58.993497Z","title":"Evaluating object hallucination in large vision-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.993497Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:c46123c37b309748572f29bd3f193cf326fd13eea94cb076e428c929735a988e","observation_id":"2f1fe67d-4edb-4a46-b477-f3beb4ae5965","resolution":{"observed_at":"2026-08-07T14:27:58.993497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.697718Z","title":"Contrastive decoding: Open-ended text generation as optimization, 2023","venue":null,"work_id":"4bd2b301-5430-41f3-9529-7cfdcab16e6c","year":2023},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.106265Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:4d3fdec1d18ba336aaf699663c6783c7754736568ac4e7277e7bd92ee0c1fc00","observation_id":"9674c5f7-15b7-49a1-b19c-93fb61f50c38","resolution":{"observed_at":"2026-08-07T14:28:03.773229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.235205Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.235205Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:9a207949011631cbfbbc05ab05c12aa4f67920cd5b0447c88951c584e679e462","observation_id":"fc61362c-e981-4bdb-9083-9c66bae216f2","resolution":{"observed_at":"2026-08-07T14:27:59.235205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.562160Z","title":"Investigating and mitigating object hallucinations in pretrained vision-language (clip) models, 2024","venue":null,"work_id":"3cde14a2-42a8-42e8-9ee6-97170f663a97","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.362395Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:8600d6830fd76a1f2ee43bc2cbbad756bce4b77dd99044d220e2ac6fcd369707","observation_id":"b746a2f3-02fc-4ac3-acf7-60c0d316104a","resolution":{"observed_at":"2026-08-07T14:28:03.617743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.434393Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.434393Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:211791015143ccd4c8ea515e612d005cb6853d3d73e3b12638637877e9afb2d3","observation_id":"d290a7c4-74f8-47dd-abc4-6ee9cd13dadd","resolution":{"observed_at":"2026-08-07T14:27:59.434393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.506999Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.506999Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:51463d85163cc54681b9d371cd66608a35388ff6b95683efd3913f91444e861d","observation_id":"9dc29557-bc34-4842-9399-c6f9662c3fa5","resolution":{"observed_at":"2026-08-07T14:27:59.506999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.601721Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.601721Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:7d9fd1f0034765014f9629e8ed3e5fc84ac76efc30750a162aad7e98672a3ccf","observation_id":"753a32f4-dd31-47ea-b15c-4844b9d83ea8","resolution":{"observed_at":"2026-08-07T14:27:59.601721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.720731Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.720731Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:cf3922935ae22e44b85e53f7e85d3e0765a93cc3fe1a9513b774f430cb818679","observation_id":"43c7ea7e-0584-47d2-88ce-fccab49a8b7b","resolution":{"observed_at":"2026-08-07T14:27:59.720731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.442240Z","title":"How attentive are graph attention networks?, 2022","venue":null,"work_id":"b9c5ecea-d43d-470c-b5ae-b989c66a62c7","year":2022},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.839090Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:4b7f0f6d39a6e9fd933df535e88f6dffd7fbc02f9bcaa8bd2f575411870d98f1","observation_id":"7749e5a5-5b12-4fd7-9c1d-c6419684f7a8","resolution":{"observed_at":"2026-08-07T14:28:03.477293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:59.939449Z","title":"Representation learning with contrastive predictive coding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:59.939449Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:15160ea749d37646751b587ff401422e7363685ef7af695d5c5d4c2fb8b52321","observation_id":"b1d0d87c-989d-46b7-8962-78310d944334","resolution":{"observed_at":"2026-08-07T14:27:59.939449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.330107Z","title":"Amber: An llm-free multi-dimensional benchmark for mllms hallucination evaluation, 2024","venue":null,"work_id":"9e68ca5a-5be0-42d0-bb78-0139f7e6a3f5","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.055109Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:235251242b668b01a23733d1608137efb37d1bb6040b807c97716d2cfd2ff687","observation_id":"f7d20a56-dad9-454e-84ee-ce2440358537","resolution":{"observed_at":"2026-08-07T14:28:03.368498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.139817Z","title":"Rlaif-v: Open-source ai feedback leads to super gpt-4v trustworthiness, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.139817Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:39441c142c646518e6475c0eb281a46af083155d262df79eaa3101dcd8f40f64","observation_id":"07e8f622-0b2d-446e-a608-8452ff67726e","resolution":{"observed_at":"2026-08-07T14:28:00.139817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.220061Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.220061Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:7910cbf478066e6ed78bea1d47f0a149220685350f962039a1495d79a7f940f4","observation_id":"8ff935af-12e1-4405-972d-6f519d351131","resolution":{"observed_at":"2026-08-07T14:28:00.220061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.157321Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback, 2024","venue":null,"work_id":"a12e8dfc-12ad-4a03-89fd-ed78653a5881","year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.334893Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:4f666c1a5117ce44be7f5b4e38000fe6a29732c536d175cbf731b8d02d09b180","observation_id":"8c0b4a55-ff0f-4e1e-961c-f2eac5669d50","resolution":{"observed_at":"2026-08-07T14:28:03.239667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06394","last_updated":"2024-02-11T08:38:07Z","snapshot_observed_at":"2026-08-10T16:13:51.164149Z","submitted_at":"2023-08-11T21:35:20Z","title":"Detecting and Preventing Hallucinations in Large Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06394","snapshot_observed_at":"2026-08-07T14:28:00.419075Z","title":"Detecting and preventing hallucinations in large vision language models.arXiv preprint arXiv:2308.06394, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.419075Z"},"links":{"cited_paper":"/paper/2308.06394","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:15c2bf10686d949c1abb6864abfa952295eb27f21b1db477cf2aa5d6f0ec9314","observation_id":"9f939dc7-ba98-489f-9e64-6bae9995da69","resolution":{"observed_at":"2026-08-07T14:28:00.419075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.534874Z","title":"Improving autoregressive visual generation with cluster-oriented token prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.534874Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:b0074aeca0bdf59f5c853aebc825537300be3191360c6c4e71a3a5dda9501291","observation_id":"33fc3616-d7f2-4208-8b10-2f96a8de2036","resolution":{"observed_at":"2026-08-07T14:28:00.534874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.632776Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.632776Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:3456bce39fea2b4162725cf07af8c64d9531d3d2c0f55cdb9a1197c3e0dab353","observation_id":"025eb8f8-29af-405d-b8c3-3c8e436fc15e","resolution":{"observed_at":"2026-08-07T14:28:00.632776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.731846Z","title":"xformers: A modular and hack- able transformer modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.731846Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:3c08817c3686a55b94df7e9c96f9df424763ad84a13a24002655972e5823f40e","observation_id":"9a84deff-d46b-4a13-bcc3-f97233d9048e","resolution":{"observed_at":"2026-08-07T14:28:00.731846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:03.003211Z","title":"Towards understanding how knowledge evolves in large vision-language models, 2025","venue":null,"work_id":"8f5bda9c-452d-460b-b323-1a6e9d8966c2","year":2025},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.851882Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:6ed95de1d7a1321b676dac0c34820d12c705b66225b47d7aac6229870d236062","observation_id":"16fa03d4-baf2-4ebf-832f-d4ab1b5bc399","resolution":{"observed_at":"2026-08-07T14:28:03.040706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:00.969597Z","title":"Eliciting latent predictions from transformers with the tuned lens, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:00.969597Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:ce226b94a5f606c43188baaa75ac05a27f7f86c62f26be46d8801fd49502c92c","observation_id":"de194522-6d68-42d0-8d0f-da12efce2775","resolution":{"observed_at":"2026-08-07T14:28:00.969597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:01.049963Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.049963Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:ef110c91c28512844af32cb0300a4ffa7f3be8591874c665779793276d077a6c","observation_id":"8b324683-1ab2-465b-baef-2262df2af643","resolution":{"observed_at":"2026-08-07T14:28:01.049963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:02.822987Z","title":"Describe this image","venue":null,"work_id":"f3fecf75-42fc-43ca-970e-7faf98d2c41c","year":2019},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.145859Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:96d5e398d11961cba8b2a4a381e724dc88f13f7f80c349146d0ebee8d8526016","observation_id":"6348c81d-ce38-476f-bec3-37fa3c5895ba","resolution":{"observed_at":"2026-08-07T14:28:02.887498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:02.645102Z","title":null,"venue":null,"work_id":"01defcea-9951-4bd7-89e6-ab58771ec08e","year":null},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.241938Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:0c7c5e7a06849f6d10e2fa37c19d0ee7615618e77dfbaaa0c133ce68c36d6cd8","observation_id":"0db4d7b4-cc36-4e1b-8d83-f68d860a0716","resolution":{"observed_at":"2026-08-07T14:28:02.748382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:02.484324Z","title":null,"venue":null,"work_id":"0e0dc5ff-9010-4f23-857b-00bb0ccbcbc9","year":null},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.325847Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:9cfbdb5a755bdb2968aeffc0a006d8eddfbcb09f0a3161554edff59820b8e3f2","observation_id":"2528ea71-57a6-456d-987c-7eb536a251f9","resolution":{"observed_at":"2026-08-07T14:28:02.580041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:02.335265Z","title":"as part of the object name in your result","venue":null,"work_id":"a4357b1c-fe54-42e3-b8f5-354fccc757fc","year":null},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.407202Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:7dccdedffaafa308959f1bb9c933e018b2b8e23550f426725ed8cefcdf04484b","observation_id":"04b546da-c988-4f3c-9889-3b96439ae016","resolution":{"observed_at":"2026-08-07T14:28:02.436217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:02.135550Z","title":"object 1","venue":null,"work_id":"f21c7b2b-5019-4cde-9172-a79511a04709","year":null},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.511814Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:12185c8dbfb4fdfb825f76a4b041aa19dbbc0cb0204b3c7aa462b31f71592568","observation_id":"8b50245c-21ca-45bb-be74-8f60c41aa8a1","resolution":{"observed_at":"2026-08-07T14:28:02.196414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:01.878397Z","title":"The image displays","venue":null,"work_id":"d16b45ec-e3cd-4006-9d4e-a67146167884","year":2000},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:01.636998Z"},"links":{"citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:3876baadb4271fbeee81cfb82e9e6804b687ab7a9b054ba00d96957bacc4f29c","observation_id":"e70a4590-37cd-4bb1-a6e4-6b2b491e44bd","resolution":{"observed_at":"2026-08-07T14:28:02.000062Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:18:25.298467Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 4 inbound Pith citation observations for arXiv:2505.21547."}