{"as_of":"2026-08-10T15:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9735f0f2bead60f3f1b89e951d9c5027684ec3768dcee0a7e9368998cc07348a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:02:45.221151Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:14:36.819533Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00717","snapshot_observed_at":"2026-08-04T08:14:36.819533Z","title":"Mint: Mitigating hallucinations in large vision- language models via token reduction.arXiv preprint arXiv:2502.00717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.819533Z"},"links":{"cited_paper":"/paper/2502.00717","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:6fc2a3e63b76c631feabebbfe3e31ab27dbc36cd8c6606a30dd4505db76114f2","observation_id":"fd86c048-156a-4a5a-8069-44b7abf78f3a","resolution":{"observed_at":"2026-08-04T08:14:36.819533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00717/citation-record","integrity":"/paper/2502.00717/integrity","json":"/paper/2502.00717/citation-record.json","paper":"/paper/2502.00717"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T18:02:45.050009Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.050009Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:4a4dcad4113ccb12cfcbe5424b21a9d6929eb6abfeafa4e0c86f03da8c798728","observation_id":"3b22dc06-eb47-44c9-9f03-282b443d89b8","resolution":{"observed_at":"2026-08-09T18:02:45.050009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-09T18:02:45.055692Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.055692Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:1de3bebe325fd01269d182fb98c61e01fec787fe1165518f08f3b738752e63d8","observation_id":"343c750e-369e-41c8-9f7d-1aea43af12e6","resolution":{"observed_at":"2026-08-09T18:02:45.055692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.742798Z","title":"Y., Bhiwandiwalla, A., Tseng, S.-Y., Olson, M","venue":null,"work_id":"02807acd-22ef-403e-8d4d-86de16bd7d28","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.060876Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:71f2b9f991f4b2a33500976d7a4eb1ad003ff1cf0211187e53970dc04728b55c","observation_id":"ab325d68-16af-4cea-b535-77d1c8190fff","resolution":{"observed_at":"2026-08-09T18:02:45.747062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.067233Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.067233Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:584fe00dedac25be6d0700a798805ca542a64d9db659ebede9329fcaecdd27ec","observation_id":"9559d8da-160f-4045-9d0a-02a68d05ef0e","resolution":{"observed_at":"2026-08-09T18:02:45.067233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.718740Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"a2f0bf21-b472-405d-8af9-373037d4aa65","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.072247Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:a4f6805aca1eac05adbacac6557facaf40db231d439236e64581e9d884683367","observation_id":"383ebc9f-4bf6-4de8-bc9d-85bb801cb0f0","resolution":{"observed_at":"2026-08-09T18:02:45.723271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.703527Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"1e973c4b-91b0-4bb6-a6f5-63acba213250","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.076964Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:15b25c3c1069374b8aa39bb4ed9f17f6ce7ba9673de322b2d576f97e1f7b2bee","observation_id":"f88f5eed-8fc8-4fd3-bb2b-bb5685368e1b","resolution":{"observed_at":"2026-08-09T18:02:45.708557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.082246Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.082246Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:76e4cc21f2dad1ae376b9701b82d7a15e52619fd2b3a15864f480d81c6905712","observation_id":"89cc4221-5b42-401d-86b6-b2dbb14f532e","resolution":{"observed_at":"2026-08-09T18:02:45.082246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.679864Z","title":"Vision transformers need registers","venue":null,"work_id":"4cfc6bee-f589-42f4-bcee-f8429eaa50d6","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.086650Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:543a8a10e5a1e5245c690de26da9122315283cdb3930a6ea2b46b94fdfd5c01f","observation_id":"d6157353-10cd-43f9-86e8-79faf796d208","resolution":{"observed_at":"2026-08-09T18:02:45.684270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.665085Z","title":"Intern LM - XC omposer2-4 KHD : A pioneering large vision-language model handling resolutions from 336 pixels to 4k HD","venue":null,"work_id":"a6a06a61-56e6-4051-99a8-1a723fa48224","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.091136Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9778e011f056b446ceb96e3d2ee9c444bcb73f5070b014601c2edc4eefdc0764","observation_id":"5bf0cfb9-7f44-40ca-a3f1-b9f54ccac391","resolution":{"observed_at":"2026-08-09T18:02:45.670033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T18:02:45.095827Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.095827Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:071e8a3d24f289f91dff67bfedab8cb0391b6d99390a4f7ef0e9e26671797af6","observation_id":"e372e6e3-31ba-4f6a-865b-bc629db98ea6","resolution":{"observed_at":"2026-08-09T18:02:45.095827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-09T18:02:45.100605Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.100605Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:0e887f049c2d193c2297bfaad3b9c25f2f1a85089974a0438c902c77ae013a86","observation_id":"2f08a5cf-e9aa-4df2-b351-654abf5b0a14","resolution":{"observed_at":"2026-08-09T18:02:45.100605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.646946Z","title":"A., Ma, W.-C., and Krishna, R","venue":null,"work_id":"c6be128e-3841-4503-a78b-8f5a74a8675d","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.105324Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:44de125beedb1b268c1b168f9f76105df2616565465cfe6b520b2885bf057cf8","observation_id":"95cfe3cb-7e6d-4a2f-baa9-b6167e64caf6","resolution":{"observed_at":"2026-08-09T18:02:45.651387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.109865Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.109865Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:48327f8ad29710e7293de29b1ba4156858ba391a5220bccb977fc70627bd0d71","observation_id":"4ffa2056-e84d-400b-a949-dc8d7f4c3210","resolution":{"observed_at":"2026-08-09T18:02:45.109865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.114157Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.114157Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:87605db882f0cdf7513db5d527cbe06fc50ae06bfc842262102a7fb092207f6b","observation_id":"3a2aeaed-9f09-4a0f-a3b5-70f50e8d4156","resolution":{"observed_at":"2026-08-09T18:02:45.114157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.118566Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.118566Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:8fe7206c61053832cd0d9a65f75a78d081ed3db5024ac3b4136afdbb61e51c92","observation_id":"30b95d8e-1ec7-475b-afcf-3c95fb442e79","resolution":{"observed_at":"2026-08-09T18:02:45.118566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.122378Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.122378Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:8f532b1e68f27207fdc9c187832ed633daa7d2bbedcf9cb55ca347b724903bd0","observation_id":"349682b0-1ac4-443d-82db-dc44b05e0421","resolution":{"observed_at":"2026-08-09T18:02:45.122378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.594590Z","title":"L., Holtzman, A., Fried, D., Liang, P., Eisner, J., Hashimoto, T","venue":null,"work_id":"fcffd5ca-b917-4479-9f51-eb9f68d95aa8","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.126301Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:8799930d714eb29a16ec48e50189e51bca4a0f4f5d74d8b272e4ac7017e9bfad","observation_id":"64779bfe-e615-4e27-a556-e84bd1fa8e30","resolution":{"observed_at":"2026-08-09T18:02:45.599498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.579874Z","title":"X., and Wen, J.-R","venue":null,"work_id":"c26ef643-47ee-4a67-9198-0310a24318b2","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.130189Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:b9fa1054f66a4ad958c1b90b91dec5a2e9e32066ce4f62375c7a2c31a5c6c385","observation_id":"f62d742f-848e-496e-880e-a38e7393ee98","resolution":{"observed_at":"2026-08-09T18:02:45.584380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.134091Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.134091Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:a5d36770e7f0fdca0ce4dd25a87343699d9c3e3cb17996c4ca4b0e4a21415c97","observation_id":"781cc07a-de18-4ce9-95aa-a5efcc45a1b3","resolution":{"observed_at":"2026-08-09T18:02:45.134091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.138911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.138911Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:7060dba827fc6a0c2ec359c70b69c727eefd22acb683321e7f8145f03138534a","observation_id":"5672227d-54e7-428c-8ba6-7beafcbbd65c","resolution":{"observed_at":"2026-08-09T18:02:45.138911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.142715Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.142715Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:614007e05026a4eb8cf533d8651b3fcd62f904b6d78b93b34d3a15b5ca7408bf","observation_id":"571167a3-04f2-4dbf-9284-baab24b883aa","resolution":{"observed_at":"2026-08-09T18:02:45.142715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.146514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.146514Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:6aec413896d9e69d0d873688a6994b716dc3d78fd2c53ede54d5584e189bf7bf","observation_id":"97b06fc0-2d68-42f4-b18d-11fab6096eee","resolution":{"observed_at":"2026-08-09T18:02:45.146514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.150444Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.150444Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:06b114fcd0502cef45280663bb6d836a032b0e9f01afc6ce91f03790885c610b","observation_id":"0252356e-de8d-423d-9efc-932b5513b6eb","resolution":{"observed_at":"2026-08-09T18:02:45.150444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.154459Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.154459Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:53e4b816c72cde09d24045a33902e0cc90daea33750af12eacc1b4f4773b82af","observation_id":"08b1f8ac-079d-4cb0-9e07-ee0e7ba93298","resolution":{"observed_at":"2026-08-09T18:02:45.154459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.509646Z","title":"A., Burns, K., Darrell, T., and Saenko, K","venue":null,"work_id":"0c856928-7b3d-4f4c-af8c-3b712431bc3b","year":2018},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.158411Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:edd680a301379b3a5e5fca28cae51e32c5a98e4221a52714386c3daae48f62d2","observation_id":"ebedfd82-17f5-42e2-aff5-020d954ec983","resolution":{"observed_at":"2026-08-09T18:02:45.514090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T18:02:45.162801Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.162801Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:2b94d42e577f93fa8f3f3e804da7b50fd579c7e0c21d01d157bf9f82df48b202","observation_id":"ce2b2060-7f87-46b3-8445-9512446e5bbb","resolution":{"observed_at":"2026-08-09T18:02:45.162801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-08-09T07:55:47.071847Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-09T18:02:45.167476Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.167476Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c00864cc9b703d93acbe351b4c8de5787dcea005a3dc73c643fe266d4b597b31","observation_id":"d0aff9bc-1a78-4a8b-825f-341e3ee67787","resolution":{"observed_at":"2026-08-09T18:02:45.167476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.495557Z","title":"Dilu: A knowledge-driven approach to autonomous driving with large language models","venue":null,"work_id":"d42a8328-3b12-47ff-8bfe-a5732d230568","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.172458Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:980a2b3c50c9bffd0e28ee5f83d0f3e1a0f75295b9ed91bb45c89a4c4b8b1a22","observation_id":"6329c177-7233-409f-9149-ae22f4970fcc","resolution":{"observed_at":"2026-08-09T18:02:45.500108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.481415Z","title":"Q-instruct: Improving low-level visual abilities for multi-modality foundation models","venue":null,"work_id":"65434621-a422-43f4-a9a9-010482d89987","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.176770Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:34c39d5a9ef3114f3e86af7e94abf3f46467a4e18b100099f9681c8f7e9f6b7c","observation_id":"369c3dfa-6660-49a0-befb-f956d42bfe32","resolution":{"observed_at":"2026-08-09T18:02:45.485571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.468973Z","title":"and Xie, S","venue":null,"work_id":"c262b1d0-7d93-49f2-9e9d-35a6664afdfc","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.180929Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:b81cdda81427f23494ff9614d1b7feb0e240fa71887296feaf53034f7da0b52a","observation_id":"cf895cd9-62e4-4ca5-99a7-5fabac22c513","resolution":{"observed_at":"2026-08-09T18:02:45.472927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.454597Z","title":"D., and Potts, C","venue":null,"work_id":"39cb4406-973a-4984-863a-1b69aa56e187","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.185361Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:728d0c070ad80f63974afe982efba82148535c10b98660ef4802112b18b906c8","observation_id":"e776ef32-e83d-4066-a204-ccbd657f4f72","resolution":{"observed_at":"2026-08-09T18:02:45.458914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.440361Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"04b00f0d-cf72-4ff0-9f6b-44f9d8eb0b3a","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.189945Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c23651cf14584dd69b881bc344ee6cc3d3230fa484c1aaf43be3c544aaf51be2","observation_id":"e619e128-cb61-4748-b43d-8ae82552b336","resolution":{"observed_at":"2026-08-09T18:02:45.444862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.425861Z","title":"Multi-modal concept alignment pre-training for generative medical visual question answering","venue":null,"work_id":"ae0f76cf-66f5-412b-8a09-fcd7c08a3a05","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.194609Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:a309edd15aa00e75d423761243380ad0904aa1cb7211d6b2d28c29dd47d3e2ee","observation_id":"e9bbe534-fe4a-4a91-a9c7-17caf404e538","resolution":{"observed_at":"2026-08-09T18:02:45.430732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-09T18:02:45.199090Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.199090Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:52556bfc115b77d8063b78032ecd473d38c128a1ffe0119fddda5003b557808b","observation_id":"af8a30b9-e676-481c-b2c3-9729c9a16f13","resolution":{"observed_at":"2026-08-09T18:02:45.199090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.411487Z","title":"Attention prompting on image for large vision-language models","venue":null,"work_id":"e9d7ddec-cf7b-4024-a58a-aae1234f904e","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.203690Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:ede91acb5011c81ceb86728744f744b676c1bb7428819e961d831d13a1bd6f62","observation_id":"eca925e7-d6ec-4a08-a5f2-101acc3a8cdc","resolution":{"observed_at":"2026-08-09T18:02:45.416106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.396508Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"e8f0a008-07b9-4970-8d6f-a3832911e3be","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.208263Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:e8c719c138b5b5c35c926979ef17c279b6f32475d5fd51d0819791afe13158e2","observation_id":"682319d0-9100-471a-960d-3840f09aa90a","resolution":{"observed_at":"2026-08-09T18:02:45.401593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.379826Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"818a06de-7dba-4072-b24b-f84d9a9b4592","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.212469Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:02a559f5be8ec2eca0cb26186be44c41384b09ab9bad4a6d152069ef7aa1e3c4","observation_id":"6eccde3b-c143-49ff-b44d-ab87ed1cf2ea","resolution":{"observed_at":"2026-08-09T18:02:45.386299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-09T18:02:45.216603Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.216603Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:f4b7f646cf2998fd7103429bc1c228db6d5a3c12cbbf9f97d8a82a306812b085","observation_id":"c8558b2e-e214-4e40-ba7c-19c2b880d798","resolution":{"observed_at":"2026-08-09T18:02:45.216603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.221151Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.221151Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:975ba0f429b1b075d068dd2bb41a88e045967c8f920f8d6ee3d46ae03583c36f","observation_id":"5cc824b5-e1ea-4247-9981-92659d3c69a5","resolution":{"observed_at":"2026-08-09T18:02:45.221151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:56:43.542313Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2502.00717."}