{"as_of":"2026-08-17T17:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58d6c0acdafee667cbbba8acd82af30f75d059e3b0bb9eca08ed347be18201e3","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:27:36.967307Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:32:15.287630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.297814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"cited_work":{"arxiv_id":"2504.15619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15619","snapshot_observed_at":"2026-06-30T06:54:20.297814Z","title":"Adavip: Aligning multi-modal llms via adaptive vision- enhanced preference optimization, 2025a","venue":null,"work_id":"d23dbd2d-88b3-4989-80db-de064ee137a8","year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:52:55.368187Z"},"links":{"cited_paper":"/paper/2504.15619","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:061063e8e5e8479721595bf9a2c4b4ea8ec9faba57c78e7ca95cc06fd7c23df4","observation_id":"96fb79cb-15f2-49a7-a315-a5403f276793","resolution":{"observed_at":"2026-06-30T06:54:20.299776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15619","snapshot_observed_at":"2026-08-02T09:32:15.287630Z","title":"Adavip: Aligning multi-modal llms via adaptive vision- enhanced preference optimization, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.287630Z"},"links":{"cited_paper":"/paper/2504.15619","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:dd0e1c7f7ef4cef829bff5f88b650defebcb0340260eb66f9121f85a9a09abd0","observation_id":"d05ecd30-59cf-4ae0-81dc-2c38046ca202","resolution":{"observed_at":"2026-08-02T09:32:15.287630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15619/citation-record","integrity":"/paper/2504.15619/integrity","json":"/paper/2504.15619/citation-record.json","paper":"/paper/2504.15619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T11:27:36.775609Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.775609Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:25ca8bd89bb00020516803ddb5769bc1b69a1405269b427a0c57d9e7350afa9c","observation_id":"093899e6-7095-4e10-b223-4ddb7bcf3d23","resolution":{"observed_at":"2026-08-16T11:27:36.775609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.781271Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.781271Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a445c22984eadf4f3dccc9c376e5256d77effe1b4f86afde1f1b8d33b18ef1f7","observation_id":"92150601-f9d1-4c86-bdd9-6a97ca3e59e7","resolution":{"observed_at":"2026-08-16T11:27:36.781271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.786299Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.786299Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a4a16aba228aed6cbb3727b68dad0281ddfa6c0c87a8d504a1de559696b44282","observation_id":"719192e5-89df-4588-bac2-e43d57f8e384","resolution":{"observed_at":"2026-08-16T11:27:36.786299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09215","last_updated":"2024-11-07T18:30:53Z","snapshot_observed_at":"2026-08-16T13:43:17.896821Z","submitted_at":"2024-06-13T15:16:11Z","title":"On Softmax Direct Preference Optimization for Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09215","snapshot_observed_at":"2026-08-16T11:27:36.791252Z","title":"On softmax direct preference optimization for recommendation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.791252Z"},"links":{"cited_paper":"/paper/2406.09215","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a232a3c757c384c92010778b7e44792be5d9d1d2c673b1018e3d68d4fe207162","observation_id":"d81c4bbe-ef1f-4e95-a20b-9f4be29fe3b7","resolution":{"observed_at":"2026-08-16T11:27:36.791252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.795638Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.795638Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:ab0d310b88d38c86687037acd7db957e6bb6a6fa7bb2d411285f0b8c72cc0839","observation_id":"bb9c2a54-d787-4175-94d9-5ca5817a5c73","resolution":{"observed_at":"2026-08-16T11:27:36.795638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14148","last_updated":"2025-04-21T04:04:53Z","snapshot_observed_at":"2026-08-16T13:08:11.080997Z","submitted_at":"2024-10-18T03:34:32Z","title":"Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14148","snapshot_observed_at":"2026-08-16T11:27:36.799901Z","title":"Fine- grained verifiers: Preference modeling as next-token pre- diction in vision-language alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.799901Z"},"links":{"cited_paper":"/paper/2410.14148","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:7c5666ef0da3e7751f85118d8bfd2d7743ed63e2fea2d4430330681f545365a8","observation_id":"d04cb186-8fa6-46a8-80e5-ebef887297ef","resolution":{"observed_at":"2026-08-16T11:27:36.799901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:27:36.804737Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.804737Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:49dc72013696b55be25b1ca96fbdae53bb13b2012a8365b522c797ccc5d44476","observation_id":"3a17869f-2166-42cf-8746-51fd6f8a1e80","resolution":{"observed_at":"2026-08-16T11:27:36.804737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.809824Z","title":"Token pref- erence optimization with self-calibrated visual-anchored rewards for hallucination mitigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.809824Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:35c1b36c7a077ac186e0ac83d902e814bbd6e6ded9e79fe40d22f9133a21705a","observation_id":"95945a37-ba21-4a3d-baa5-fdab24ce670e","resolution":{"observed_at":"2026-08-16T11:27:36.809824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.645846Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"b6e22595-56c7-4f95-8d17-6aebd880e6f3","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.814777Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:16df2811d8493e21fbc2ed6d0ced024ed183824f9951f4ed04c92acb3097da17","observation_id":"a6d22f44-da87-4636-b64c-3c08af0b715a","resolution":{"observed_at":"2026-08-16T11:27:37.650484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.632105Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language models","venue":null,"work_id":"3be50156-4330-4393-bebb-a7d85f474bab","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.819185Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:b73d507104eccf46d26cdaaace4468eb8c48a2aa86ca4019eab2be00c69b9cd3","observation_id":"d8808e51-ce19-4561-ba05-82f0bd35a36f","resolution":{"observed_at":"2026-08-16T11:27:37.636582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.823599Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.823599Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:2ef52440a5393c95d35b56510e4c1b7a0db26962abecd1e43b568962ec15fcad","observation_id":"eed9db34-3573-4c79-9481-0aebebfa17fd","resolution":{"observed_at":"2026-08-16T11:27:36.823599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.609265Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"c4f2fcfc-8da2-4f58-9244-d309379a93ec","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.828357Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:8ec7b8218046a0d758c876ae5e41090d415638f29dad8d541db2f7565f1dc210","observation_id":"7a39659f-7ac2-4425-9003-a4517094f08f","resolution":{"observed_at":"2026-08-16T11:27:37.613634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.595709Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"5bf6468e-2533-4d11-8f33-80f65175fcff","year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.832906Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:56452b34f90b6d3cf3b14c90fdba7aa595d46d57084a875c68c3d2acb552b79e","observation_id":"5a629912-dca5-4e7f-9a44-ec6495c14280","resolution":{"observed_at":"2026-08-16T11:27:37.600403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.581483Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"c98cea64-7326-46b9-a462-fec72e1ae361","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.837390Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:93930e580ae129910ccc7b8b0fd87e6de695d57e8ff2e2ddf9d1d0a220a2f734","observation_id":"4934d308-8fd1-44a2-b4de-e18754222cd3","resolution":{"observed_at":"2026-08-16T11:27:37.586286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.842748Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.842748Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:efcc5a8f766cf10ebd5088964e70837f44a6dc6192ab11c2d5188d1091035dac","observation_id":"82e1dca7-42f8-4e1b-a925-a5a10ba7aaf6","resolution":{"observed_at":"2026-08-16T11:27:36.842748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-16T11:27:36.846971Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.846971Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:053079659c78c905971a2ab6e01c1fbc00543cd368fa545ef20ae7e787dfbf63","observation_id":"424ef249-6884-4c4d-884f-fb2f98b8c06c","resolution":{"observed_at":"2026-08-16T11:27:36.846971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.851574Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.851574Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:c426eeaa581dee2e63d12145c1fa82d3909c3ff66edceb3c5e41740ffbd2fb93","observation_id":"130569f9-1b16-4e9e-8e42-4c1bcff895e6","resolution":{"observed_at":"2026-08-16T11:27:36.851574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01943","last_updated":"2025-02-11T03:55:29Z","snapshot_observed_at":"2026-08-16T10:13:29.780738Z","submitted_at":"2025-02-04T02:30:36Z","title":"DAMA: Data- and Model-aware Alignment of Multi-modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01943","snapshot_observed_at":"2026-08-16T11:27:36.855648Z","title":"Dama: Data- and model-aware alignment of multi-modal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.855648Z"},"links":{"cited_paper":"/paper/2502.01943","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:f430d7e1d90bc0c8e9407a0149c6a78bf4b6d2867513df9ddd5c6c494a67dc1a","observation_id":"5f4a199b-33f3-482a-8863-026fdecfdc87","resolution":{"observed_at":"2026-08-16T11:27:36.855648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T11:27:36.859960Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.859960Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:b50e389501bc4fef68577ababf4513c8cbddda2f66e854d680e4210fb745fc1f","observation_id":"125a8a78-1c1b-4aac-af6b-4f56387f5b13","resolution":{"observed_at":"2026-08-16T11:27:36.859960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.547812Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"643b1436-98fe-475e-81d6-c4e4d45ad4df","year":2022},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.865016Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:75475828feea52b31760cd3b4bb2f4062466d9891c530c035381bdca4142c98a","observation_id":"23502d6e-736e-4c68-87de-ac85f7769eb8","resolution":{"observed_at":"2026-08-16T11:27:37.552804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.533817Z","title":"The analysis of permutations","venue":null,"work_id":"2e5f3e2e-dff7-4496-80fb-942a8429cbaa","year":1975},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.868685Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:8dde0b0e9de7495b49b7333d98f5795eaf2c6a2d09d50515ed14495538964e78","observation_id":"adad47df-3b0a-4954-9301-9987268c5d02","resolution":{"observed_at":"2026-08-16T11:27:37.538273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.872489Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.872489Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:5d9b98931f6c75a858ea50fceac44c0eec8d478aa31a4d93a85bab679eb32f92","observation_id":"dd965f93-ac32-4fd8-8348-4841393b0271","resolution":{"observed_at":"2026-08-16T11:27:36.872489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.510889Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"84a82144-0aaf-4b21-89ea-ccca60d033f5","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.876456Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:329aae515f301ab7667638bb2a27e192c4fd89f586df59d6be05370572fb5214","observation_id":"e26f40fc-0a66-49a1-8279-52db45feb442","resolution":{"observed_at":"2026-08-16T11:27:37.515321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-16T11:27:36.881296Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.881296Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:7243495a622bf448763727da64ccb3a52f7f10a2f54ae23b26d185ff279a1a2b","observation_id":"e19d75d0-46dc-46b5-b2e6-f4718afbb906","resolution":{"observed_at":"2026-08-16T11:27:36.881296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:27:36.885833Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.885833Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:f222e9d84b61182065831521935d8eccb082efe9f8c8101caa647fb1416048c4","observation_id":"3f03910b-e67d-4962-94b5-a4567d505901","resolution":{"observed_at":"2026-08-16T11:27:36.885833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.497098Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"e89a7767-d94b-419c-93a6-22b06c9ffafd","year":2019},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.890601Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:60484a30433d7352b84296ea97e5d6f7433d7e970cc4038489010d8b85023111","observation_id":"37f7f5e2-deb2-4bf3-a4a3-a7ad16d48696","resolution":{"observed_at":"2026-08-16T11:27:37.501824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.483046Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":"9fca0fc3-aa67-40b1-b01f-f7f52e3411f6","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.895020Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:eac7532330f604391f0f27330d90fe0dd040c153031b84b60f65cdf8f1aeb8b2","observation_id":"1214fcfc-d56e-4ed2-9e45-9a34c45751bf","resolution":{"observed_at":"2026-08-16T11:27:37.487560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.468900Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"a677696d-0c45-4953-979a-109a3c1c929f","year":2022},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.899747Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:24557ba1c8f552c003c14fd0b08ee2a136e6a274262782e1ea45f9535f4db029","observation_id":"ee3e42fc-198b-4fbc-baa8-8b677aebf1ee","resolution":{"observed_at":"2026-08-16T11:27:37.473590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.454530Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"b7fd0fe5-88f5-4676-ac6c-c68173d64630","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.904069Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:6b74922a9cb9c42805f2ae6068a31e35f4ca9fb8a53fa31f941b9bad9f7a9457","observation_id":"c1c23691-359e-4934-86a2-7da63f6ed46c","resolution":{"observed_at":"2026-08-16T11:27:37.459135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-16T13:42:07.514023Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-16T11:27:36.908291Z","title":"mdpo: Conditional preference optimization for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.908291Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:6e1d08dcf9662b797eb787cd9195e77231d5ef9df5a39af0a5e3d9e9a367a4be","observation_id":"2d99a1ee-41d2-498b-9578-1562c7ca1bd3","resolution":{"observed_at":"2026-08-16T11:27:36.908291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-16T11:27:36.912762Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.912762Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:09391be50c9d87e87fc45afcc41fda395a606711ab2a40c25093fa73fd5f1d46","observation_id":"7de03321-57d7-460a-8924-106a1a52e5c4","resolution":{"observed_at":"2026-08-16T11:27:36.912762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.441493Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization","venue":null,"work_id":"5fd6c0b3-d982-484f-abc6-a8b52b945338","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.917543Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:ccf1b4307dc2403108bcbd53be93897fbb471b224cd4529a2afd9779afb66fd1","observation_id":"5f2e13fd-6b91-40ca-b3e9-fb4316cd8b43","resolution":{"observed_at":"2026-08-16T11:27:37.445952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.429347Z","title":"Miti- gating object hallucination via concentric causal attention","venue":null,"work_id":"10538607-efb9-444c-bbe0-057d26c681a1","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.921589Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:878bc96ac7dfe8d7251223a5beed188004d40ad6e8396cc1f8097252e7b1a4f3","observation_id":"b1706a88-95c2-4dc8-91d8-c7a31db28773","resolution":{"observed_at":"2026-08-16T11:27:37.433369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.413796Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":"7cd7c413-dca2-4fb5-aaca-64d5deff214e","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.925145Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:7eb31025ce2fd36e86806b92652e74980140a99db1e132b2c5b54670e8d25e3f","observation_id":"543e52e2-b383-42e1-b31c-521ecae710f5","resolution":{"observed_at":"2026-08-16T11:27:37.419164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.398811Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"59228e65-8dff-43f0-8e75-96fdc932314b","year":2020},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.928913Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:434d9e5bb11a87158db079fb0a1129ffa17e2541b9dab1745c99ce8288f4dba5","observation_id":"1b7b53f2-0ecd-44f9-8737-94a9d76baf2e","resolution":{"observed_at":"2026-08-16T11:27:37.403148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.383499Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional hu- man feedback","venue":null,"work_id":"84a044cd-25cc-4eb8-b90a-46e62b5d49d6","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.932671Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:b84aa7b3f5642653a1805169b52cd7e82692642cc68ccf7e6397e833aba4bb60","observation_id":"6ac5f39a-6808-4e98-a437-78bec96e61a2","resolution":{"observed_at":"2026-08-16T11:27:37.389025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.936265Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.936265Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:521c9b7a19d8260b6104310824ce786882b6108c1675cffbd4c3c3ebd30698d0","observation_id":"a5b3b0f2-d9a5-4cd6-b1e4-0139ba3583ec","resolution":{"observed_at":"2026-08-16T11:27:36.936265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.368826Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive","venue":null,"work_id":"cd4d3427-61c6-4b5e-8016-074038377b87","year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.940132Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:7be24ede89ec05442b1d9119df6a20babd634a78dfd44692048e7a085f8f65e7","observation_id":"73ad28ea-13da-4df4-b350-6544a29966c6","resolution":{"observed_at":"2026-08-16T11:27:37.373451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.354902Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object de- tection","venue":null,"work_id":"d3633487-006f-4553-a5af-6c3e9e427c8f","year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.943904Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:1bd6b659cd8af86c09a6cfd5c35792b83b572e00c97305c250e206614bfe2d73","observation_id":"45faf425-0cfa-479f-8119-e2b3bd570cd4","resolution":{"observed_at":"2026-08-16T11:27:37.359000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.337824Z","title":"Automated multi-level preference for mllms","venue":null,"work_id":"bc81495f-8510-4216-b91f-992ae010852a","year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.948595Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:5f5fa6fe8c9a7d256a7f77f46b806a480569b064cfca332f5eab5d3b1cfb0182","observation_id":"01843850-9619-4c58-b617-ebe5e29f0e00","resolution":{"observed_at":"2026-08-16T11:27:37.344886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-16T15:26:15.090405Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-16T11:27:36.953580Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.953580Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:bce97806793aa8d3ae9db80b0535a189cf7f60b588b00b1348b17623a1a6e485","observation_id":"44b884ca-911e-4888-bdc4-d7fd8c394d63","resolution":{"observed_at":"2026-08-16T11:27:36.953580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-16T14:18:52.863427Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-16T11:27:36.958272Z","title":"Mitigating object hallucination in large vision- language models via classifier-free guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.958272Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:926c33249c64f47672b0be4ff5015dc405c72c3b6ac1e998e203511d0bf0faed","observation_id":"692784a0-41d9-449d-ae1a-f18255bc8761","resolution":{"observed_at":"2026-08-16T11:27:36.958272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-16T19:33:05.632918Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-16T11:27:36.962572Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.962572Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a475add35ed090863de8b4b2b972121ed5c8892eccfbe0f6b4b19f445d76047d","observation_id":"e37eccb4-077b-490d-8871-adb8cb90c6ee","resolution":{"observed_at":"2026-08-16T11:27:36.962572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-16T11:27:36.967307Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.967307Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:9c45edfd68ea0c64d7c5f917d00bd6ce7980c5054da0a73d31da2b3643120db6","observation_id":"332e1d13-7462-41bc-a4f0-d5d64fe41616","resolution":{"observed_at":"2026-08-16T11:27:36.967307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2504.15619."}