{"as_of":"2026-08-11T12:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:999e086c09e221145b4c13b49af5a175bcb96039b83e239ebad912399b0df049","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:58.964182Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21061/citation-record","integrity":"/paper/2505.21061/integrity","json":"/paper/2505.21061/citation-record.json","paper":"/paper/2505.21061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T13:45:53.250462Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:53.250462Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:087772a2de6518d5049b85cc809f9a5e52f4783c4e3523793f6b90d7d833b010","observation_id":"59d38f09-1875-4ad4-8d1b-e208bda20790","resolution":{"observed_at":"2026-08-07T13:45:53.250462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00530","last_updated":"2025-01-07T20:36:35Z","snapshot_observed_at":"2026-08-10T04:21:43.019639Z","submitted_at":"2024-03-31T02:05:40Z","title":"Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00530","snapshot_observed_at":"2026-08-07T13:45:53.369052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:53.369052Z"},"links":{"cited_paper":"/paper/2404.00530","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:4661c49ee2b8ef8827d44bf90fbd3c4e77236c9c77fbe89ea27f88e32764eb51","observation_id":"a5bbb1e9-fe0f-4198-ac77-325b3bf4948c","resolution":{"observed_at":"2026-08-07T13:45:53.369052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00784","last_updated":"2024-04-27T01:53:39Z","snapshot_observed_at":"2026-08-09T03:33:29.453781Z","submitted_at":"2023-12-01T18:59:56Z","title":"ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00784","snapshot_observed_at":"2026-08-07T13:45:53.573721Z","title":"Meyer, Yuning Chai, and Yong Jae Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:53.573721Z"},"links":{"cited_paper":"/paper/2312.00784","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:4674ceef4659353cbaa4ef6b666eaaeb12a3574734157ea110c8cfdd7b7830eb","observation_id":"cf14ef7f-11e3-4a74-9ed1-e4f5ea5cb9e4","resolution":{"observed_at":"2026-08-07T13:45:53.573721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:53.721316Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:53.721316Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:999b4bebbc98824f340309b28de186444f033a172498c5f85965984f40f8080d","observation_id":"7f8739cc-6371-4187-80b5-c4f08bbe1acc","resolution":{"observed_at":"2026-08-07T13:45:53.721316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:00.586124Z","title":null,"venue":null,"work_id":"e1a676c8-ea7d-407f-b941-013c1b654e63","year":2007},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:53.845950Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:93a7165ec446aec2bc4890f1f3721e37d64c80dda1a449b5626f2e0e2fd04ff2","observation_id":"dbc556e3-7652-46da-b642-0c158d32d31d","resolution":{"observed_at":"2026-08-07T13:46:00.630261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17270","last_updated":"2024-02-22T13:05:52Z","snapshot_observed_at":"2026-08-09T16:14:37.195905Z","submitted_at":"2024-01-30T18:59:38Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17270","snapshot_observed_at":"2026-08-07T13:45:54.052711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.052711Z"},"links":{"cited_paper":"/paper/2401.17270","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:7f163d6f9f0899f4de296339fc4d7fd6f26f8387913072734908b39b49b3f666","observation_id":"e460de43-6e9f-4cfe-b620-3d36cf21da78","resolution":{"observed_at":"2026-08-07T13:45:54.052711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T13:45:54.131584Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.131584Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:66d91feac4ae7b38bd573fa82620fa65131575e3370934d6c526724393668a2f","observation_id":"a4e64ed9-1acf-4cc7-855f-f52845c5b5e6","resolution":{"observed_at":"2026-08-07T13:45:54.131584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-04T15:18:22.654819Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-07T13:45:54.210668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.210668Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:755c6b6d11a7b689b3a38134fe59724f47871727b86a2f85e19237a426ae6ec2","observation_id":"bb7b27b4-f7fc-4012-b787-d561deeb4668","resolution":{"observed_at":"2026-08-07T13:45:54.210668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-07T13:45:54.319696Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.319696Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:3787bb4352dfd40c87212026878852052e32cfcc423aa88bb552beb10cc6966f","observation_id":"18ee7bf8-3c84-4dfd-8f01-176928648ee6","resolution":{"observed_at":"2026-08-07T13:45:54.319696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-07T13:45:54.410950Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.410950Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:c591fdd9b7b31cc9c6b50e6a466d7b4b0ca03947930d35edefbfa8b8694412a5","observation_id":"3819cefe-d47f-4874-8524-04be070ffac7","resolution":{"observed_at":"2026-08-07T13:45:54.410950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-07T13:45:54.523163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.523163Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:941fb5d3ceb5d1d2aba2858db2a0adae51364bc712a7a930569350421e74e4f6","observation_id":"7a114a34-461f-4164-9aeb-051344d34b50","resolution":{"observed_at":"2026-08-07T13:45:54.523163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:54.680509Z","title":"Hadsell, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.680509Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:60d61e45d64dd90d86ed54030592da7ca4fb188b2dcca4d6f1956bc391e3f3f5","observation_id":"17d65380-ab35-4e7e-be04-f222e2487c36","resolution":{"observed_at":"2026-08-07T13:45:54.680509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T13:45:54.771659Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.771659Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:731a1ad4f6436d482c85b12cac97c8b941826c00bfccf1152547314c6118eb8c","observation_id":"d96d496f-ae5e-42c7-806e-5bf959e673c9","resolution":{"observed_at":"2026-08-07T13:45:54.771659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:54.854787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:54.854787Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:bc1bdd41b07fefb4893be0bd2b45c65d1864ab347d8324cdf379b10d6b06c42c","observation_id":"0bc04ca2-e2c3-4670-997d-e28522a7cdd3","resolution":{"observed_at":"2026-08-07T13:45:54.854787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:45:55.009000Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.009000Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:c1c6dd500e4eab68d6e814fc8cab096741e6eaa1806ab3965785cff91b7e168a","observation_id":"93ac7471-9d73-447d-a326-57aa9bac8fea","resolution":{"observed_at":"2026-08-07T13:45:55.009000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T13:45:55.102776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.102776Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:3aa375f9dffaca3340275d50c9f5c95b0d71d178e12f7d9ed506262fcbdc1d45","observation_id":"4fcac7c7-f49a-430a-80cf-8995fbf9fffe","resolution":{"observed_at":"2026-08-07T13:45:55.102776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T13:45:55.178315Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.178315Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:e9dfd7d74833d52305d2c525cea16fd4225b9d8bd74a423cb92378f5acf0bbc8","observation_id":"33fe8ba4-4dc3-4704-aafd-3cccd388b715","resolution":{"observed_at":"2026-08-07T13:45:55.178315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16566","last_updated":"2023-05-26T01:18:52Z","snapshot_observed_at":"2026-07-06T15:33:42.279377Z","submitted_at":"2023-05-26T01:18:52Z","title":"Integrating Listwise Ranking into Pairwise-based Image-Text Retrieval","version":1},"cited_work":{"arxiv_id":"2305.16566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16566","snapshot_observed_at":"2026-08-07T13:46:00.008614Z","title":"Integrating Listwise Ranking into Pairwise-based Image-Text Retrieval","venue":"cs.CV","work_id":"da8664a8-bcbe-4f26-8f0c-b6dab33cb937","year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.277278Z"},"links":{"cited_paper":"/paper/2305.16566","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:918a99581aa83e6ec6a4b4bf84d8e84f4ac2578ae7fadf2334b902144b8c70ca","observation_id":"f82dec66-d409-4513-af2d-07c32c7e2178","resolution":{"observed_at":"2026-08-07T13:46:00.077499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-09T18:37:19.036481Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-07T13:45:55.390063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.390063Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:28b1b381d2d4e7c171f6ff344827a4fcfb081cedefaa736f81509ada2b2ae2ca","observation_id":"1ebdb2ac-b14b-4722-991f-169e278f991f","resolution":{"observed_at":"2026-08-07T13:45:55.390063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T13:45:55.466261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.466261Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:0f0bb979e81c4d8577cd594034b725bee44829809d7fc06d519426bb19c88303","observation_id":"09b1de9c-9a08-4aa2-b00b-9ad0c3d858f5","resolution":{"observed_at":"2026-08-07T13:45:55.466261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T13:45:55.571669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.571669Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:9b2c3779cbc87abc572fdd88e6e01fdb7a2c9def3cab1d71b357955c1fe38d99","observation_id":"e6db6119-d1c9-4791-9265-1c81a41f8863","resolution":{"observed_at":"2026-08-07T13:45:55.571669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:45:55.711948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.711948Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:33d1eac925f63e77640416b893d1e689f19ca857e029c7b669d9dd370aac3a06","observation_id":"64f3b64c-a6b2-4a97-ac85-ff154cf31b4a","resolution":{"observed_at":"2026-08-07T13:45:55.711948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T13:45:55.816724Z","title":"Liu, and Xuanhui Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.816724Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:a765eb103e5cfa42428799169322d68756ec971c1dec7672388cbcabdba88aff","observation_id":"8d7eba4a-3ff9-4c93-ad87-bddebd038360","resolution":{"observed_at":"2026-08-07T13:45:55.816724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T13:45:55.878822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.878822Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:bc7f6d19ed29469361954e221837739d97b952795885978a0ec1f45b7d55e61e","observation_id":"351d1a80-924b-4edd-b9c1-fef3035bda62","resolution":{"observed_at":"2026-08-07T13:45:55.878822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09683","last_updated":"2024-05-22T13:00:02Z","snapshot_observed_at":"2026-08-04T22:40:33.196944Z","submitted_at":"2023-06-16T08:27:46Z","title":"Scaling Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09683","snapshot_observed_at":"2026-08-07T13:45:56.035204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.035204Z"},"links":{"cited_paper":"/paper/2306.09683","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:2c77102f8bcaf5e670a9053cc29ab3e8922d8d6f1ba0ca13922ac70a86d6e91f","observation_id":"7aec114e-e393-45d5-b967-ab8e5c35643e","resolution":{"observed_at":"2026-08-07T13:45:56.035204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:45:56.118797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.118797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:69f7c30b19eb213bca8aa78d710e9de62e48caa134c622cb822f8a48f0e7848d","observation_id":"e3257c19-2265-4c63-b10c-146b0b36249a","resolution":{"observed_at":"2026-08-07T13:45:56.118797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T13:45:56.176366Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.176366Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:ef58095c75fe2e94178465a98ab655bda5d1a19a438dcec02ccd8c5ccd9259bb","observation_id":"09251261-72e9-42b7-83b3-fd4144265182","resolution":{"observed_at":"2026-08-07T13:45:56.176366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08730","last_updated":"2024-04-03T15:22:23Z","snapshot_observed_at":"2026-07-06T17:44:04.908253Z","submitted_at":"2024-03-13T17:29:45Z","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08730","snapshot_observed_at":"2026-08-07T13:45:56.237159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.237159Z"},"links":{"cited_paper":"/paper/2403.08730","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:ab18879276474d1b70fbf27dd5bdb90493cf3fab4b7c617ab42e628699e8236f","observation_id":"881e100c-4a68-4ef0-b55f-329b5d5fff0b","resolution":{"observed_at":"2026-08-07T13:45:56.237159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T13:45:56.341007Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.341007Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:375025355943794ed6ce54c9f426ac1a4bfef62a21c4cf09fe20c8eb7ce4e926","observation_id":"afacd7eb-405c-4909-b3fb-0818e3aa0374","resolution":{"observed_at":"2026-08-07T13:45:56.341007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-07T13:45:56.463830Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.463830Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:8d4f64056283bd901dde87d958467b943cd13f65c6e6c524a4522440d408a4c5","observation_id":"1f48987a-b6cf-4740-8b1a-bc95027adc3c","resolution":{"observed_at":"2026-08-07T13:45:56.463830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T13:45:56.530238Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.530238Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:96f769d05870ce73d2aba8831b2e7a3cd742134ca7151538b642b7fe722933b6","observation_id":"f94dff3a-b6bb-4941-9cef-df3468e1aa57","resolution":{"observed_at":"2026-08-07T13:45:56.530238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18654","last_updated":"2025-02-28T00:26:42Z","snapshot_observed_at":"2026-08-04T21:04:25.264907Z","submitted_at":"2024-05-28T23:36:00Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18654","snapshot_observed_at":"2026-08-07T13:45:56.617261Z","title":"Arık, and Tomas Pfister","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.617261Z"},"links":{"cited_paper":"/paper/2405.18654","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:71a9691b9237a66d4be9bd35fdfd76e80ce815156885507f06601d84d17192ba","observation_id":"18dca663-26bf-4c96-bafc-d22e2010a868","resolution":{"observed_at":"2026-08-07T13:45:56.617261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:56.780656Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.780656Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:ea58cc4e1ecae26cf8601be5c5bda2f35018604a1ee93b01dc8f9ab7dac6c973","observation_id":"67878832-dda0-457a-8e58-8f2547339463","resolution":{"observed_at":"2026-08-07T13:45:56.780656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-07T13:45:56.874054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.874054Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:e5fd08fce815b08a729bbbbe49b6cc10a575563425988a07bd5e760fda758724","observation_id":"cef1a705-6e1d-4fe4-b967-8f7369bcafec","resolution":{"observed_at":"2026-08-07T13:45:56.874054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17492","last_updated":"2024-02-27T18:42:42Z","snapshot_observed_at":"2026-08-02T19:39:02.664535Z","submitted_at":"2023-06-30T09:07:37Z","title":"Preference Ranking Optimization for Human Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17492","snapshot_observed_at":"2026-08-07T13:45:56.960790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:56.960790Z"},"links":{"cited_paper":"/paper/2306.17492","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:9fa7b97a5b51b67bc03c54c0c72999fcca83fe43bf4f7fbb71ed980c282e4dd5","observation_id":"29a73b90-9297-4977-b2fb-e39741917e83","resolution":{"observed_at":"2026-08-07T13:45:56.960790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T13:45:57.073908Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.073908Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:2094b0e8a449826c6a3423e27b25ad6429b35db389dbcd921030ba75b206cb76","observation_id":"e7dd32bf-a9f7-48ba-913d-6254d76f657e","resolution":{"observed_at":"2026-08-07T13:45:57.073908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T13:45:57.195765Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.195765Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:1aa4b643b2a7af7d09563377ee3307a1cab7967f5cbabc313ee0625334100b36","observation_id":"444f3d24-3691-4fa7-bcbb-0fc86ded3bf2","resolution":{"observed_at":"2026-08-07T13:45:57.195765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-10T23:13:16.481696Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T13:45:57.282620Z","title":"Huang, Nan Xu, Sheng Zhang, Hoifung Poon, and Muhao Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.282620Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:058d491d1b82b7747a198cb17aa11b975d61530cf7da1d94cb931047e88b7d09","observation_id":"abfa1f5f-c24f-4664-a279-ea700245fe5c","resolution":{"observed_at":"2026-08-07T13:45:57.282620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T13:45:57.372377Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.372377Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:aca9a50d8ee9bbacc9d6154d25065386c3d402af297b6228c05cc3fd921c9dfd","observation_id":"e1410784-7edc-40c5-bc2b-266f26a159d2","resolution":{"observed_at":"2026-08-07T13:45:57.372377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T13:45:57.523050Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.523050Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:fe5558eac9a223c67a17e4caa9f77a09b6fd552889bbd2b1bfd75787b1844dd6","observation_id":"0ac4b01f-4cd7-4810-8161-76edb9375d4f","resolution":{"observed_at":"2026-08-07T13:45:57.523050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00114","last_updated":"2019-02-06T22:22:55Z","snapshot_observed_at":"2026-07-06T06:25:59.057860Z","submitted_at":"2018-02-28T22:26:43Z","title":"SQL-Rank: A Listwise Approach to Collaborative Ranking","version":3},"cited_work":{"arxiv_id":"1803.00114","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.00114","snapshot_observed_at":"2026-08-07T13:45:59.402444Z","title":"SQL-Rank: A Listwise Approach to Collaborative Ranking","venue":"stat.ML","work_id":"361d0481-242e-42db-af47-4a76f1f19bf7","year":2018},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.662505Z"},"links":{"cited_paper":"/paper/1803.00114","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:fde60f16d46d3f6aad760f57eb35c002786480fcbe0d4af78ca945e2604af9ab","observation_id":"6126a066-589b-4ddd-8218-a565ae573762","resolution":{"observed_at":"2026-08-07T13:45:59.450101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14233","last_updated":"2025-01-06T13:58:45Z","snapshot_observed_at":"2026-08-11T06:17:48.689367Z","submitted_at":"2024-04-22T14:46:10Z","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14233","snapshot_observed_at":"2026-08-07T13:45:57.781749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.781749Z"},"links":{"cited_paper":"/paper/2404.14233","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:5eee3229e88a5a88ec5c75df6252d9babf0097778e5820f6dbf8cd617bd955e4","observation_id":"3f6a8ad6-ab43-4e82-8b61-fcdb73ba4dba","resolution":{"observed_at":"2026-08-07T13:45:57.781749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02712","last_updated":"2024-11-05T01:24:37Z","snapshot_observed_at":"2026-08-10T01:07:52.836287Z","submitted_at":"2024-11-05T01:24:37Z","title":"V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02712","snapshot_observed_at":"2026-08-07T13:45:57.901345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.901345Z"},"links":{"cited_paper":"/paper/2411.02712","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:5d7438bf8921ba6c93a463b5b838352504da7a6df283b36bdea7544795f27513","observation_id":"0860ab92-0c4e-4de0-8668-9df2a0361d57","resolution":{"observed_at":"2026-08-07T13:45:57.901345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-10T21:54:38.067043Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-07T13:45:57.999280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:57.999280Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:9e59e0039369b8aa222ba5b8f88836164c93e23a8ba3d5841de9635a1f197746","observation_id":"dfa4bd3c-b466-44e1-87db-f009da03e8bb","resolution":{"observed_at":"2026-08-07T13:45:57.999280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T13:45:58.094216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.094216Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:4ab60789632db842453f5335c26231c44fa1db763636dc1b359cec16d87df3e4","observation_id":"852b20d8-b573-4fa0-9a4a-ad0bc0437ec3","resolution":{"observed_at":"2026-08-07T13:45:58.094216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T13:45:58.215396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.215396Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:adab11abae890bdfeca62527937bcf97039e09c506d0252a9c31d0e24d26d562","observation_id":"53d5ba67-3ad2-4eb4-ac1f-fcd5148cfb91","resolution":{"observed_at":"2026-08-07T13:45:58.215396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-09T02:22:19.607073Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-07T13:45:58.323400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.323400Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:88d68606cf2e0831b6c4db7f288a35a59b5044ca3fe1eb5d0818ab8ef7592a1b","observation_id":"fd87b182-3dfc-4ccd-88fe-b8d196ab0a0f","resolution":{"observed_at":"2026-08-07T13:45:58.323400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04064","last_updated":"2025-02-17T13:04:24Z","snapshot_observed_at":"2026-08-06T10:38:42.227035Z","submitted_at":"2024-10-05T07:25:56Z","title":"Text2Chart31: Instruction Tuning for Chart Generation with Automatic Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04064","snapshot_observed_at":"2026-08-07T13:45:58.432036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.432036Z"},"links":{"cited_paper":"/paper/2410.04064","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:f0a0e97368d6230197aded84f28e23a10a594dea4eaf9e8103c226db64ee6d51","observation_id":"ed407162-7cb2-496a-b155-083fc95d441f","resolution":{"observed_at":"2026-08-07T13:45:58.432036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T13:45:58.553603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.553603Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:3a42b586fcd53202d979a64e428ae037726739e88cf6694bcd438dbf20cbf228","observation_id":"466bfe38-9fb0-4cba-a405-a3f696a8ce37","resolution":{"observed_at":"2026-08-07T13:45:58.553603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T13:45:58.668895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.668895Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:d4f2432a7c659d6108bd535e7dc64bd9e5b4cd31d24f5d59e0deb284ed9b9981","observation_id":"35eac0c2-dff5-441c-8429-35fe9e534d72","resolution":{"observed_at":"2026-08-07T13:45:58.668895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T13:45:58.747127Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.747127Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:3ad44a80fc9788f1287f108d52e545248779d3e74239ab836c1cdfec722d2459","observation_id":"09ab64f9-3dbf-44ba-be34-5ea6bbac0f84","resolution":{"observed_at":"2026-08-07T13:45:58.747127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:58.877958Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.877958Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:e766d5dd5914db41c785ec3ab287cff71c21cd44167e85410493f55916a569a2","observation_id":"eb1bf442-e968-4b92-8316-a099606e4460","resolution":{"observed_at":"2026-08-07T13:45:58.877958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:58.964182Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:58.964182Z"},"links":{"citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:e8e6a7c1271b856ea09253f0ff01b0c3042d1edc09981e3fc53bdd9a8fce4a66","observation_id":"fd7f327f-935e-4d80-969e-06df80621895","resolution":{"observed_at":"2026-08-07T13:45:58.964182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.21061."}