{"as_of":"2026-08-10T04:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebb26ed7df3b56fb44717ffc52d443049e71696d6abf2dd623adfe9a9454ab43","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:11:33.916383Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:06:15.623188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:26:28.843655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2509.06759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06759","snapshot_observed_at":"2026-07-02T03:26:28.843655Z","title":"Yuqi Niu, Dilara Keküllüo˘glu, Weidong Qiu, and Nadin Kokciyan","venue":null,"work_id":"af5e5365-25e2-458b-96c2-2cbdd47203a2","year":2026},"citing_paper":{"arxiv_id":"2606.03604","last_updated":"2026-06-02T13:09:04Z","snapshot_observed_at":"2026-08-09T07:19:36.012012Z","submitted_at":"2026-06-02T13:09:04Z","title":"Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:06:15.623188Z"},"links":{"cited_paper":"/paper/2509.06759","citing_paper":"/paper/2606.03604"},"observation_digest":"sha256:f9f8da6dd9a69e67b3f74d0a989af9f5ac4d7ecadb099b5484c4c47831f0f1aa","observation_id":"f4c65fd8-781c-4f7a-88f2-3b0a19ee93ef","resolution":{"observed_at":"2026-07-02T03:26:28.845645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06759/citation-record","integrity":"/paper/2509.06759/integrity","json":"/paper/2509.06759/citation-record.json","paper":"/paper/2509.06759"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.756011Z","title":"Visual instruction tuning,","venue":null,"work_id":"0599618a-d9c2-44da-ac20-411990a2f4c2","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.712782Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:098f8eabcc259cbf7411c7916feee25f69cffac1cdb11bcb0843ae3c818ef5a9","observation_id":"0b7ddbe5-6805-4d44-8d87-936c0c175228","resolution":{"observed_at":"2026-08-04T23:11:35.758397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.746960Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":"5aa763e7-11d6-430d-9591-69c6e8a9ebb5","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.810781Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8759a30d58cd75d51c866b0446d6584981197599347e8dd5a63af5da80dd4a83","observation_id":"82d881f1-e063-4db4-87d4-7c06c0718ac1","resolution":{"observed_at":"2026-08-04T23:11:35.750942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.738443Z","title":"FuRL: visual-language models as fuzzy rewards for reinforcement learning,","venue":null,"work_id":"ab65a0f5-60af-4015-8c50-c5a3baf7c8db","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.936043Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:4fa3af04399c6b57d6f6bff7cd6ce6a646532d47170c7a00c4555ca33c9d94e9","observation_id":"a9705884-29bd-481d-ad90-0883b4698e2a","resolution":{"observed_at":"2026-08-04T23:11:35.741768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.731237Z","title":"Direct preference optimization: your language model is secretly a reward model,","venue":null,"work_id":"60737735-5a08-4f76-9bea-0d051bca0b78","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.083034Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:02ee6fe5c7818e0c42b86018536acbf6271a9ac8376d36992419169c7659a113","observation_id":"285986a1-08cd-473a-b33e-adbfa20b63a4","resolution":{"observed_at":"2026-08-04T23:11:35.733910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T23:11:30.185541Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.185541Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:73963b0566336c85126f9cb1567fc42f80bb2f88516d29f29b16abfc212d4302","observation_id":"937d651a-f762-4345-9648-4634aaeccb1f","resolution":{"observed_at":"2026-08-04T23:11:30.185541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:30.327881Z","title":"Deep reinforcement learning for cyber security,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.327881Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:914703698dc8fae6d645e05c0a21b9417ecc352c7092d318769323ea41eb0d93","observation_id":"81e810d6-b6a1-4164-b624-1301cfb1878b","resolution":{"observed_at":"2026-08-04T23:11:30.327881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T23:11:30.433159Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.433159Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:4074c7416ea63078678e61adf9e222dfbfc0b3eba2f0ac4ae7b7f1d48f987376","observation_id":"2530fe82-4bf8-404e-b646-29e7b055609f","resolution":{"observed_at":"2026-08-04T23:11:30.433159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-04T23:11:30.555836Z","title":"Vision-R1: Evolving human-free alignment in large vision- language models via vision-guided reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.555836Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:ff5591e1e451d58616400d897c63883cf7ee995225a4f3c9e74a286eff892bbf","observation_id":"5eb4008c-f784-4649-a0cc-4dd41817ff9d","resolution":{"observed_at":"2026-08-04T23:11:30.555836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.719905Z","title":"GPT-4V(ision) System Card,","venue":null,"work_id":"851263e0-b20b-4337-a696-b19149402635","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.681453Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:e67648e5bd5e3e303c94d21f48d4ae0db5fbf2ff6dffaae190ce572313371b63","observation_id":"96de6b97-b3f9-44e5-8037-ad88ddfeb846","resolution":{"observed_at":"2026-08-04T23:11:35.722313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T23:11:30.789285Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.789285Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:88c64597ab6048d5600f94edbc7f21a6ed13d1ecac6ed24cfc3a89c095a14e53","observation_id":"f32b6995-f3cb-4e21-a4d0-c354ea1c84f7","resolution":{"observed_at":"2026-08-04T23:11:30.789285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.712523Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku,","venue":null,"work_id":"e1ca7096-864a-495c-89ba-2340e291d7b4","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.892892Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:62a1ac0f8e6e859d9d0a16b7ca3aad17d91b97643b1345ab1b062bdfb3b93163","observation_id":"2b2055ae-7013-4777-aa96-0396d55ff61c","resolution":{"observed_at":"2026-08-04T23:11:35.715410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T23:11:31.049107Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.049107Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c7269ebf3bd45d79900e888db234307c85231c74bc4d0074d88e20dc34089ae4","observation_id":"d4d1a607-5086-4fe1-8c10-dd42cd967546","resolution":{"observed_at":"2026-08-04T23:11:31.049107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T23:11:31.172246Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.172246Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7cb8ef33ddbbee45461f9d695c5f92ad6ec58cfaa6827452b89137afc5ea35e4","observation_id":"c7afd6ff-f37d-48fc-8971-c23572d2a6f2","resolution":{"observed_at":"2026-08-04T23:11:31.172246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T23:11:31.322246Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.322246Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:2d7da50257ee429505cb0b8b3560af6e8d7792b7d28105731ec4d413b0f63bfe","observation_id":"06c642ba-e757-4f1a-b582-dd08acd688e4","resolution":{"observed_at":"2026-08-04T23:11:31.322246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.704736Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,","venue":null,"work_id":"16f08e1a-3a39-4b2d-be06-771defb0e7f5","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.455348Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:87310e872e11353a0e4777ef322f6e65f99673624b8665781e63067ed69b08ae","observation_id":"6dea6216-c277-41e8-8d9c-deff99a9c82c","resolution":{"observed_at":"2026-08-04T23:11:35.707253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.694491Z","title":"Aligning large multimodal models with factually augmented RLHF,","venue":null,"work_id":"f0ee5e8d-2212-4caa-83a0-b57da5870630","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.557083Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:d8ad55a50711e2c953971a09fb8242f60b3e73b697eda9c69af96af395c89f67","observation_id":"05d60a77-9a45-47f1-aa8b-e5d7ef872968","resolution":{"observed_at":"2026-08-04T23:11:35.697317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.685903Z","title":"Fusing pre-trained language models with multimodal prompts through reinforcement learning,","venue":null,"work_id":"1b84d73b-5011-4f73-851f-a783d2a0f514","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.659056Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:b68acfb66510e52a54a22a37e4193f128560b31dd7fd830132bdf3980f0f8013","observation_id":"5515cda2-59b6-4b31-9a73-4a4ed8eef351","resolution":{"observed_at":"2026-08-04T23:11:35.689442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:31.774303Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.774303Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:75bf12b3a9832962ad29484ffc14c46356bd22101d58c3cccdb5be783dc165e1","observation_id":"eca955ef-ec96-4f6a-bc04-9842a5ae3694","resolution":{"observed_at":"2026-08-04T23:11:31.774303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-06T21:08:23.353594Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-04T23:11:31.875241Z","title":"Improving vision-language-action model with online reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.875241Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:13e4428ee17643bd69d5e7c67f4adff58f09a1c15133e17b374f066d8f778d57","observation_id":"2725aca8-5c7c-48f3-8fbf-57cd903c3e8f","resolution":{"observed_at":"2026-08-04T23:11:31.875241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.675663Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning,","venue":null,"work_id":"0096c954-61c0-4e0e-b939-61e82c482125","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.972932Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:d0d7515bed1ea6babcecbab9328abd0cd6ac7743d066a0babb7d67472fadad83","observation_id":"584d7002-35ed-412f-885a-9e1b337db0e4","resolution":{"observed_at":"2026-08-04T23:11:35.678223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.669280Z","title":"VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,","venue":null,"work_id":"08358edf-ef86-4b76-ac56-a4fba6b20a76","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.078379Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:10bc76e3bdce5d03f27ffb9f0514045fcb01e05a8902c909c783593995f34463","observation_id":"9dd998c8-ec99-4eb2-951b-5774943f28c6","resolution":{"observed_at":"2026-08-04T23:11:35.671740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-04T23:11:32.187646Z","title":"MM-RLHF: The next step forward in multi- modal LLM alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.187646Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:389662a8afe93702eca50eb1117d1db53e90a33eb87c906e9658daa84617dbbc","observation_id":"1e71b9a7-b5a1-432e-9845-65efc072eef0","resolution":{"observed_at":"2026-08-04T23:11:32.187646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-04T23:11:32.319995Z","title":"Insight-V: Exploring long-chain visual reasoning with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.319995Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:6498e19c41fc33113c9b47b35547f67dd04c482f7365596fb67c582b83a6c725","observation_id":"d62c896b-9f3a-4713-8d08-1799de8b65e5","resolution":{"observed_at":"2026-08-04T23:11:32.319995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.662617Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":"a346d3e7-b712-46c2-83da-242317f3fc40","year":2022},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.400862Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8b1e81ee37a638c99dec6ff9630a870c4f26f3bbbeab546103ff1a316cc429f1","observation_id":"73f1b11e-3aba-4ab6-9a34-d35332c2bece","resolution":{"observed_at":"2026-08-04T23:11:35.665282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.656135Z","title":"RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,","venue":null,"work_id":"5dcb6782-fb40-4812-b557-8dd97bd441ff","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.459930Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:5ede53ee762964c486d95d982c125c49de3fdbf1dd446115dba325e2e0640bc5","observation_id":"dd0286eb-b055-4f36-99dd-9cb8bb277b00","resolution":{"observed_at":"2026-08-04T23:11:35.658696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:32.518338Z","title":"RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.518338Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:205680517bbb42cd836fd9fa415c88ab6acefb23cc08f2fa95602c456f079dbd","observation_id":"1ed9281b-9ea0-449d-809a-5428edc78ccd","resolution":{"observed_at":"2026-08-04T23:11:32.518338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-04T23:11:32.623370Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.623370Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:3fee39267ef90bba772324514661ec2bd2e553a8d7d9ea35741288999fbb2a8f","observation_id":"9c0e0dba-87fe-4724-8c9b-7450768ae793","resolution":{"observed_at":"2026-08-04T23:11:32.623370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.649786Z","title":"Aligning modalities in vision large language models via preference fine-tuning,","venue":null,"work_id":"1c0bcd6d-42f5-4833-9959-0dcfbdb89f0f","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.712851Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:3e2756d438b5cbaaa0ece76bd08029bab561577d114c204318b9945e098e47fb","observation_id":"4d9d970f-7b5a-4ed0-ba28-4912501b0c8b","resolution":{"observed_at":"2026-08-04T23:11:35.652391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.267173Z","title":"Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,","venue":null,"work_id":"4095a9c2-e172-44b4-ba84-3760a1c1ff81","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.788914Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:1b760eecb145a8eaf70b8acb041ee00229c9b72eb794157f6f650ce0acabc8e9","observation_id":"98be5315-ceb8-4cbd-9ca8-eb2959294c31","resolution":{"observed_at":"2026-08-04T23:11:34.328168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.642049Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement,","venue":null,"work_id":"54a796eb-1761-45a7-a552-b0ad37ba3e53","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.858563Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:452bce3c43d8966af913df2753f4f56caa97f19f158d5f5214c6257fed450648","observation_id":"44d826cd-ca6d-4d51-a385-502c419dcf59","resolution":{"observed_at":"2026-08-04T23:11:35.644815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.634814Z","title":"VILA: On pre-training for visual language models,","venue":null,"work_id":"cb1a7aaa-9862-4395-8f5a-5a2b3fd8636e","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.938809Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:4b9426c539def8f6a6095bb2b1b1a217c49976976449350ade9c0aa94d3ab302","observation_id":"340830de-37de-418f-a89a-309ae2e27376","resolution":{"observed_at":"2026-08-04T23:11:35.637399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-04T23:11:33.026717Z","title":"SPA-VL: A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.026717Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8f51fa86be1ce148a7f9f399198636e0e810f911534cb292d0689adda578cd73","observation_id":"08d7f4a5-692d-40ce-a274-cc75b88179e0","resolution":{"observed_at":"2026-08-04T23:11:33.026717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.627386Z","title":"DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,","venue":null,"work_id":"5d3390f4-1ada-457e-8183-4c5a41122518","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.113237Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:49728c8e9d4abd591fb42a21860d6870aeeb898acdd8bde770f54ab414f1e704","observation_id":"cb03875e-d4b2-4db5-be8d-34f9a673557b","resolution":{"observed_at":"2026-08-04T23:11:35.629758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.619933Z","title":"Active learning for vision-language models,","venue":null,"work_id":"45a1e003-432e-41ba-af85-f761a15efa6f","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.169468Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:caa553082cd9b922968ffe715068ebeed7adbb92cfa769b7e4f0a9a4c9d12c04","observation_id":"4f1bbaf7-89cd-4365-bcb9-edf78b7b875c","resolution":{"observed_at":"2026-08-04T23:11:35.622360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.611694Z","title":"S-CLIP: Semi-supervised vision- language learning using few specialist captions,","venue":null,"work_id":"759fe328-2009-42d9-871e-5955eb335f96","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.253965Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:0ac079b541926c86bdf13032df7619db7cdf1414e4eb8f2a9010e82a88e0222c","observation_id":"947346f9-f031-49f6-8893-3e196311fc20","resolution":{"observed_at":"2026-08-04T23:11:35.614867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.603207Z","title":"RL-VLM-F: reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"a535c0af-f2db-410a-9814-24b29c655ab9","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.336199Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8505d9d476ae9a85c5c3738a615aea4e456b421924a84768840b4210ba0b7a67","observation_id":"39cd1753-ca90-4451-b2a6-3e7b88b37ceb","resolution":{"observed_at":"2026-08-04T23:11:35.606114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-04T23:11:33.426693Z","title":"VL- Rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.426693Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c30f2b1ead124f9ba4f370a3885810c9a03fa636bdf7ac410d91dab701c4cfd4","observation_id":"8f86d631-de35-4c62-b3b9-ab9639bc0c06","resolution":{"observed_at":"2026-08-04T23:11:33.426693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.122705Z","title":"Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,","venue":null,"work_id":"043607cf-7019-4fda-85d8-5a784d62f08c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.506496Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:3993b318e3ff0666d44aa8b4e4c4a0eb60db7497cae5b925651a25b0a7b66ec7","observation_id":"50ab2a2b-223e-4db1-a473-b074a11bb0f2","resolution":{"observed_at":"2026-08-04T23:11:34.192544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.324334Z","title":"Zero-shot model-based reinforcement learning using large language models,","venue":null,"work_id":"d8b603f6-29c8-4a1b-aace-a95625db8abe","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.588219Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7039e8ba42c24b17c2cc8e415b8e858ac67932c988d1b39f5b9677c73118b01f","observation_id":"275b609a-a0c7-4d8e-87f6-14be0bb1e33e","resolution":{"observed_at":"2026-08-04T23:11:35.492893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-07T17:17:34.989308Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-04T23:11:33.680238Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.680238Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:ec5b46ea71368a4c8c7b60a7ac1091828e3572d12605b72effd04cdd7dd37189","observation_id":"81da2cfc-2953-4d37-9707-0803e844cfca","resolution":{"observed_at":"2026-08-04T23:11:33.680238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.057573Z","title":"Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,","venue":null,"work_id":"f6def88b-bb57-40fd-b072-f24e2869bbdf","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.749871Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:1f812ad99cd95074e2b19a6f6fd86816389418a708c3f7068f93edc80d9d5042","observation_id":"fb608950-511f-4461-ab83-d883d128b16e","resolution":{"observed_at":"2026-08-04T23:11:35.213474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11918","last_updated":"2025-02-17T15:32:14Z","snapshot_observed_at":"2026-08-07T18:12:03.155464Z","submitted_at":"2025-02-17T15:32:14Z","title":"VLP: Vision-Language Preference Learning for Embodied Manipulation","version":1},"cited_work":{"arxiv_id":"2502.11918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11918","snapshot_observed_at":"2026-08-04T23:11:34.018548Z","title":"VLP: Vision-Language Preference Learning for Embodied Manipulation","venue":"cs.LG","work_id":"c35d4c6b-2259-4cf5-a9e2-5fe816ef0f9c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.816944Z"},"links":{"cited_paper":"/paper/2502.11918","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8149654c19c303155007427b46d65758c779dea4b241ca238c21b615f1b9f5bf","observation_id":"b37a8033-2b5a-4f9b-b754-91d30b904049","resolution":{"observed_at":"2026-08-04T23:11:34.055141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.765698Z","title":"Multi-agent deep reinforcement learning with human strategies,","venue":null,"work_id":"eb947412-8886-4f15-8b11-e724cb75bbeb","year":2019},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.871306Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:67b118e84348b036086475ef5975e6e0e69eace7351e6f09fbae07ce285149f4","observation_id":"c0650d6e-0169-4640-a19c-fd7cc2086343","resolution":{"observed_at":"2026-08-04T23:11:34.879301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.533727Z","title":"ETA: Evaluating then align- ing safety of vision language models at inference time,","venue":null,"work_id":"f6936193-05ec-4155-9b16-3b9a21d6f93c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.916383Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:b1d54a78ed2c98d07035d7694259fce32f0b13699d1a9fb12c746dbf475947c5","observation_id":"7336f9a6-1f18-42b4-a64b-401378996dcb","resolution":{"observed_at":"2026-08-04T23:11:34.656421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.06759."}