{"as_of":"2026-08-13T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b6b16ce1fbc36216dc10b4ebb27488ffb5c433b7d93f08b05b27aa845c9e0ff","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:53.072713Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05260/citation-record","integrity":"/paper/2506.05260/integrity","json":"/paper/2506.05260/citation-record.json","paper":"/paper/2506.05260"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.676716Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"92e504a6-c1ed-40c2-a83e-6498b3f7254a","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.381300Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:d5ddfeb604a005610133d7c67f589ab8d192058ee3d7cac91752158d59c1ca8c","observation_id":"87599cec-a8c3-49a6-98fb-d1bb2e9aacb7","resolution":{"observed_at":"2026-08-07T10:28:56.790748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.463830Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"735c3276-da52-4164-a5ca-ff87735b0a26","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.460063Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:d6f8445a5cd5f0d4e0cb2d69acb9f170d27356772a6b3337163c3b31c0251cc4","observation_id":"c91fee19-a402-43d6-aa39-22017afc1f14","resolution":{"observed_at":"2026-08-07T10:28:56.569181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.550694Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.550694Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:c9b937ff9ff4499bf2ed4babc94f98029283ba2c974ac6ea05ccbd41e800c37c","observation_id":"5c70d3fd-489c-4376-a198-173679d4ffed","resolution":{"observed_at":"2026-08-07T10:28:45.550694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.661244Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.661244Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:177e40f443176cecf8568483fb0f560057306198454bc397599376381a1268bb","observation_id":"c4ee9b8e-b97c-4647-b1b4-ce1639322efc","resolution":{"observed_at":"2026-08-07T10:28:45.661244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.761050Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.761050Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:b0cb855e325fef1eeddac61d392985f226e219f446e7f30c66ed56eb417deff4","observation_id":"a366eb47-61fc-4a47-ac23-8144fe241e3d","resolution":{"observed_at":"2026-08-07T10:28:45.761050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.887667Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.887667Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:37d5bcc4648c87ad1fa99389dc5ce05e17a577cc4c7484f6b2b8642f241e168f","observation_id":"e67d2d0e-a974-45a8-ac93-dc7007a9bd20","resolution":{"observed_at":"2026-08-07T10:28:45.887667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:28:45.998856Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.998856Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:63731c8e7002091e4b651d7af02500342aefe5b9d43f27078f4f0121e025a08b","observation_id":"967a0eea-1615-4424-ac6f-5c8e99da5241","resolution":{"observed_at":"2026-08-07T10:28:45.998856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T10:28:46.132778Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.132778Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:11d08b845f4fd8c9ce10d24b9499b99f1462f31146dcbd74d2c441f44cb7ec8c","observation_id":"e09aaaa5-b745-416b-afaa-963f8e4c80b2","resolution":{"observed_at":"2026-08-07T10:28:46.132778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.243169Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.243169Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:50ce3aeade15cc2c02a66ba23bf33c4022b01947b8f3dbc9778fa6201f15702f","observation_id":"1d141351-52b8-4878-ae0c-406649785dd2","resolution":{"observed_at":"2026-08-07T10:28:46.243169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.205517Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"a0593bf3-78aa-453b-9dd7-319a9a6659dc","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.336455Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:3b2f5b69b4cae65bd83e91ff7d8a08dc34af73f9022d589accb3ec8b75377127","observation_id":"43ba7005-2f35-48eb-9b53-0d20f3e5b38c","resolution":{"observed_at":"2026-08-07T10:28:56.294640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.031441Z","title":"Tuning large multimodal models for videos using reinforcement learning from AI feedback","venue":null,"work_id":"7c724bda-23b2-4ba5-ba57-4c140305bbb5","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.414954Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:d52851f1c56ec6bc606942dac4657c0ba6552234de9c0f12156a732bb3fa1a85","observation_id":"0aec69c4-55a2-4614-a893-da89764a2ef1","resolution":{"observed_at":"2026-08-07T10:28:56.112709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11280","last_updated":"2025-01-08T03:18:23Z","snapshot_observed_at":"2026-08-12T23:41:23.471769Z","submitted_at":"2024-06-17T07:33:30Z","title":"ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11280","snapshot_observed_at":"2026-08-07T10:28:46.520071Z","title":"i-srt: Aligning large multimodal models for videos by iterative self-retrospective judgment.arXiv preprint arXiv:2406.11280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.520071Z"},"links":{"cited_paper":"/paper/2406.11280","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:bcbc16e30458640b525bc97103d162e7ebd1fbe8895cd808ec4674953cd26c8e","observation_id":"133ef95f-1b8f-492a-a37f-8edfac11ae9d","resolution":{"observed_at":"2026-08-07T10:28:46.520071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-13T00:39:57.337984Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T10:28:46.600253Z","title":"Direct preference optimization of video large multimodal models from language model reward.arXiv preprint arXiv:2404.01258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.600253Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:62dd364c8d8108ab69666b1a5d82d7a4541dfcb4e2fb6d932a24386dd6cd8a05","observation_id":"62eede0d-e51d-42aa-8b72-ca8e342585ba","resolution":{"observed_at":"2026-08-07T10:28:46.600253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-07T10:28:46.708160Z","title":"Temporal preference optimization for long-form video understanding.arXiv preprint arXiv:2501.13919, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.708160Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:e43a7bf732405991cda09fff30d0030d01f30e639507508d24e6fbc62cf702a6","observation_id":"94a971de-4074-476a-9cf7-63b5e04448ba","resolution":{"observed_at":"2026-08-07T10:28:46.708160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-08-12T22:25:23.825751Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-07T10:28:46.995120Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization.arXiv preprint arXiv:2410.08847, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.995120Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:e5824a8d1709aec9aa3d3ae14beeb946cdfc01d2cb382b706eda189127637bed","observation_id":"c508bcee-1390-4374-963a-a09fa2b00bcc","resolution":{"observed_at":"2026-08-07T10:28:46.995120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-13T00:27:12.618680Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-07T10:28:47.055899Z","title":"From r to q∗: Your language model is secretly a q-function.arXiv preprint arXiv:2404.12358, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.055899Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:e8f56ee69c5b36366b3fc605a3b5c2023d035c32e2babc981aa44e52a57c929f","observation_id":"3d84090d-c768-4a67-be3f-dbbf84471ef6","resolution":{"observed_at":"2026-08-07T10:28:47.055899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T10:28:47.117231Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive.arXiv preprint arXiv:2402.13228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.117231Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:a1ef16a222a9d2b0e88b9b837255b904bf9da3bcc03219165906bcb53724793a","observation_id":"11c3c272-c05d-49cc-abdd-ef5cafae400c","resolution":{"observed_at":"2026-08-07T10:28:47.117231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-08-13T00:24:28.662797Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-07T10:28:47.187005Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data.arXiv preprint arXiv:2404.14367, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.187005Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:be390e0bff1351015260f5f0193c9f1165fe007012a6acb4c75662ba28b86c95","observation_id":"f636b544-d400-46e2-9613-c3a0e5458869","resolution":{"observed_at":"2026-08-07T10:28:47.187005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-13T00:38:51.715697Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":"2502.07599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07599","snapshot_observed_at":"2026-08-07T10:28:54.031274Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","venue":"cs.CL","work_id":"4b8dccb6-eb77-4c87-95bf-3d6e33b1c757","year":2025},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.271156Z"},"links":{"cited_paper":"/paper/2502.07599","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0a8db37c98f348386b11abb41e7358fa87574ce898e4f1b29d8124c84a35c13d","observation_id":"9ec5bba3-48a6-487e-b041-1bc3367e23d9","resolution":{"observed_at":"2026-08-07T10:28:54.149778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-08-12T23:57:54.839711Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-07T10:28:47.390690Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer.arXiv preprint arXiv:2405.16436, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.390690Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:d2dc9683a286ea4b503e3c9434e2b08ad23ba443274e9e6977f0e5d2a7be72f5","observation_id":"551e7d34-90c3-4fd9-adf5-b9717b571467","resolution":{"observed_at":"2026-08-07T10:28:47.390690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.877122Z","title":"Introducing chatgpt.CoRR, 2022","venue":null,"work_id":"909347ff-5bf7-4b63-a446-6b0403a36c3f","year":2022},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.480018Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:ce007d4e8f829092fb5bab57aa2c1fb356d94a558fe722371fac82e08a870353","observation_id":"c671aef6-8fcd-43e7-b4ee-7f5795c410e1","resolution":{"observed_at":"2026-08-07T10:28:55.929693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.602865Z","title":"GPT-4 technical report.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.602865Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:4ac19931f6bd957a1ab881f3b4e79571932abfb93b09f5e595591f987fe2a4e6","observation_id":"eab90330-9598-42d5-bee6-5e593e4ab5a7","resolution":{"observed_at":"2026-08-07T10:28:47.602865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:28:47.725396Z","title":"LLaMA 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.725396Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:8fb2a1171c2f8673e03ada823e0a05510c3c45495af10c4a324603054d3b38a4","observation_id":"fdc7ab15-ccc6-490e-9e1f-900c4fb4f293","resolution":{"observed_at":"2026-08-07T10:28:47.725396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T10:28:47.829591Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.829591Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:40ce6f3737b60f211e34badc424d6a03b523f9007de93a83bcc5660e701e8dab","observation_id":"1994fffd-2d34-401e-90fa-5bd7a6787b76","resolution":{"observed_at":"2026-08-07T10:28:47.829591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.913327Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:47.913327Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0dbf77ff4f8cb77703b5b7ab11b54a783f9b93a5fff7d4f0e1a020955656e0ca","observation_id":"3596279b-d390-4ac8-8476-d3fc2816c3c1","resolution":{"observed_at":"2026-08-07T10:28:47.913327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T10:28:48.035884Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.035884Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:1f20f29b756a3b3fa3bed3f4837796d10e8059408eaa1bd29b44468e73d187d4","observation_id":"ab522e8b-65f0-4613-8b55-db444a01e5c3","resolution":{"observed_at":"2026-08-07T10:28:48.035884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.096937Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.096937Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:a0c1c8d17cdd532fd01a3afd86ecfa9a79844921e68281e1fa113f4d88e632a3","observation_id":"4cd34a1f-f641-495b-8c86-e039e87f0a81","resolution":{"observed_at":"2026-08-07T10:28:48.096937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T10:28:48.212275Z","title":"Lipo: Listwise preference optimization through learning-to-rank.arXiv preprint arXiv:2402.01878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.212275Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:5759e6caeeb14550fb74a9f794c1c30a0031535fca046dd624cae61f19e7693b","observation_id":"98d5ad29-7c6a-41bb-900b-d36ab5f2d551","resolution":{"observed_at":"2026-08-07T10:28:48.212275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.339711Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.339711Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:c35c6326028601916fdc33f06c5420559be9f59a92573a2a5219504fc228e9dd","observation_id":"2706551a-be43-4870-ba5b-aeb482090f73","resolution":{"observed_at":"2026-08-07T10:28:48.339711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T10:28:48.465974Z","title":"Simpo: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.465974Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:64f2f9d1e4e8b38a2237970183779c8b5da97d257cb0a0d52a17f80a0380a4ee","observation_id":"7e9011be-a790-4f63-91ec-4a4a6320fcfe","resolution":{"observed_at":"2026-08-07T10:28:48.465974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T10:28:48.558901Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.558901Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:1f61e8f1ff32dbb6f7019ee52af68e5ffa7ecf6f3a1f0610f2c9670c09240f16","observation_id":"7406bc35-b70f-497b-b0f2-4f08220f4fd1","resolution":{"observed_at":"2026-08-07T10:28:48.558901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.594483Z","title":"β-dpo: Direct preference optimization with dynamic β.Advances in Neural Information Processing Systems, 37:129944–129966, 2024","venue":null,"work_id":"eb33bd43-89ce-4e6b-9c5e-ad6857d02021","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.688666Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:b080ad99867061f6ade014ac667a0bda260cdbf4796c87b40e602a7449f656f6","observation_id":"17fbe66b-8f0a-4173-81f6-023008380142","resolution":{"observed_at":"2026-08-07T10:28:55.714997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.430639Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"943092a7-f776-4a98-b02f-a1528c362853","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.772450Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:9dd05b1eb56dae1be282c972050539acf6ab78d87b5db5226e957203b86254e4","observation_id":"41dcf136-d98c-40d1-9cea-83db0000177c","resolution":{"observed_at":"2026-08-07T10:28:55.511918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.905011Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.905011Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:8c1651d2719a99d6a633e8d8c9ba248fed359293db0d9da840f0e71116b40004","observation_id":"853e42d9-1765-442f-9db5-228dbbe3669d","resolution":{"observed_at":"2026-08-07T10:28:48.905011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T10:28:49.027723Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.027723Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:9b2b20acd2d17328bbc9c11f4a5641d0d5dfb4260b9bec72ff7d69a8d5f62b71","observation_id":"96db0a19-af0d-4def-b013-5187b34ca691","resolution":{"observed_at":"2026-08-07T10:28:49.027723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-12T23:59:47.266381Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-07T10:28:49.151530Z","title":"Calibrated self-rewarding vision language models.arXiv preprint arXiv:2405.14622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.151530Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:bf6af5c691509fa1d7e8297b1e4cd470b953273ea063883454644f7c2367de86","observation_id":"689686d6-4939-47c3-a39c-cfdbe7056327","resolution":{"observed_at":"2026-08-07T10:28:49.151530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T10:28:49.316868Z","title":"Aligning modali- ties in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.316868Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:a3a38e0c3b2c7951526417b0faac70f62740f69c747154d4c056da9f58c03d1d","observation_id":"3f21cf8d-a24b-47be-a337-9c536218f6ed","resolution":{"observed_at":"2026-08-07T10:28:49.316868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.281442Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization","venue":null,"work_id":"36e72aa8-04ba-4fb9-a065-f4a7f7c8f27b","year":2025},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.413288Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:53f99330dde355329d879d3ef3920a80e83172c98a937f9949127bbc0272dcae","observation_id":"c6a66a8c-c5fb-4e99-9b94-f1979f5e9ac7","resolution":{"observed_at":"2026-08-07T10:28:55.332426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10501","last_updated":"2024-08-21T11:36:47Z","snapshot_observed_at":"2026-08-13T00:29:10.116510Z","submitted_at":"2024-04-16T12:19:54Z","title":"Self-Supervised Visual Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10501","snapshot_observed_at":"2026-08-07T10:28:49.538730Z","title":"Self-supervised visual preference alignment.arXiv preprint arXiv:2404.10501, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.538730Z"},"links":{"cited_paper":"/paper/2404.10501","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:f1012e3e00a71054d5bef5b94655d009c4d7b068ff7afa6e8ca9aeb768f953fd","observation_id":"c1555e19-d7ec-4741-bafd-f014c10d7c53","resolution":{"observed_at":"2026-08-07T10:28:49.538730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-12T23:54:33.713097Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-07T10:28:49.630859Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.630859Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:8a8daa2275600e9d81914aac7e487cb21ee94f9327316407f4f22da88217235b","observation_id":"40649a4a-21ce-4624-8dde-4a990aab741a","resolution":{"observed_at":"2026-08-07T10:28:49.630859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02712","last_updated":"2024-11-05T01:24:37Z","snapshot_observed_at":"2026-08-12T22:07:43.732553Z","submitted_at":"2024-11-05T01:24:37Z","title":"V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02712","snapshot_observed_at":"2026-08-07T10:28:49.730599Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization.arXiv preprint arXiv:2411.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.730599Z"},"links":{"cited_paper":"/paper/2411.02712","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:a4e7b99d9c2669a51b4a113027063f6131645408aa6abcabd5a800f2de95b2b6","observation_id":"f4faa711-20ac-454d-a55f-eed1ac93a9dc","resolution":{"observed_at":"2026-08-07T10:28:49.730599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-12T22:31:25.254904Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T10:28:49.885639Z","title":"Llava-critic: Learning to evaluate multimodal models.arXiv preprint arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.885639Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:3c1c235674ae50899fe38fdcf88d6d017e2cc2c547f90118afca5eb4b9a4e34e","observation_id":"7219ed15-c1e1-48dd-91da-592f664f44aa","resolution":{"observed_at":"2026-08-07T10:28:49.885639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.011445Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.011445Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:ce29d54d1dcec55a4923193532a3c2117f9457e4501d95dde8b395f75a23b431","observation_id":"a6333614-1407-4612-933e-b8d170676237","resolution":{"observed_at":"2026-08-07T10:28:50.011445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17637","last_updated":"2024-10-23T07:56:48Z","snapshot_observed_at":"2026-08-12T22:16:58.394860Z","submitted_at":"2024-10-23T07:56:48Z","title":"MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17637","snapshot_observed_at":"2026-08-07T10:28:50.117579Z","title":"Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models.arXiv preprint arXiv:2410.17637, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.117579Z"},"links":{"cited_paper":"/paper/2410.17637","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:ae1ad0bb87e919177fbdc1826690067739deca4106d3467143202b5eefd4fcb3","observation_id":"f1fe44d6-e2ed-434f-a21f-4265d75d4059","resolution":{"observed_at":"2026-08-07T10:28:50.117579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:28:50.207227Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.207227Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:a000d965961fd4ed5a2cef8b2803c5fcc07409f9cc6e59d7d858e45204002047","observation_id":"3270e2b8-a8ea-4c7b-b7af-cb578d67f968","resolution":{"observed_at":"2026-08-07T10:28:50.207227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.305434Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.305434Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:5060db3e7408b8795f829b0afc9317dd686e84c776af44dfc2b910d12b320558","observation_id":"77c20d65-4420-448d-8ece-1103be391e81","resolution":{"observed_at":"2026-08-07T10:28:50.305434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T10:28:50.404469Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.404469Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:c4f1cf1431540ffaa4e233144de8c4f553b55f8872e985fadbd1e547fd88c46e","observation_id":"9d08fe25-05d8-44b6-baff-994531e31581","resolution":{"observed_at":"2026-08-07T10:28:50.404469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.063811Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":"5c5230ff-9090-42bf-b5f3-c54785c3b602","year":2021},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.481389Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:3fe7953a4ec70ace415936bdb1c33e2b929d918d0a5e177422c0870f14dee94a","observation_id":"26833bff-6594-4913-b455-b17868a7c612","resolution":{"observed_at":"2026-08-07T10:28:55.165696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-12T23:31:58.325076Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T10:28:50.622545Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.622545Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:96fa899a46dfea2ebe8f53f029f8aeb5d3776f1127c0289da449e2b52946dc13","observation_id":"543f8e17-0ffc-4fd6-aac0-f39935557265","resolution":{"observed_at":"2026-08-07T10:28:50.622545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T10:28:50.714518Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.714518Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:1b969f995d1bbd021d7dd42aa5c2cc5253406e7be5f3b7f9bc2c2ef38c06d2e4","observation_id":"e688c280-5d0b-486c-b6e6-65394988a969","resolution":{"observed_at":"2026-08-07T10:28:50.714518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:28:50.810656Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.810656Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:9c50303ceb544d857de1192bfa893bc1d685c1165d73e5d09eaeac2ef0f1338e","observation_id":"f80aa099-eb9c-451d-9aa0-396919a9d63b","resolution":{"observed_at":"2026-08-07T10:28:50.810656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T10:28:50.920945Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.920945Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:baff4c8dd393cfcc72997b2d443086027a01cbf934d9302223ffc8e2ad8d20dc","observation_id":"96c989f9-ebcf-4710-9e98-2e1186146552","resolution":{"observed_at":"2026-08-07T10:28:50.920945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-12T23:48:30.486852Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T10:28:51.015037Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.015037Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:15fc6ab0b491c723abcf5b77a5e7f8c9db854a5b3015e42ce365d22be58b111f","observation_id":"c2782dec-d4a8-494b-bbe4-8deb106d887f","resolution":{"observed_at":"2026-08-07T10:28:51.015037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.104238Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.104238Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0570be131804adae6ad0cf6f373ac90d63f920ac4784fd2bc2cd07ba2150646f","observation_id":"67ea4abd-87d7-4b0b-9e40-e8b935b22aa5","resolution":{"observed_at":"2026-08-07T10:28:51.104238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.857063Z","title":"aws-prototyping/long-llava-qwen2-7b, 2024","venue":null,"work_id":"97b3c33e-6934-4a50-b049-aed067114cb7","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.329194Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:14be11133ffbe0443b0edbf1edb577b7e04fed30f39a9d1fc91a1f736e77db62","observation_id":"04fb546c-0951-41d1-bce2-934208d8a927","resolution":{"observed_at":"2026-08-07T10:28:54.932150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-12T22:57:40.927684Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T10:28:51.431837Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.431837Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:8b23981ccbed24c11e798990861caf9e0b831dc87504573ce6281d8e688d6c08","observation_id":"97b1818a-42de-4fdb-820d-985568e79bc4","resolution":{"observed_at":"2026-08-07T10:28:51.431837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:28:51.563326Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.563326Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:b9a367312018a4d22e85e8a7149914c593d24191ae1ee756067a12f913a87810","observation_id":"d56b795a-64cc-4291-86fd-07789b11d2f0","resolution":{"observed_at":"2026-08-07T10:28:51.563326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.687089Z","title":"Temporal alignment networks for long-term video","venue":null,"work_id":"ea06f357-11df-4e56-adf0-8d3d17d9b9a5","year":2022},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.695307Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:da5af395bc4a01ec3ccda76ce7b07e0a983b1241c390e7b27c23ff2e60f844d6","observation_id":"cbeb08f8-64c3-46e3-a966-d5eae9f61395","resolution":{"observed_at":"2026-08-07T10:28:54.760273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-07T10:28:51.806239Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.806239Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:3e04b2b00fa4f6447fac90c798ecde726050baff9429f0d24d9e67b597f3658f","observation_id":"ded1134d-8f6e-40d4-bcd3-355b0f706f3f","resolution":{"observed_at":"2026-08-07T10:28:51.806239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-07T10:28:51.919841Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens.arXiv preprint arXiv:2404.03413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.919841Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:bcf15b45ef63fd66d012530c0257323854fa657507d756b1122f5509ac707f17","observation_id":"90c069d5-78fa-4889-9b20-ecc8e2e66d6c","resolution":{"observed_at":"2026-08-07T10:28:51.919841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T10:28:52.036063Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.036063Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:781d798444a1424cf8df0ea4620cd60b07fdd13ffc7d78676f9b2c0d2f1a0aae","observation_id":"841de52e-6fdb-4cd1-932e-e5d78859507a","resolution":{"observed_at":"2026-08-07T10:28:52.036063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:28:52.131174Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.131174Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:313078b4361874e9b452c7f250b9a27d575758e84382350731b478172a5e86ed","observation_id":"b5bc3b82-eb86-4917-8094-c69ed13df073","resolution":{"observed_at":"2026-08-07T10:28:52.131174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.530023Z","title":"Vista-llama: Reducing hallucination in video language models via equal distance to visual tokens","venue":null,"work_id":"5032b6d3-a0e4-46b3-a38e-24e9745a7a29","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.249257Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:99ec1bbaab133945b6e1c606a816b531895398509aa718e3ce6ddf12f00ca933","observation_id":"025af6e4-5523-48a3-bbb0-a31e17236f2c","resolution":{"observed_at":"2026-08-07T10:28:54.600521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.330867Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"6221acef-d3cf-44ba-ac63-619f75c17f4b","year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.323626Z"},"links":{"citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0033ef1d5b33081da2c1be8046274e4e1a3af3bbab66e32ed1dc8733a6162a5f","observation_id":"d4fe6a54-53d8-4197-bbb9-0a3aba7e0de1","resolution":{"observed_at":"2026-08-07T10:28:54.420895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-08-07T10:28:52.406829Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.406829Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0628f3e52aa4d85cc798a3be3aa930e0e0d773219bb367cc2b99231bf598fa01","observation_id":"6381f0d3-ecab-48cd-815c-29a40fcc0c55","resolution":{"observed_at":"2026-08-07T10:28:52.406829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04640","last_updated":"2024-03-07T16:31:02Z","snapshot_observed_at":"2026-08-13T00:59:58.905544Z","submitted_at":"2024-03-07T16:31:02Z","title":"CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04640","snapshot_observed_at":"2026-08-07T10:28:52.514103Z","title":"Cat: enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios.arXiv preprint arXiv:2403.04640, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.514103Z"},"links":{"cited_paper":"/paper/2403.04640","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:f73e899b1cbc1fe2cfec90567edbb8f2cb8f43e8dbab54c2596d804079809b23","observation_id":"5518530f-bb48-4847-adfb-cf52eff7b58f","resolution":{"observed_at":"2026-08-07T10:28:52.514103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-13T00:40:59.749269Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-07T10:28:52.598295Z","title":"St-llm: Large language models are effective temporal learners.arXiv preprint arXiv:2404.00308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.598295Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:06db23bbef62bfd51f4786a835fbc9fdf55c5791cf4bfb1ac60ed7201c58f094","observation_id":"b1649634-71a0-4263-bd39-1fb94d03ec3e","resolution":{"observed_at":"2026-08-07T10:28:52.598295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T10:28:52.675004Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.675004Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:d27dbcc700a6a1d229fe8779f5d8402b00623aa8bb73cf35ea0a7aff968bc217","observation_id":"7630b6a7-429d-4150-9796-7b38c732fd6a","resolution":{"observed_at":"2026-08-07T10:28:52.675004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:28:52.769185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.769185Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:51452b37e97dc5a41faa432471d9c866a1e3fae67511d9b6be05fc2e93e01ac9","observation_id":"27afb509-f49e-4f96-9c8d-6ab3dd4736e1","resolution":{"observed_at":"2026-08-07T10:28:52.769185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T10:28:52.855846Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.855846Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:5246ff9f4321a0cf2ad349e0bbd054ee744141bbab9385b6f03af0850054e7a2","observation_id":"efd4f661-ed5e-4a93-8567-59ebe3793f39","resolution":{"observed_at":"2026-08-07T10:28:52.855846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-12T23:58:23.908585Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-07T10:28:52.987620Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement.arXiv preprint arXiv:2405.15973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.987620Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:be2be4f396c0fff5c8e288e5ccfa3cf5e7dfe67f51eb54757f3332f86569c33e","observation_id":"e873ec0a-ab0b-4f29-a3b5-edc9fc45642c","resolution":{"observed_at":"2026-08-07T10:28:52.987620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T10:28:53.072713Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:53.072713Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:0083b0d0df129c1d3065c33e408ca1fa79d91317dcebc1ed7312b3003043b853","observation_id":"45796a56-d9a6-4f0d-ba93-5557fe424b6e","resolution":{"observed_at":"2026-08-07T10:28:53.072713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2506.05260."}