{"as_of":"2026-08-13T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa304e6adcff1302a6a6e5f3efe8be56354cfd3d7096ff8f3c03e3d42648da39","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:31:10.814698Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16201/citation-record","integrity":"/paper/2411.16201/integrity","json":"/paper/2411.16201/citation-record.json","paper":"/paper/2411.16201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.521538Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.521538Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:f3fb2fad276d9ce7b81b4feaf92850e2d16a1e523726bb7a9481e79eee20b1d9","observation_id":"eca11ac4-b118-4b84-b791-5d36912e82cd","resolution":{"observed_at":"2026-08-12T13:31:10.521538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T13:31:10.527255Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.527255Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:833ca7fcc5c854e3f73cc9cb2389fb76b760e3e76b089729811523874a8918ee","observation_id":"22bd658a-6679-4d56-b378-404ad7ada325","resolution":{"observed_at":"2026-08-12T13:31:10.527255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T13:31:10.533202Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.533202Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:2a2232529f0033ecfa55af249be937d156ac09f88a175323e5ed8a97a8cc2b4e","observation_id":"ace32fdb-527b-4fd2-946b-bb00af8afd99","resolution":{"observed_at":"2026-08-12T13:31:10.533202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T13:31:10.539991Z","title":"Llava-next- interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.539991Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:2b8aa35ff1995baa04965fc2dd2d913cfcff8ee8d87d0b9e10d6e93cc1316262","observation_id":"bd396c2f-d606-4388-97d0-7a2753996647","resolution":{"observed_at":"2026-08-12T13:31:10.539991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T13:31:10.545848Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.545848Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:c3efcaf92af6f80463e2644cb290ea68224c4472eae4468c7ed48cd591f9c73c","observation_id":"dcb0f39c-00e6-47a1-8c81-6bcd4cf07bb0","resolution":{"observed_at":"2026-08-12T13:31:10.545848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T13:31:10.552918Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.552918Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a85c09a50878ca20e1339b2c1b24d247b5deed336146ca96ec8fa1a053bd872c","observation_id":"f2222748-57a1-49c7-8b5f-2c75b0e93df1","resolution":{"observed_at":"2026-08-12T13:31:10.552918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T13:31:10.559017Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.559017Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a3cad5c756dd82c5c7dc1547db82492a7d60c34152b9d414ad0f634eadcf90c1","observation_id":"853a2a25-2629-437f-8fe0-cda44967dfa9","resolution":{"observed_at":"2026-08-12T13:31:10.559017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-12T13:31:10.564173Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.564173Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a6047b6d74ec06a1f442dd253c300a9730e93bdfd7cfda10c187fd91b42f6e8a","observation_id":"08710526-0657-4472-8222-192f6e320dff","resolution":{"observed_at":"2026-08-12T13:31:10.564173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-13T00:39:57.337984Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-12T13:31:10.570432Z","title":"Direct preference optimization of video large multimodal models from language model reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.570432Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:5b3098cff369dd90282fe955fb0030fb73e8e28480616f3b44448f1304f8d001","observation_id":"f72d6367-31f0-4582-9c47-499e9a7b9109","resolution":{"observed_at":"2026-08-12T13:31:10.570432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T13:31:10.576440Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.576440Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:8b91d468ac52bc67cf42c73f2e05c283952b33b00363a20727d150f4075049de","observation_id":"6b977978-c600-4e54-9f9e-2b06636631bb","resolution":{"observed_at":"2026-08-12T13:31:10.576440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-12T13:31:10.582066Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.582066Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:acda6e236751569d12786e2840a68691631c468cac0d78ef2e5e8f3e120113ec","observation_id":"50ad9708-b22c-4188-9ed3-a8cfdd831e80","resolution":{"observed_at":"2026-08-12T13:31:10.582066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T13:31:10.587661Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.587661Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:8bfdf544a2ccf8a0189adb3f30f9671f867ed31b5fecf66f462f2bb512d261ae","observation_id":"d0eebc09-dac3-4705-9906-85b88d1675ab","resolution":{"observed_at":"2026-08-12T13:31:10.587661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-12T13:31:10.594338Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.594338Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:80574042944c69953844185ede188c2728859457df77e4d7aa4369049f998d1c","observation_id":"2c70d2ac-9b1d-4da8-b970-aff52c43e887","resolution":{"observed_at":"2026-08-12T13:31:10.594338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T13:31:10.600039Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.600039Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:b51211b869d47df55c0f5d115c80eece32c9d245d29bade4d9e78b2832df9f49","observation_id":"e4e687df-5993-40e2-9eaa-6a61212db21c","resolution":{"observed_at":"2026-08-12T13:31:10.600039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-12T13:31:10.605734Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.605734Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:d2a3683f96a605d4c4206a066e05d1bfe5a1a7d4493e212ed458b099866c07a6","observation_id":"0118922d-762f-4fdc-bcff-11827726ed82","resolution":{"observed_at":"2026-08-12T13:31:10.605734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.611788Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.611788Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:52885f6825618c19cb070a5e19548f08bcec7203018d9f9eb6ed1aff438c514c","observation_id":"6897a2d7-2a33-4c9b-8678-c23035d08cca","resolution":{"observed_at":"2026-08-12T13:31:10.611788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-13T10:14:47.864569Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-12T13:31:10.616988Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.616988Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:6d93c7f6010c0f83bb1668e1ee08d4a3100c4367154e7219961f43c622bbdfe0","observation_id":"32855b2e-1994-4440-8ade-2291b1ab1ee9","resolution":{"observed_at":"2026-08-12T13:31:10.616988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T13:31:10.621710Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.621710Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:ae04953711c6fe3e85effbc632ee9d6e2171cc4be4aa08a24072cf6dd4cde302","observation_id":"8c071df3-41bb-493c-a256-f81fcce82abc","resolution":{"observed_at":"2026-08-12T13:31:10.621710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.627777Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.627777Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:ac185aaa0c55f3ad5acf91d12f59f0bdf04d55698e7c9d0fcc78bc2514cab48f","observation_id":"fdf776f6-ceca-4d22-9551-1afc8ad641ff","resolution":{"observed_at":"2026-08-12T13:31:10.627777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-13T05:00:07.845665Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T13:31:10.635516Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.635516Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:348a6e8f77a0bfac94bfb8202be90a235a1421c0be910dc3ac201984b816a1d8","observation_id":"9332e79f-d7ce-46ff-82ee-da5bfda82e81","resolution":{"observed_at":"2026-08-12T13:31:10.635516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03746","last_updated":"2024-06-17T08:20:33Z","snapshot_observed_at":"2026-08-13T04:25:26.631532Z","submitted_at":"2024-02-06T06:27:40Z","title":"Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03746","snapshot_observed_at":"2026-08-12T13:31:10.642858Z","title":"Tuning large multimodal models for videos using reinforcement learning from ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.642858Z"},"links":{"cited_paper":"/paper/2402.03746","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:91e559e7459012cb82d694e52b4f96c04e92f1522553760044bd093760f1ef26","observation_id":"d7e5fbeb-dd43-4e40-a0fe-5cad899f7f54","resolution":{"observed_at":"2026-08-12T13:31:10.642858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.650203Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.650203Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a95ca6dd71cb606694d5644a2bd36e4e2dce6d64030e3314115c6a8226765dea","observation_id":"88b3a2d7-0385-44ec-8608-466cfb54084c","resolution":{"observed_at":"2026-08-12T13:31:10.650203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16792","last_updated":"2025-05-30T04:58:07Z","snapshot_observed_at":"2026-08-13T00:22:04.515541Z","submitted_at":"2024-04-25T17:39:50Z","title":"Model Extrapolation Expedites Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16792","snapshot_observed_at":"2026-08-12T13:31:10.657000Z","title":"Weak-to-strong extrapolation expedites alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.657000Z"},"links":{"cited_paper":"/paper/2404.16792","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:be79f2bc2dc10dde4339058b8d1df41f09b918ef3307eaff672370d552d79966","observation_id":"9a7dfcbb-7853-45c8-8df7-051d97f7878c","resolution":{"observed_at":"2026-08-12T13:31:10.657000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.663745Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.663745Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:7e48e79dd0acd005a08f162a5ee4f25e323d8bb2379a537392d998f050a89ef5","observation_id":"f3a7c618-105f-479a-b8e0-f5dd33172327","resolution":{"observed_at":"2026-08-12T13:31:10.663745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.670735Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.670735Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:2e6461872c4ed343fd74040db7ddb09dcb0cb415fd02cef378d9afcbbcc4f64a","observation_id":"191dc859-7ff7-4a0e-998f-720dd03601ae","resolution":{"observed_at":"2026-08-12T13:31:10.670735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.736475Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"7d9a7af2-f8f4-4cc9-8f90-bbd05a269c4a","year":2025},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.676275Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:98e51ba9b0ef2a356c18b52e33c5c7bb70b815b0a41e66442c94b9d6d2a00812","observation_id":"7b80de64-9711-4c68-befb-f88f3430b5dc","resolution":{"observed_at":"2026-08-12T13:31:11.745619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.681872Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.681872Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:3f987e900241e0f6cfce17250943d5f4a0604f0a8e80389732b20a015ce1989e","observation_id":"da689573-6cbe-4ae8-b9ce-9f1e8505ddf7","resolution":{"observed_at":"2026-08-12T13:31:10.681872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T13:31:10.687598Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.687598Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:e917c84c3098ec9f25810a59bc348cb85572949f5e5a8728f56334c176a8441b","observation_id":"ea46d369-dad9-4098-a159-5b1315716da8","resolution":{"observed_at":"2026-08-12T13:31:10.687598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.695262Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.695262Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:338345a5b297afae12ea6cc16beab53f9daa071d633a01ee7c864f9851e32214","observation_id":"fe0c5fab-4a56-46fa-ad5d-29576a414594","resolution":{"observed_at":"2026-08-12T13:31:10.695262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-12T13:31:10.702395Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.702395Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a2765dcf33acc23e44c0fa0610047d8e741ab6dab1b46a4ec21ede07a63bd4bc","observation_id":"ae951733-419c-4de0-8bee-6c3d47550f85","resolution":{"observed_at":"2026-08-12T13:31:10.702395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13709","last_updated":"2024-08-22T17:56:15Z","snapshot_observed_at":"2026-08-13T16:06:16.135019Z","submitted_at":"2024-07-18T17:08:10Z","title":"Understanding Reference Policies in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13709","snapshot_observed_at":"2026-08-12T13:31:10.714278Z","title":"Understanding reference policies in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.714278Z"},"links":{"cited_paper":"/paper/2407.13709","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:c60c872693176e6b198a1447bb4ebdd392fb355b757f87f312737dba1dda4257","observation_id":"0f6da3eb-9320-488a-b35a-d615b36ee3fd","resolution":{"observed_at":"2026-08-12T13:31:10.714278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-12T13:31:10.721135Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.721135Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:8abb300944960bfe8f304727234fcd8b673ff5f88dea41f4388f49edf1074133","observation_id":"92c1f849-6227-4133-b55c-5fdca36ea965","resolution":{"observed_at":"2026-08-12T13:31:10.721135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.682068Z","title":"Mitigating the alignment tax of rlhf","venue":null,"work_id":"fe986f40-d55e-499b-b0d7-29a8a169cbce","year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.730400Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:5271b54ad8c1c16e94a40ec44e54b51211962c8223f9d0f362ff88fc9bf1ce61","observation_id":"b6b0144e-f424-4ec9-89cc-34b2917dd750","resolution":{"observed_at":"2026-08-12T13:31:11.688096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17230","last_updated":"2024-07-14T08:02:49Z","snapshot_observed_at":"2026-08-13T10:02:16.488998Z","submitted_at":"2023-09-29T13:29:22Z","title":"Spurious Feature Diversification Improves Out-of-distribution Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17230","snapshot_observed_at":"2026-08-12T13:31:10.736454Z","title":"Spurious feature diversification improves out-of-distribution generalization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.736454Z"},"links":{"cited_paper":"/paper/2309.17230","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:74f4489989c14534e9129e5565e19aac38572362e82d0c22f6ae711ec38bb4f7","observation_id":"d9f3d4ec-cfa5-40b9-8788-4841e330076c","resolution":{"observed_at":"2026-08-12T13:31:10.736454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.743616Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.743616Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:a81943afa104880d5d85baf9b6d34fa8f87ec5c53ea67e60fe661ae8c3e0ccf6","observation_id":"3fed1565-deae-4028-ac33-0bf978d6e7f1","resolution":{"observed_at":"2026-08-12T13:31:10.743616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.751541Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.751541Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:eda15c3ea82ffacbfa7ef0ff959f2885d7c9302b1a10adc214575e088c7017ec","observation_id":"08502e6c-3882-4202-b606-44fdd5c2b591","resolution":{"observed_at":"2026-08-12T13:31:10.751541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.641454Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"4c6d4be0-8912-4788-b24d-983bb0f57ab2","year":2011},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.759683Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:733b005596837be441b7b01dd9fc0d02eb7dc2886578d066811ad394ce8c6765","observation_id":"4448ab51-afb0-46ab-a2be-246f99138b23","resolution":{"observed_at":"2026-08-12T13:31:11.646667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.765343Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.765343Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:3d49603302e6093b74f18c50e786d83c51aa32ea11b3a7829e22bcd49d219c0d","observation_id":"b7491e61-2905-4ed1-9a7f-8e0f7626bc67","resolution":{"observed_at":"2026-08-12T13:31:10.765343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.770443Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.770443Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:f7526db64b55c6d594141332ef181aba18a77f88f03c9aca199896e3ac16ac4a","observation_id":"f9000a92-d14b-4285-8f02-7219c1b1f778","resolution":{"observed_at":"2026-08-12T13:31:10.770443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.776113Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.776113Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:4fd7773b83a50e3e1034f3088c32fd1f6b975f353c600da5fbdaa0049c952311","observation_id":"7b5a80dc-c49c-460d-96ba-9fa08f53d769","resolution":{"observed_at":"2026-08-12T13:31:10.776113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.585262Z","title":"Vision transformer with quadrangle attention","venue":null,"work_id":"6f26152a-e584-4a2b-ba22-6b5b56d7098a","year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.781161Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:94dfc67363630795ba34b931f555ff9b59f94453a5686c7d8eb2b6c0eacad4c3","observation_id":"4499c109-e71c-4b1a-a225-533eb47d1388","resolution":{"observed_at":"2026-08-12T13:31:11.591064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:10.786726Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.786726Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:d014362cf1f030bbd684ee390c78909ade8e9cda8db8bbb9e8142fafbd481a0a","observation_id":"dc08f4c8-2f55-45f4-801d-1e6d1db9056e","resolution":{"observed_at":"2026-08-12T13:31:10.786726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T13:31:10.792205Z","title":"% 4.47 95.30 4.45 91.63 4.60 94.39 4.71 96.08","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.792205Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:1ce971e48b6b3299b6f6d14536d78eb7b635d2a02ff8283e1afa9a3b65c68843","observation_id":"ea81f325-c03c-41fb-8884-478455918ba4","resolution":{"observed_at":"2026-08-12T13:31:10.792205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.553333Z","title":null,"venue":null,"work_id":"6420fa4e-ae61-46e1-abee-6efee9b97442","year":null},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.797644Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:91a15f7b8d50cf7b54b124cc01bb373c390495e755174dafcab6f91eb151931f","observation_id":"28c2e256-00f5-4b48-bbb5-c1a4675cc820","resolution":{"observed_at":"2026-08-12T13:31:11.560023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.529627Z","title":null,"venue":null,"work_id":"725aa0dc-5ef9-4616-9385-ec7e94f09b6d","year":null},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.803316Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:3d92f09498b598638ed60008b7599772c140e9a8159da6f2468af12ba0b047e0","observation_id":"eb050356-f8a8-4c6f-96bb-d281a68530e1","resolution":{"observed_at":"2026-08-12T13:31:11.536951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.507405Z","title":"Consider the following criteria for evaluation: -**Relevance**:Evaluate how relevant the model's predicted answer is to the question asked","venue":null,"work_id":"172aac23-7121-477c-a3c9-2e76b6e858ee","year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.808796Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:ec2acd17391b64ab16ba66929cad6e0834552703423fc32c2a03ba8dfea382b2","observation_id":"43217553-0d2e-4953-9722-a874f9a72be0","resolution":{"observed_at":"2026-08-12T13:31:11.513344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:11.483371Z","title":"Temporal Consistency:Does the answer appropriately reflect the temporal progression and events of the video?3","venue":null,"work_id":"318165b1-a6b1-464d-a9f5-f88e7e6d97f1","year":2024},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.814698Z"},"links":{"citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:656aea6e4e0e10e83216a8344f9da0731cd4aa84225e2306c82e31bc0c409c6c","observation_id":"ddb17ddb-16c1-414f-9989-3f1d82ec9922","resolution":{"observed_at":"2026-08-12T13:31:11.492286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T07:17:26.849810Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2411.16201."}