{"as_of":"2026-08-13T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da91d282fc714e0c6224843455b33a4b5b7955f4de076247015927c4b6afa5a7","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:43:27.228812Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.02561/citation-record","integrity":"/paper/2510.02561/integrity","json":"/paper/2510.02561/citation-record.json","paper":"/paper/2510.02561"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-04T12:43:25.890929Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback.arXiv preprint arXiv:2309.00267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:25.890929Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:efd98c5df116754cf0b869e527103c2a42efe30606eb4766b532a390b989b921","observation_id":"7cf321b0-87e6-485b-a24d-3d6a4a98476e","resolution":{"observed_at":"2026-08-04T12:43:25.890929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:26.110667Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.110667Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:7f4fa37a994d982e80887e4872edc29898929bed37a0f3d799cf67a9587f2126","observation_id":"d511aa32-e20f-437d-a84d-cbd0157179fe","resolution":{"observed_at":"2026-08-04T12:43:26.110667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:26.180441Z","title":"doi: 10.18653/v1/2024.emnlp-main.342","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.180441Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:d37293428e8c78dfdf9976b492dc9ed8353ca72e46c358e226e4de4bdb6cec68","observation_id":"43a8ced4-544f-4856-a4f3-1850d05a8341","resolution":{"observed_at":"2026-08-04T12:43:26.180441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15785","last_updated":"2024-06-27T12:05:48Z","snapshot_observed_at":"2026-08-13T10:03:47.236571Z","submitted_at":"2023-09-27T16:58:35Z","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15785","snapshot_observed_at":"2026-08-04T12:43:26.262167Z","title":"Ruipu Luo, Ziwang Zhao, Min Yang, Junwei Dong, Minghui Qiu, Pengcheng Lu, Tao Wang, and Zhongyu Wei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.262167Z"},"links":{"cited_paper":"/paper/2309.15785","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:28f7ad0b9cc73c1c36335bcc6d712a7d2f27ac1932a67d94d6ed8e476c1fcfff","observation_id":"4b5a927f-3563-448b-b4f1-cbf3e29cf05d","resolution":{"observed_at":"2026-08-04T12:43:26.262167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:26.509948Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.509948Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:45fd539bb73c54cdf4793073a3970d240ac5e9919a1bb92892a34090871092f6","observation_id":"e96f5fa5-9c47-4287-b1a2-a73a8c623e35","resolution":{"observed_at":"2026-08-04T12:43:26.509948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T12:43:26.690312Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.690312Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:6fd507865a150baf6035c9a9d2d57bfc88cfcf409a212677035cf9546abd5738","observation_id":"3d8ab01b-b7fc-47b3-9052-01d855daeaee","resolution":{"observed_at":"2026-08-04T12:43:26.690312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T12:43:26.965324Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.965324Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:6e3b5b3b544481812f7b248dd9649cca888b84cb6a2a4ecad08a6e0d3153988f","observation_id":"6eda4fb1-a3c0-42f7-bc1d-8bed18076076","resolution":{"observed_at":"2026-08-04T12:43:26.965324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:27.041149Z","title":"Raft: Reward-ranked fine-tuning for generative foundation model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:27.041149Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:8f5e9f71656d62e0c86e7da84b03d452c06d44b71fc6bb145bef6123811b08e6","observation_id":"116573cf-f3c5-45d8-8ec7-f40e46dac953","resolution":{"observed_at":"2026-08-04T12:43:27.041149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-04T12:43:27.130472Z","title":"Haiyang Zheng, Yuxuan Shao, Baolin Wang, Xiang Ren, Chen Sun, Junnan Liu, Xinyang Liu, and Percy Liang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:27.130472Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:119968ae5687e76c70a30bd808d558cb8d124f4a7ba7cce31bed209125f3b890","observation_id":"597da5fc-a21c-406d-8a06-12c1a5a55e55","resolution":{"observed_at":"2026-08-04T12:43:27.130472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:27.228812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:27.228812Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:7a202f00dd6adc29cc2c2ea741d50b563bf3072a11dba3bbb1d9fee633830190","observation_id":"fbb0c4d1-fcf3-4de5-9125-aea7c65c6655","resolution":{"observed_at":"2026-08-04T12:43:27.228812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T12:43:26.794397Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.794397Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:3cd29b9f4a0769874ca16852637ffcf7c6829dafc362a90dac9d3384c8a0e562","observation_id":"d9ea132b-402b-4138-b2d4-e438e1c1daa5","resolution":{"observed_at":"2026-08-04T12:43:26.794397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-04T12:43:26.888581Z","title":"Pandagpt: One model to instruction-follow them all.arXiv preprint arXiv:2305.16355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.888581Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:3ecd6c7f6fc6eaec30a0e6cbc50d277bbc9fbdb4f1cdb9dab1e0a4c6358a6421","observation_id":"d856d017-90c0-44e8-8ee0-6df666939542","resolution":{"observed_at":"2026-08-04T12:43:26.888581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:43:25.703607Z","title":"The accuracy paradox in rlhf: When better reward models don’t yield better language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:25.703607Z"},"links":{"citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:dfd2c3adc7bdd51b6ecac4d6fbf6bdf4b019b4cf013efe9e2c8cea2588f9c935","observation_id":"8200a115-dbf0-4055-87ca-a8a71ac058d1","resolution":{"observed_at":"2026-08-04T12:43:25.703607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T12:43:25.631443Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:25.631443Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:f151a67f0c499085e5749b69fe75b209e812845090b07cb73d5611216d4dbd87","observation_id":"e13194ef-23b6-422f-b0dd-408c34e93c02","resolution":{"observed_at":"2026-08-04T12:43:25.631443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-04T12:43:26.001661Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.001661Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:c9eadbb324e812ef13ac3f73270ae08cb4c12287636a2f30b39886cb92842782","observation_id":"546abc83-3175-495f-8eb4-18acdfcc4ff9","resolution":{"observed_at":"2026-08-04T12:43:26.001661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T12:43:25.780727Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:25.780727Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:a05a663a89329b21376e19656b96e7a2595ac614bdebb3dbe2bcf6c1c0007dc1","observation_id":"b41a9b51-1ea5-442c-9df0-2eea39130c92","resolution":{"observed_at":"2026-08-04T12:43:25.780727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-04T12:43:26.369390Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T12:43:26.369390Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2510.02561"},"observation_digest":"sha256:7799076601963ea3b466bfe41e8af431a6bf0bd8822f25f7d7178680a5d82ca2","observation_id":"cc54c339-f4b6-4761-841c-302c20bcdb77","resolution":{"observed_at":"2026-08-04T12:43:26.369390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.02561","last_updated":"2026-06-21T19:30:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:47:41.234845Z","submitted_at":"2025-10-02T20:57:10Z","title":"Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2510.02561."}