{"as_of":"2026-08-08T09:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b60e0e4dca11480dab84cab5f89a76b132296eccc409a187bea5e4d740b78a9b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:39:37.864500Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:09:46.394396Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:148c139fc5f43ca1d946032f20cc9cf88a844774f596bb56728b428a5f62347a","observation_id":"9fc03707-b6ce-471f-84eb-4d75de5d9fed","resolution":{"observed_at":"2026-05-11T23:08:36.577360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T18:39:37.864500Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.864500Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:a456e6df993f6bd3ef2634cfbe2bb3c46f9e62cee98113eadad47f52df21374d","observation_id":"238780b0-f35b-4771-8497-9b696b970edf","resolution":{"observed_at":"2026-08-07T18:39:37.864500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T18:32:21.022389Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.022389Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:f950d45ca21b76f2f398230e1951caa8e6ef124f0e6de254a1f9e15540357a6c","observation_id":"5724ed26-706e-4021-a240-b524f4676b17","resolution":{"observed_at":"2026-08-07T18:32:21.022389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:7811de92b2b82529db5255526f29bf996139ca5bd72137dfab4a1fb1b48f1f0d","observation_id":"01d71fb7-6b99-405a-9bc9-81f4537e1e12","resolution":{"observed_at":"2026-05-22T19:32:01.394165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T15:09:53.852749Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.852749Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:bb922667f659bb51d81b4f936e9102e99895c1f652953f393d6f6c9459fbab81","observation_id":"9cb827c2-9926-4f6e-8717-aabe5f2532a0","resolution":{"observed_at":"2026-08-07T15:09:53.852749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:57:26.468933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-07T14:51:39.133333Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.468933Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:48a257be98cdb8aa1a291ef7fb8b086cd4441c7dd89b03884d7e4923d9fe3e70","observation_id":"37779663-14c7-4844-8c03-42accb2ae545","resolution":{"observed_at":"2026-08-07T14:57:26.468933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:51:13.280315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17454","last_updated":"2025-05-23T04:25:10Z","snapshot_observed_at":"2026-08-07T14:44:37.452177Z","submitted_at":"2025-05-23T04:25:10Z","title":"Self-Training Large Language Models with Confident Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:13.280315Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.17454"},"observation_digest":"sha256:0761f436ec0c223fb1aee63a4c4f185a602c571f8fa948dc53290e706e90c5c0","observation_id":"9ec77987-1d39-4229-8a6e-f57c7ae1920e","resolution":{"observed_at":"2026-08-07T14:51:13.280315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:27:49.270567Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.270567Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:4606f56a18b6aaf5826feb04e362df489293c8949272127c2748f308091a44ff","observation_id":"49e448cb-6a11-4e17-ae8d-5ecd6eb7f0f3","resolution":{"observed_at":"2026-08-07T14:27:49.270567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:31:04.853691Z","title":"Shangmin Guo, Biao Zhang, Tianlin Liu, Tianqi Liu, Misha Khalman, Felipe Llinares, Alexandre Rame, Thomas Mesnard, Yao Zhao, Bilal Piot, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-07T14:25:47.818884Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.853691Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:3f3fabf99e4c5f9c5239a2855dc44a3245d8b7a785209289e4ab3cced1b62bde","observation_id":"70ae6733-b1b2-4dfb-88e2-ee7e74a226c5","resolution":{"observed_at":"2026-08-07T14:31:04.853691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T12:02:41.934550Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:41.934550Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:a6923a242ae7791b5a2e8955258f0420ccd0f188d7f8469ceda430b380c65b16","observation_id":"7f1ca33b-face-4559-ab79-aec833b99512","resolution":{"observed_at":"2026-08-07T12:02:41.934550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T11:20:15.560054Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.560054Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:ad83d664ca9243238f75777a1b61e11e576b5490d63a15c15c77e444cb1eeb29","observation_id":"23f9ea8d-a73f-4b8a-a799-0a9968480331","resolution":{"observed_at":"2026-08-07T11:20:15.560054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.185377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.185377Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:570b02c585be8290379d5da7e7334911419f9c9e3fd862eaba1a2959db7b7928","observation_id":"258e424f-f7ff-40c9-a1f4-26cfa3be0f3d","resolution":{"observed_at":"2026-08-07T05:16:43.185377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.189540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.189540Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:30e946ecfd0368a75315df3b291cd491034601c442f5e2dd9d4668f92f11b844","observation_id":"4d66ed61-f61e-490b-ae51-adb4cca2b999","resolution":{"observed_at":"2026-08-07T05:16:43.189540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T10:23:19.820010Z","title":"Direct language model alignment from online ai feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11091","last_updated":"2025-08-19T20:44:16Z","snapshot_observed_at":"2026-08-08T09:00:37.557630Z","submitted_at":"2025-06-05T18:42:57Z","title":"Customizing Speech Recognition Model with Large Language Model Feedback","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:23:19.820010Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.11091"},"observation_digest":"sha256:5b0b1c0e0ea42cb71dc383daaed37e29d434d351ee526e6bccec6ae8a6c9c6f1","observation_id":"9e272212-0a67-482e-b5a1-9831005a09d1","resolution":{"observed_at":"2026-08-07T10:23:19.820010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T22:28:05.981374Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-06T22:21:21.361920Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.981374Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:7dbc745bd2e88de2b9358ecc2b031ab452be6a028a0a79cb5b4bf7295daec07b","observation_id":"84f5acc2-ba3b-43e3-946b-d31459bd35a3","resolution":{"observed_at":"2026-08-06T22:28:05.981374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T20:43:26.226540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02173","last_updated":"2025-07-02T22:12:03Z","snapshot_observed_at":"2026-08-07T13:56:29.658636Z","submitted_at":"2025-07-02T22:12:03Z","title":"Data Diversification Methods In Alignment Enhance Math Performance In LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:26.226540Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.02173"},"observation_digest":"sha256:0560487e532b970e0677477f197eab306fd73cae8ca02e073dcc0dc0124e533f","observation_id":"a140d1b5-77dc-4353-9028-07de6ffee18f","resolution":{"observed_at":"2026-08-06T20:43:26.226540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T21:19:37.182865Z","title":"arXiv preprint arXiv:2402.04792 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02984","last_updated":"2025-07-28T05:53:50Z","snapshot_observed_at":"2026-08-07T08:32:24.456726Z","submitted_at":"2025-07-01T08:24:51Z","title":"From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:37.182865Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.02984"},"observation_digest":"sha256:f9f6e434ff7e74eea5f57bb0506b11b26d6854a6773cfd9c004443aceaed306e","observation_id":"1f54acb1-611e-49c7-ba95-7ebfe0a7f823","resolution":{"observed_at":"2026-08-06T21:19:37.182865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2507.06419","last_updated":"2026-06-04T20:44:16Z","snapshot_observed_at":"2026-08-06T19:02:44.982053Z","submitted_at":"2025-07-08T21:56:33Z","title":"Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-19T05:16:22.274580Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.06419"},"observation_digest":"sha256:b3e5bc57fff9d98ead229b23599273012d25338afc42062ce09d13cd6dfcf6bb","observation_id":"d796d31d-9f3b-4109-8e94-f04c9c540e35","resolution":{"observed_at":"2026-05-19T05:17:05.788905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T16:34:25.021993Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.021993Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:132e7387f7b420c8620f055b09df2c0f0a55b852a6a3bf01adf9dcabab4fc70c","observation_id":"2e45fe2a-0649-4a2e-88a4-cf1875fbf5d2","resolution":{"observed_at":"2026-08-06T16:34:25.021993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T04:36:13.417768Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03252","last_updated":"2025-08-27T11:39:11Z","snapshot_observed_at":"2026-08-07T08:32:28.646377Z","submitted_at":"2025-08-05T09:30:39Z","title":"Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:36:13.417768Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2508.03252"},"observation_digest":"sha256:d96e9f985f07f4a4adb5b6591e732e609cd256abb92e3c1f29873d2faf17f794","observation_id":"a9e3b838-9524-4038-8924-5fd067ad16f7","resolution":{"observed_at":"2026-08-06T04:36:13.417768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-04T09:48:05.297616Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13554","last_updated":"2026-06-08T06:02:10Z","snapshot_observed_at":"2026-08-04T09:47:55.188440Z","submitted_at":"2025-10-15T13:49:51Z","title":"Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T09:48:05.297616Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2510.13554"},"observation_digest":"sha256:2cba8f5b3957c71fc85303a6f88ac50479d10d8c3e46528cc21368cad491668e","observation_id":"7012f92b-6880-4eea-b3e9-6e20e0838a5f","resolution":{"observed_at":"2026-08-04T09:48:05.297616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2511.01014","last_updated":"2026-04-16T03:16:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-02T17:06:49Z","title":"IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:27:00.824546Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2511.01014"},"observation_digest":"sha256:4cd1b2c2aaa70f57367b0baac94c0c7e023657fe27d00787681ebdbc50d55920","observation_id":"d1431a99-d1bd-46e6-a6c6-9c58c7d34fcd","resolution":{"observed_at":"2026-05-18T01:30:35.839277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2512.16378","last_updated":"2026-04-25T20:42:51Z","snapshot_observed_at":"2026-08-02T18:57:30.783881Z","submitted_at":"2025-12-18T10:21:14Z","title":"Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T21:49:21.785096Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2512.16378"},"observation_digest":"sha256:4b37950c9a1d01872dd7bbf03ec0e63e3ec98a6e12b131a1f70228d97af48660","observation_id":"a917cb65-00e6-4af7-8631-da3807faf630","resolution":{"observed_at":"2026-05-16T21:51:17.792019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-03T14:24:21.154235Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-06T07:38:24.259000Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.154235Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:b27045ffbcb976dac490639b2a09d7c31ab778a981540ab08317304aa4b8d6b3","observation_id":"50f7b995-cb23-4176-9e28-933b1a7e0e1e","resolution":{"observed_at":"2026-08-03T14:24:21.154235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:6e27007e3abfb7d587bdc5c0afb0cd9578af1c274f0e13f6fb2a4b5bfb553741","observation_id":"38f530cf-96ab-414d-bebf-65dc1657cdfd","resolution":{"observed_at":"2026-05-14T19:12:24.704031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-03T07:11:58.083080Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21166","last_updated":"2026-06-22T00:23:06Z","snapshot_observed_at":"2026-08-08T01:56:52.723455Z","submitted_at":"2026-01-29T02:08:41Z","title":"Noisy Pairwise-Comparison Random Search for Smooth Nonconvex Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T07:11:58.083080Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2601.21166"},"observation_digest":"sha256:be6b145ebaff8c97693bde63e80143be7d28c03cca8682c299f752a1a8a5cec2","observation_id":"2215a8c4-a41f-4730-822e-34c9055982d1","resolution":{"observed_at":"2026-08-03T07:11:58.083080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:b4e2df7749f6ef72e2bee7bc6c9099de9c3c3961d1b2e5bde839f6c61e46d93a","observation_id":"9c503c54-32c4-4024-a4e6-2084b118b98c","resolution":{"observed_at":"2026-05-16T06:37:28.599444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:1838db4df076e9fd26509376b9af3ee8dae8a827a450a7037915905bce97c9bf","observation_id":"33020fae-9d6d-41e6-aa54-059289939857","resolution":{"observed_at":"2026-05-21T13:10:10.410196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2604.02766","last_updated":"2026-04-03T06:24:11Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T06:24:11Z","title":"Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T19:48:46.245576Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2604.02766"},"observation_digest":"sha256:aae966fdf69d7460a82c8ca6dfaf6ec14337efb34d94785870f33fa42105922a","observation_id":"c194993b-207c-4c12-8995-6db66a858ee6","resolution":{"observed_at":"2026-05-13T19:53:11.873009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:96d6d5c17176c9f4b1153c8d3b12320c8e1c121217d18ac63fe7ea225843e7dd","observation_id":"07d33688-9cad-4a73-bed4-c96ca2a55bfb","resolution":{"observed_at":"2026-05-10T14:00:28.597043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2604.15847","last_updated":"2026-04-17T08:56:36Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:56:36Z","title":"CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T08:48:12.941821Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2604.15847"},"observation_digest":"sha256:c2b106c7ca49f517a9b2daa9e4b316aad4e8a4a2c5a815579ec9394b9e4c6d58","observation_id":"99e214aa-2fbe-46cd-a9d3-90077f9be17e","resolution":{"observed_at":"2026-05-10T08:53:04.770013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2604.23809","last_updated":"2026-04-26T17:13:17Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T17:13:17Z","title":"LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T06:06:53.959061Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2604.23809"},"observation_digest":"sha256:6bee81a71ab27243f1bd01c254882aa8a86717c7b6e9a52ff2a39db80052c392","observation_id":"5777ec4c-c515-4c3b-8017-c2c5d5c9c181","resolution":{"observed_at":"2026-05-11T21:16:26.012326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2604.27733","last_updated":"2026-04-30T11:24:04Z","snapshot_observed_at":"2026-07-06T23:13:11.623453Z","submitted_at":"2026-04-30T11:24:04Z","title":"Mind the Gap: Structure-Aware Consistency in Preference Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-07T06:41:18.311986Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2604.27733"},"observation_digest":"sha256:03f6b45afbdde9e2ba531114e20efdc159f1c188592e4362ff5dbd414d5e3cc2","observation_id":"40b92d08-c052-432c-b463-ba6f952ed9bb","resolution":{"observed_at":"2026-05-12T10:16:28.582713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.02626","last_updated":"2026-05-04T14:15:24Z","snapshot_observed_at":"2026-07-30T07:44:04.614445Z","submitted_at":"2026-05-04T14:15:24Z","title":"Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:13.659698Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.02626"},"observation_digest":"sha256:0655faf24c0041fe006fb463275aa3b00295c886ad67feaa3564754fbe19b825","observation_id":"6efc0a37-4cae-4f1e-8eb2-e890ecd24a08","resolution":{"observed_at":"2026-05-09T06:20:41.769327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-08T17:01:04.571087Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:6fd12fa8f0c0bdab627cff008a261820c5c4bf1bebf3ff7501a43f8dadba9b36","observation_id":"d527bc9d-9315-4726-ab55-5629f13f5ac3","resolution":{"observed_at":"2026-05-11T17:51:09.228349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:4ab8c852694df5e72434b1b499995cc5128c00d1b5c843b384256de899dbfece","observation_id":"1a5303a5-7923-4d03-9a3c-e3cf9e802322","resolution":{"observed_at":"2026-07-01T00:35:10.418679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.08283","last_updated":"2026-05-08T07:38:35Z","snapshot_observed_at":"2026-08-03T16:22:22.745568Z","submitted_at":"2026-05-08T07:38:35Z","title":"HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:42.836549Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.08283"},"observation_digest":"sha256:449684a1015bb284429535d2515fb762b8a9958ee49fe25262b71dc2fc8b7bb7","observation_id":"485bf674-827a-4d27-9811-e11f5725fa08","resolution":{"observed_at":"2026-05-12T00:51:14.624333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.09291","last_updated":"2026-05-10T03:36:49Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:36:49Z","title":"dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-12T03:52:05.779559Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.09291"},"observation_digest":"sha256:62973e5d426eedbeda45d9ee3882133d9184d582433c36905da1d7dc1626fce2","observation_id":"0cfec670-b681-4450-bb79-82a96b6e339a","resolution":{"observed_at":"2026-05-12T06:51:29.686453Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:6e783144dcebc71873f5d7553fea92f49827a87e36ece5bbfdd1436cd09e40d3","observation_id":"bcc9ea60-ea4a-4e1d-8449-e318756e9fb0","resolution":{"observed_at":"2026-05-15T03:19:42.998151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:9799b61bed032f5cd924a916cfdc774c6b4a54e07f77834c953db2abfaddd4db","observation_id":"dec601cd-24b2-4258-86b4-a06000049b14","resolution":{"observed_at":"2026-05-20T19:43:44.127323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.23398","last_updated":"2026-05-22T09:11:20Z","snapshot_observed_at":"2026-08-02T13:58:02.707128Z","submitted_at":"2026-05-22T09:11:20Z","title":"TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T03:41:52.859647Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.23398"},"observation_digest":"sha256:ce75a3036a0aa9afb24be6b7ae092489b1b6a08040eb91364b5e67a480cfddf6","observation_id":"a3a6c154-8285-4758-8d63-6191ecf29af2","resolution":{"observed_at":"2026-05-25T03:45:17.516908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2605.26293","last_updated":"2026-05-25T19:30:45Z","snapshot_observed_at":"2026-08-08T07:50:39.752478Z","submitted_at":"2026-05-25T19:30:45Z","title":"CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T21:30:39.993873Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2605.26293"},"observation_digest":"sha256:e28e5ac61a85d628ddcad854fb7283f740496720d7e6bdbf053f52ef512eedef","observation_id":"d6bf4218-d171-4b0f-8898-8565ca3ab6ad","resolution":{"observed_at":"2026-06-29T21:33:59.069649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:88f4f8469071fc661217133c438343736ae15f43d3675e3f43f7ffc1a57ceb8d","observation_id":"303e8719-2e68-4ce7-a158-36d186402e70","resolution":{"observed_at":"2026-07-01T20:56:13.560428Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2606.04807","last_updated":"2026-06-03T12:31:42Z","snapshot_observed_at":"2026-08-06T00:35:56.342331Z","submitted_at":"2026-06-03T12:31:42Z","title":"BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T05:55:00.629666Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2606.04807"},"observation_digest":"sha256:2dbcba9cceed66430e308601b7e4fdd1001435a7dc1501512c80e3dfdc7e88a0","observation_id":"3e34989b-6faf-4738-b3ee-e8305e6abe1c","resolution":{"observed_at":"2026-07-02T08:36:48.330733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":219,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:c50acf43b426e5bdb3ff3507310a5122472bede9c0f37f55a1e5d5705e41056b","observation_id":"3fbc77f9-7207-494e-bd86-7239b59ed9bd","resolution":{"observed_at":"2026-07-03T01:37:30.508306Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":"2402.04792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-04T11:09:46.394396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":"55e38714-7a1a-46a1-81c1-04bccd2847f4","year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":209,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:815aa4e94cd9f08a72782e932127c4cfe04020520cceab744bf0f19c1bb4d2b3","observation_id":"5cb7cf2e-02e5-44ff-884a-07d8e2198004","resolution":{"observed_at":"2026-07-04T11:09:46.396105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-02T10:27:18.465337Z","title":"Direct Language Model Alignment from Online AI Feedback.arXiv Preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.465337Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:babf6704723b1134d298c529a34ee39211835454dd9c1fe10d7301035640f24f","observation_id":"c6fb746f-6fae-42ad-84f8-f9b65d2ac202","resolution":{"observed_at":"2026-08-02T10:27:18.465337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2402.04792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:9b607a12df6f63fcec66603dd954c03324fe382cb6078aa64551315904edc979","observation_id":"bd29c9fa-d3eb-4312-9572-46e39fe177cc","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-02T08:40:49.906858Z","title":"arXiv preprint arXiv:2402.04792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:49.906858Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:dcd6e2fe15e922b65f0a01a2704b5dc702331e8ea7a56ac3717d47e0cfd8f01c","observation_id":"459a5410-667f-4eaf-9155-22e366d49116","resolution":{"observed_at":"2026-08-02T08:40:49.906858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-07-31T21:13:05.334534Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24199","last_updated":"2026-07-27T09:24:41Z","snapshot_observed_at":"2026-08-07T18:43:26.314228Z","submitted_at":"2026-07-27T09:24:41Z","title":"Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T21:13:05.334534Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2607.24199"},"observation_digest":"sha256:9e9a89f4720dfb53066301dbd55de6d26e27160c673693cd978603483960b67a","observation_id":"bd08babf-de01-4076-b7cf-6777e4df8941","resolution":{"observed_at":"2026-07-31T21:13:05.334534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.04792/citation-record","integrity":"/paper/2402.04792/integrity","json":"/paper/2402.04792/citation-record.json","paper":"/paper/2402.04792"},"outbound":[],"paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2402.04792."}