{"as_of":"2026-08-22T04:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f124df191dc5fb5146738cef2c71da056cfa78cf1b74e75f89ea31c10408b1c","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:28:10.266576Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:50:46.549563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:40:08.218379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2509.21267","last_updated":"2026-04-22T15:37:16Z","snapshot_observed_at":"2026-08-15T02:13:41.066025Z","submitted_at":"2025-09-25T14:58:07Z","title":"Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T13:34:22.790199Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2509.21267"},"observation_digest":"sha256:765a6b37bd55deccde342fdbf88ea4948dbc02f84f53f9c88232260969806b5b","observation_id":"3ab7ef80-1dbb-46a4-821c-b519340abb04","resolution":{"observed_at":"2026-05-18T13:36:24.983666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-08-04T09:50:46.549563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13272","last_updated":"2026-06-03T06:16:13Z","snapshot_observed_at":"2026-08-19T13:28:40.358514Z","submitted_at":"2025-10-15T08:17:52Z","title":"Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:46.549563Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2510.13272"},"observation_digest":"sha256:ea111f92f56d7df7d82407f2bd4e758133d62ab001f58f0c6b7b080aa9f12db4","observation_id":"d3c3b757-9212-422a-b8f0-97949b079396","resolution":{"observed_at":"2026-08-04T09:50:46.549563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-08-03T14:24:21.679930Z","title":"Bridging offline and online reinforcement learning for llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.679930Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:a00c213981620c97a51125e01bca9de692881f58b85a1c7cca154bd46233e7bd","observation_id":"202772d5-4b27-4529-a7b7-41fb2b972c45","resolution":{"observed_at":"2026-08-03T14:24:21.679930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-08-13T13:27:48.320533Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T04:29:21.897215Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:87562b55c74e62c22ca063759cc22faa6d3026672344295bb1c94ffb885edc8b","observation_id":"089ad325-e523-45ab-a2c4-a1e5469647d6","resolution":{"observed_at":"2026-05-11T11:56:15.425803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:458f516e7f23d941706063ba6923a17de08d1f2d753ff295e63e30f6a9dd4139","observation_id":"7465628b-7cca-4c32-8f66-7c8684b401f7","resolution":{"observed_at":"2026-06-29T00:02:50.010858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.03698","last_updated":"2026-07-21T05:51:38Z","snapshot_observed_at":"2026-08-15T07:28:24.055030Z","submitted_at":"2026-06-02T14:20:09Z","title":"Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T11:29:46.554292Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.03698"},"observation_digest":"sha256:f318a5bed19cbfcbba2bf963c4ca459e5eeea42001c84bbf358ac40fc418e78c","observation_id":"b7230ccc-d595-499e-98fc-4d0eb1787025","resolution":{"observed_at":"2026-07-02T01:46:27.027263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-08-02T12:30:46.217716Z","title":"Bridging offline and online re- inforcement learning for LLMs.arXiv preprint arXiv:2506.21495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03698","last_updated":"2026-07-21T05:51:38Z","snapshot_observed_at":"2026-08-15T07:28:24.055030Z","submitted_at":"2026-06-02T14:20:09Z","title":"Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:46.217716Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.03698"},"observation_digest":"sha256:3296a6ef1968e39b67d9277dbcd01889b9274e039b5204b789c8f8a6bcfe9a1f","observation_id":"507f7013-5128-4117-8a77-4d64895355cc","resolution":{"observed_at":"2026-08-02T12:30:46.217716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.05464","last_updated":"2026-06-03T21:43:38Z","snapshot_observed_at":"2026-08-03T10:19:08.677126Z","submitted_at":"2026-06-03T21:43:38Z","title":"Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T05:46:26.938277Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.05464"},"observation_digest":"sha256:5af1d816da6367237b1b071b8387df898ecd0281cb42c3bf15839b1ccb45b3ff","observation_id":"cc445246-eaec-4226-b5fc-f4fefe4861de","resolution":{"observed_at":"2026-07-02T08:46:48.927436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:e093a365c0f96bf10ad2623f3da3c0dc1b91f9eeabaab7d3409ef1dc95c8cb02","observation_id":"7ee3a065-8118-4b92-9708-1f8e7d080591","resolution":{"observed_at":"2026-07-04T08:09:40.509771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.25996","last_updated":"2026-07-04T15:07:51Z","snapshot_observed_at":"2026-08-07T11:35:11.679286Z","submitted_at":"2026-06-24T16:08:31Z","title":"Autodata: An agentic data scientist to create high quality synthetic data","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-25T19:50:35.574454Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.25996"},"observation_digest":"sha256:e045f54c9da51faae55b7874f3cea2a85ccb1387b5e8c1c8345f8a6dcd6ff810","observation_id":"7e0c52fc-5ece-4b58-9779-38d28c66da07","resolution":{"observed_at":"2026-07-04T20:40:08.219887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.25996","last_updated":"2026-07-04T15:07:51Z","snapshot_observed_at":"2026-08-07T11:35:11.679286Z","submitted_at":"2026-06-24T16:08:31Z","title":"Autodata: An agentic data scientist to create high quality synthetic data","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T05:16:12.361470Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.25996"},"observation_digest":"sha256:e68a0e3fde71e3ee48ea4fa2305b4dcb8e6400067883236977ed0d3f36843b8e","observation_id":"f177b23e-6f8c-4e22-b30a-ef7b1335dae5","resolution":{"observed_at":"2026-07-04T13:19:51.287491Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2606.30642","last_updated":"2026-06-29T17:59:20Z","snapshot_observed_at":"2026-08-13T14:26:47.969747Z","submitted_at":"2026-06-29T17:59:20Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T04:21:38.825926Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2606.30642"},"observation_digest":"sha256:ffd640b998adf494f3e8ac0d598bea7c6aae25522ab6c6fa0d9afcbe670b5273","observation_id":"9cbe79a4-8756-444d-a1b3-b98c5f4f1484","resolution":{"observed_at":"2026-07-01T15:15:47.555967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21495/citation-record","integrity":"/paper/2506.21495/integrity","json":"/paper/2506.21495/citation-record.json","paper":"/paper/2506.21495"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:04.879326Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:04.879326Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:615e2fbd29f4f84bdc15a747c58250422c97c9b03a49c127a8687db4f246dbe5","observation_id":"344a4cba-33ab-4db7-a4f1-3f43136360d3","resolution":{"observed_at":"2026-08-06T22:28:04.879326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.518711Z","title":"fairseq2, 2023","venue":null,"work_id":"d6c71354-8921-4d77-8f37-844247231e6f","year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:04.982424Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:25ac049784829c4cedc076709b15af19cb335dcf6e2a9cc00cba7c23cd023a62","observation_id":"b4279561-afe0-46a0-89e5-01b5919863f3","resolution":{"observed_at":"2026-08-06T22:28:12.612372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.294734Z","title":"Preference learning algorithms do not learn preference rankings","venue":null,"work_id":"ed22b228-ae42-47fe-add0-768832cbbfd2","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.039479Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:a6b73de03f28cb49678eea56c5ab03a6459c80437293cc2c3518bf92bf0343ef","observation_id":"b781d302-fe36-4b2f-b531-b915a5c70a9d","resolution":{"observed_at":"2026-08-06T22:28:12.399050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-19T08:48:56.371619Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-06T22:28:05.128670Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.128670Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:10fecc8a4a3215091a55e2ae94ea551c7f770ea57e6103648c4e604e83115e7c","observation_id":"f37495a5-d296-46c0-b9df-2c80c0b198a9","resolution":{"observed_at":"2026-08-06T22:28:05.128670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:05.212164Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.212164Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:3a8e3f37ad07ab8c3e4afbb901ff5ed79e9c022bdcd7de330a5fc88e26611dcb","observation_id":"b7ef05f0-2c6f-407e-8e1f-2280965fa0c9","resolution":{"observed_at":"2026-08-06T22:28:05.212164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:28:05.308808Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.308808Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:a833c503d7d8930758abe0ff3a2baa1ce39fff54fb5212f177126bb7a66302db","observation_id":"fdc39dda-ea42-4647-896f-4e89e297eccf","resolution":{"observed_at":"2026-08-06T22:28:05.308808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T22:28:05.412620Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.412620Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:39258bf57aec1f092ed433fecb6a58d7293fba8869ae31ebf25e965651c8ee40","observation_id":"f133324e-40d8-4c15-997e-ea96aa6c6069","resolution":{"observed_at":"2026-08-06T22:28:05.412620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.112146Z","title":"Athene-70b: Redefining the boundaries of post-training for open models, July 2024 a","venue":null,"work_id":"c6a84bd2-1b5c-43ec-aee4-a8b2f79aed2d","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.547248Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:9ab9f0cd77fc32eeec891b734b5e0c57ff754bf55c97d21fdb9b9e4490451653","observation_id":"2a3fc58e-c16e-4c0d-b117-3ac588379246","resolution":{"observed_at":"2026-08-06T22:28:12.160526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14872","last_updated":"2024-10-22T22:18:14Z","snapshot_observed_at":"2026-08-21T16:41:10.991702Z","submitted_at":"2024-10-18T21:38:21Z","title":"How to Evaluate Reward Models for RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14872","snapshot_observed_at":"2026-08-06T22:28:05.645832Z","title":"Angelopoulos, Jiantao Jiao, Banghua Zhu, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.645832Z"},"links":{"cited_paper":"/paper/2410.14872","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:6b182f4ba72ac21b8830ccaea72073d1750d192f487f1ab41bff1814d6a63e7f","observation_id":"dafde6d9-7c3b-4dae-ac77-f8f20c1952cf","resolution":{"observed_at":"2026-08-06T22:28:05.645832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:05.741024Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.741024Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:8b70c243814272c90080a6e8bbc3c476555b56c673ce78dc78e45d7790b01b19","observation_id":"cebb86d3-51cf-482d-a85e-7cc9aa5a59fb","resolution":{"observed_at":"2026-08-06T22:28:05.741024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:28:05.871341Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.871341Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:9bc4a038acf0427ba9b744b707fc2daf8aeed2091b13b00b5cc2b9c85a297e51","observation_id":"2cc140a8-6a72-4d09-a3b9-bf86a18b7246","resolution":{"observed_at":"2026-08-06T22:28:05.871341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-16T14:20:38.839188Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T22:28:05.981374Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:05.981374Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:630e58ec178be7b8b7604092f35737dd84c40a2df25bd7a63193108813379a2e","observation_id":"84f5acc2-ba3b-43e3-946b-d31459bd35a3","resolution":{"observed_at":"2026-08-06T22:28:05.981374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T22:28:06.065494Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.065494Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:0cbda9f97b96c0bfe695fd532266e35c472377b1870cd1a36e5dfb7620dfc43f","observation_id":"587f2705-7c85-4e90-af71-3c6b3ee6d799","resolution":{"observed_at":"2026-08-06T22:28:06.065494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:06.143444Z","title":"ORPO : Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.143444Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:b9e972b32a1d1db1c691bf2201b1c71038310e6adfca0fd3530b102caf556555","observation_id":"8bc5fe93-ac70-44e6-944e-71c4a0713743","resolution":{"observed_at":"2026-08-06T22:28:06.143444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:06.218419Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.218419Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:fc0e659978392c34805a0419c33efaa6e4db78e209853e459b7fc786d7531981","observation_id":"648e4f9b-ba8a-4ae4-ad7c-fd7242c24883","resolution":{"observed_at":"2026-08-06T22:28:06.218419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:06.322902Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.322902Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:d0a86ee28a291111dbc34f60dec303b049fca38dce8953f8fcbf0d82ccc7ef75","observation_id":"bb5cea72-367c-44e7-ab17-1f8503bf2a32","resolution":{"observed_at":"2026-08-06T22:28:06.322902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T22:28:06.421583Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.421583Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:df92774e363f4e611e4b587de208407fffe3fc55a4608693b14f06b7dab2c53e","observation_id":"5a1178cc-fecf-4e77-8d95-f8d3fd2ee581","resolution":{"observed_at":"2026-08-06T22:28:06.421583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.926836Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions","venue":null,"work_id":"5537870f-6d61-4a06-8fde-ecdf32449d22","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.557537Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:fa729252d131de6b5ca05c836e063412480ee0d224aa30667a3df63276f666f7","observation_id":"53e6dc1b-db68-4490-854b-f79bda263def","resolution":{"observed_at":"2026-08-06T22:28:12.015713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.752154Z","title":"From live data to high-quality benchmarks: The arena-hard pipeline, April 2024 b","venue":null,"work_id":"d9229c4d-ffdb-4cec-a412-42bc08e6c27f","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.681214Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:e9034bde3c93cbfa75e83c566b4e5f213b74384b839173df3ea8b64729e8be65","observation_id":"9745ab9e-2f20-445d-8ffa-8f388e7736f2","resolution":{"observed_at":"2026-08-06T22:28:11.809112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-21T06:07:47.921030Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-06T22:28:06.760710Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.760710Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:947a867f7a05a38691f86a20192fb93503b7a6ba3a246465d60f6ae210628449","observation_id":"54b4cd45-973e-41ea-a2e1-ba3a182c92cd","resolution":{"observed_at":"2026-08-06T22:28:06.760710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-08-16T15:09:03.366337Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-06T22:28:06.859418Z","title":"Self-alignment with instruction backtranslation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.859418Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:5e2810e55b32ba7b9e252e89b6aeb9d070440634024c7aa42755f359c102939a","observation_id":"73c2a475-43b2-41d8-a0e4-231a0a7e259a","resolution":{"observed_at":"2026-08-06T22:28:06.859418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.634589Z","title":"Hashimoto","venue":null,"work_id":"cca8bdea-dfd6-431d-9d57-29c47780c442","year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:06.946488Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:2c841aa2eeaac601ee34183f75de0de64beb4d718684f9d789ae6929e80c1c07","observation_id":"bf53e613-46e1-4248-89ae-94c0df82f4d3","resolution":{"observed_at":"2026-08-06T22:28:11.687633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T22:28:07.062465Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.062465Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:a698f5d531a030dcbef51884a0c26e341bcad6f66a0ab0ecf3fee122a91e18ae","observation_id":"e8167f2a-9bfc-49f2-aa9c-e62e88efe5ac","resolution":{"observed_at":"2026-08-06T22:28:07.062465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-19T14:39:01.338131Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-06T22:28:07.163268Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.163268Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:827941a75e3a2030d32444d69a9af1d4106b757c8718d99921678e56a6bdb072","observation_id":"d68b4f96-d8a1-4c78-a8f5-74ec1ec203de","resolution":{"observed_at":"2026-08-06T22:28:07.163268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:07.276662Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.276662Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:6dd7f5b27446cdea52b49d01d5d72edd78846e4bae4452d34c5567fc68f9d26e","observation_id":"627f0544-a507-48b9-8e8d-b5dd31932f45","resolution":{"observed_at":"2026-08-06T22:28:07.276662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.438766Z","title":"Mixtral of experts: A high quality sparse mixture-of-experts","venue":null,"work_id":"f96ddafa-f9d0-4566-b6ba-ecf90a04e0a6","year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.363506Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:a251b54adfd0298351be34a9815a922f65a7b28a32031a0f2b5e57efec56f184","observation_id":"118a8369-2f59-4425-b628-9df5572ca0e0","resolution":{"observed_at":"2026-08-06T22:28:11.541879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.280862Z","title":"Ray: A distributed framework for emerging \\ AI \\ applications","venue":null,"work_id":"ff537bc2-017f-406c-b6a0-5aea1b0b9876","year":2018},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.471713Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:1bd7eb49fedcf3b0485c91b5a2d024ce2e1d20f2b4f06eb267220d9105238916","observation_id":"1af63203-9798-4f1c-948d-469e6525b206","resolution":{"observed_at":"2026-08-06T22:28:11.357146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:07.577745Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.577745Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:f554f0904be64f48308e7aa3640f9c0e224f5d4056b2202b3de0bae204719497","observation_id":"ceaffc31-60bd-42df-a8c3-a4578692c358","resolution":{"observed_at":"2026-08-06T22:28:07.577745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12086","last_updated":"2024-10-25T12:04:26Z","snapshot_observed_at":"2026-08-21T19:37:54.327369Z","submitted_at":"2024-01-22T16:24:43Z","title":"West-of-N: Synthetic Preferences for Self-Improving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12086","snapshot_observed_at":"2026-08-06T22:28:07.646010Z","title":"West-of-n: Synthetic preference generation for improved reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.646010Z"},"links":{"cited_paper":"/paper/2401.12086","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:19aed2fa04141c80d9891f1f324f5c04282cae455b305c4b2a608b6a15834059","observation_id":"d924b7eb-7f25-42fe-836d-3b7a7fe23925","resolution":{"observed_at":"2026-08-06T22:28:07.646010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:07.735012Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.735012Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:816b0567a59267f3ee61ad2adfea536b707cb17e20575c69d867e2fc35689e74","observation_id":"6e887785-451e-429b-81b5-183f57a09fcb","resolution":{"observed_at":"2026-08-06T22:28:07.735012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:07.868238Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.868238Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:1a54e40c4d488ae1e318651e3cd438bcf68ccb0f64046e7f7af53dc9e2c5b72a","observation_id":"8524ab45-8871-43d7-9e42-487e27f30440","resolution":{"observed_at":"2026-08-06T22:28:07.868238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-20T11:07:35.159951Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-06T22:28:07.964261Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.964261Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:41c95703668875776dc6a939fdfb698a3ceb72b1a2516fee42db7313376b3b90","observation_id":"561a7e33-73f4-4e69-9cfa-a42e91b4fffd","resolution":{"observed_at":"2026-08-06T22:28:07.964261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:08.036930Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.036930Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:3b8d0909e547d7c0e4ae9890dc238b612577b904c53007840caa9580cf54dff1","observation_id":"24110d55-6030-444d-b2d1-75b55ad7a8e0","resolution":{"observed_at":"2026-08-06T22:28:08.036930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:08.101830Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.101830Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:1c1d2a73ba9040e1e65e88203f0ea67ee06d7fe6df76a28effccc285c98ab916","observation_id":"02239330-82da-4ba0-a3d5-42fa36a5edc1","resolution":{"observed_at":"2026-08-06T22:28:08.101830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:08.225651Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.225651Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:62ec166a09c96c8ccceb346d55b519cd46d6f2163bd98743937bba7afd31b6ea","observation_id":"5b8ade72-fba5-41ec-a837-618165e1337b","resolution":{"observed_at":"2026-08-06T22:28:08.225651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:08.319306Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.319306Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:fd4118a5d833d066065cd4746675c700351d1d3194566d5b148bc19b7c5b2c02","observation_id":"eb2362c4-a505-453e-9bfd-7166795d23e6","resolution":{"observed_at":"2026-08-06T22:28:08.319306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:28:08.531883Z","title":"Proximal policy optimization algorithms, 2017 b","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.531883Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:8e6a3c56098e1f49f7ec2d098ca766b30a847223ce4c1bc292b8b2b7d5bfe22b","observation_id":"3120a6ea-4cc8-4632-a8fa-ac9bc2109dc1","resolution":{"observed_at":"2026-08-06T22:28:08.531883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:28:08.661390Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.661390Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:14f8dce2b49edfbb4ac0fbd859cd47308af715adef266bab522d74cbc17765f8","observation_id":"54604467-07e4-4c24-881d-947e81676d91","resolution":{"observed_at":"2026-08-06T22:28:08.661390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:11.079184Z","title":"Welcome to the era of experience","venue":null,"work_id":"99438255-1cf7-40f3-bbe7-d639e3a9beec","year":2025},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.768169Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:67aeba384bae51a0e0665f7b7e51a0ea40990f35d5e8e767963effc04b8a309b","observation_id":"a80e91d1-6705-43ff-8fc0-1e318c2c7c9a","resolution":{"observed_at":"2026-08-06T22:28:11.153605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:10.934077Z","title":"A long way to go: Investigating length correlations in RLHF","venue":null,"work_id":"c9a37288-82da-49bd-971f-7ed689b20638","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.855939Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:a8c4ecc4064b3fffc8bf4612004fad7516900ff39fd348405e702c5226e42a12","observation_id":"591e2016-2b65-4747-896a-17aba7f47326","resolution":{"observed_at":"2026-08-06T22:28:11.008634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:28:08.959424Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:08.959424Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:b3b10c38e9f6922b601d50ff09dda78f97d96105a027b2e29d90fb7a68574091","observation_id":"346d1015-0e56-44ca-b54d-f209525b007f","resolution":{"observed_at":"2026-08-06T22:28:08.959424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T22:28:09.048795Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.048795Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:fd959a679077f6be1906278bec743d59497a0c56a20bcb2bcea68d445b419dab","observation_id":"ccc5ca8f-c8c3-425d-becb-b12fdd54ce2e","resolution":{"observed_at":"2026-08-06T22:28:09.048795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-18T22:05:54.705341Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-06T22:28:09.134651Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.134651Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:f2efddd3a3b872283498e35ca2445ece2ed5678198d61a046546207c30b7e252","observation_id":"0d1cd526-46cd-488e-87b3-c0ba5b3fd08a","resolution":{"observed_at":"2026-08-06T22:28:09.134651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10630","last_updated":"2024-10-14T15:38:56Z","snapshot_observed_at":"2026-08-16T13:09:33.655948Z","submitted_at":"2024-10-14T15:38:56Z","title":"Thinking LLMs: General Instruction Following with Thought Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10630","snapshot_observed_at":"2026-08-06T22:28:09.217475Z","title":"Thinking llms: General instruction following with thought generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.217475Z"},"links":{"cited_paper":"/paper/2410.10630","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:e8c137ce03d3544ad6f6777dbf9f1a9a4955f506aae52e3cdc1c3ba38d81eec1","observation_id":"ce183029-a436-4bfc-a777-5425946aa887","resolution":{"observed_at":"2026-08-06T22:28:09.217475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-20T11:42:05.593922Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-06T22:28:09.310079Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.310079Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:f307b85aaa97166b608d498b059db224f92a3b5c4cc250c63da38102333981ca","observation_id":"baeaa4fb-5bd9-4b9f-84da-61c5d5ffab84","resolution":{"observed_at":"2026-08-06T22:28:09.310079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-22T02:29:32.961473Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-06T22:28:09.397544Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.397544Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:1288a0653b813a5298fcab2ec33b25cc137a7af1d2e6d62fccb924e66abf8b73","observation_id":"aadb1a06-6ba7-44f1-8ad0-d2b140535341","resolution":{"observed_at":"2026-08-06T22:28:09.397544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:10.731620Z","title":"Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf","venue":null,"work_id":"3c43645d-22d7-48f1-960b-a4414b406d1f","year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.483479Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:49c7cc02855f6e2e59542c3265cdc6d4c07f266e9a62d4750c16c8ba0b7519fc","observation_id":"a00e9344-8a24-475a-b719-bad7539cd25c","resolution":{"observed_at":"2026-08-06T22:28:10.850501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T22:28:09.578482Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.578482Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:76ee0ec2ebd5d3308e1f3cda372adbf65b3b853941080fe5dbf8e619c336d8ca","observation_id":"4d8e1c05-82c5-420f-9591-4dd36d84a8f6","resolution":{"observed_at":"2026-08-06T22:28:09.578482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-16T14:31:20.852372Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-06T22:28:09.691354Z","title":"Some things are more cringe than others: Preference optimization with the pairwise cringe loss","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.691354Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:2092821c7e813016d568e7d6ba29a73150a512ccd1071eda925ca77db5695798","observation_id":"ab9dd718-b78d-491d-9789-0004f8b42a36","resolution":{"observed_at":"2026-08-06T22:28:09.691354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-20T11:04:33.167279Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-06T22:28:09.790974Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.790974Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:6230f8d035cd19dd84d7a08f95ace75cc97124e6a775d42938735dda054bc7aa","observation_id":"6a88cb36-aac5-4a67-8291-9c4fc629a398","resolution":{"observed_at":"2026-08-06T22:28:09.790974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.623","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"BPO : Staying close to the behavior LLM creates better online LLM alignment","venue":null,"work_id":"5c4c2e50-2936-4a3c-ad21-40afd0c59185","year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.869519Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:4935ad2ed5bd8cfac29725a5e74abc83ec1b9a85d6f65ba96129a13021900d31","observation_id":"757a19e2-111d-4b8c-b2d4-47fbf950d92b","resolution":{"observed_at":"2026-08-06T22:28:10.442692Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-06T22:28:09.980703Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:09.980703Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:63c0ed124be68092487110e2268755d167c9cfb0393167dcfca6e5af41134de3","observation_id":"41c10192-46cd-49c6-aadf-e0e4536b6240","resolution":{"observed_at":"2026-08-06T22:28:09.980703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01470","last_updated":"2024-05-02T17:00:02Z","snapshot_observed_at":"2026-08-17T00:12:52.305769Z","submitted_at":"2024-05-02T17:00:02Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01470","snapshot_observed_at":"2026-08-06T22:28:10.083842Z","title":"Wildchat: 1m chatgpt interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:10.083842Z"},"links":{"cited_paper":"/paper/2405.01470","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:ddbd63dc0925e3ae62466954787452ab7f8e799411368bd0f44e388f492fb0ed","observation_id":"e89d6539-c0bf-45ad-b512-df53c68879fa","resolution":{"observed_at":"2026-08-06T22:28:10.083842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:10.181387Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:10.181387Z"},"links":{"citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:24a2b4fb592b695bf2aa4b8eb971fb114d7f2b40e238074d04eaaef21f73bbac","observation_id":"23af5f03-b49c-4648-8428-f8d344d54282","resolution":{"observed_at":"2026-08-06T22:28:10.181387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-21T16:54:14.450108Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T22:28:10.266576Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:10.266576Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:eca37eee785232bd4dbd6d46b2d16ecf24be2694a8b30a0d588a8d75212005b3","observation_id":"c4852346-3bd9-40a7-a77f-56969f60f120","resolution":{"observed_at":"2026-08-06T22:28:10.266576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 12 inbound Pith citation observations for arXiv:2506.21495."}