{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c0064ccc7b3531dc501ea7a30b827389112adf6b3b1bcbebb3f053d23ed1037","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:40:42.080296Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T13:06:54.002248Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T13:10:10.404876Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"cited_work":{"arxiv_id":"2502.06861","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06861","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design considerations in offline preference-based rl","venue":null,"work_id":"09c3c6cb-11d2-44d6-a1ad-296f9a473b37","year":null},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2502.06861","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:48563120f7798916eb6edda5150f66d2dbf7a0166bdac2d176096705261ab143","observation_id":"3fe1c548-1e61-48a0-9c5f-c0a9d67d8b9e","resolution":{"observed_at":"2026-05-16T06:37:28.516891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"cited_work":{"arxiv_id":"2502.06861","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06861","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design considerations in offline preference-based rl","venue":null,"work_id":"09c3c6cb-11d2-44d6-a1ad-296f9a473b37","year":null},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2502.06861","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:bb0c51c9021b283ff889f245ea5952d8d4aec9d153c63302ccbf5945bea25e0f","observation_id":"6a5f2044-b3f1-4b49-9a79-dc6d9ad3e799","resolution":{"observed_at":"2026-05-21T13:10:10.406878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06861/citation-record","integrity":"/paper/2502.06861/integrity","json":"/paper/2502.06861/citation-record.json","paper":"/paper/2502.06861"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-08T19:40:41.977517Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:41.977517Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:9137b429eba9e55e61df1339c1412d19d22da8c3398761b7d12c88648b9be9d1","observation_id":"18182556-cba3-4140-bd73-4b789af87ceb","resolution":{"observed_at":"2026-08-08T19:40:41.977517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:40:42.410863Z","title":null,"venue":null,"work_id":"32892822-0bdf-45d1-b147-43e6d44d98ab","year":2017},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.074455Z"},"links":{"citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:e515b81a9821a9005f7d3f0863fc03b27567e30335a22ddb36892c5923558a67","observation_id":"5c30b055-fb90-4bf3-8124-fbb6fabce50c","resolution":{"observed_at":"2026-08-08T19:40:42.415603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19316","last_updated":"2025-03-03T08:22:25Z","snapshot_observed_at":"2026-08-02T12:00:09.704648Z","submitted_at":"2024-05-29T17:39:48Z","title":"Robust Preference Optimization through Reward Model Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19316","snapshot_observed_at":"2026-08-08T19:40:41.999377Z","title":"Robust preference optimization through reward model distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:41.999377Z"},"links":{"cited_paper":"/paper/2405.19316","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:8555b7138c95e3475cc01ab413e3766e6416b406c59b43b3ab6689947e524bf2","observation_id":"89e4aabb-baae-45b5-af0f-9e2d9e9d6917","resolution":{"observed_at":"2026-08-08T19:40:41.999377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-08T19:40:42.004209Z","title":"D., Sun, W., Krish- namurthy, A., and Foster, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.004209Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:dc488b259ca4e9bd12e175664d5e0d995c3ad557f5e974aa2892af0303191e2c","observation_id":"28b3bc5c-75f7-4b8e-bf00-8d71f0b107ff","resolution":{"observed_at":"2026-08-08T19:40:42.004209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-08T19:40:42.009598Z","title":"Provably mitigating overopti- mization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.009598Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:0fef00171148db44e2aa046753d93ad6a7d056e838a7b38d69e2852496d94296","observation_id":"8e476658-38ac-4c5e-8c3c-b49441490b4c","resolution":{"observed_at":"2026-08-08T19:40:42.009598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-08T19:40:42.019294Z","title":"G., Row- land, M., Guo, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.019294Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:19fbb98f69a2d33b08d5c95675825dfeaf179faeebeeaa64e15a95b30d67c533","observation_id":"9ba1fac7-9632-4932-a5e4-4a15ee9fb486","resolution":{"observed_at":"2026-08-08T19:40:42.019294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-08T10:19:27.268855Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-08T19:40:42.029675Z","title":"Disentan- gling length from quality in direct preference optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.029675Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:fc1792d7a773fc1847489149ae4fafd010af8cd01167822f0f76fb39eb779e66","observation_id":"c94c4030-9263-4763-91fc-8508caf05beb","resolution":{"observed_at":"2026-08-08T19:40:42.029675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-08T19:40:42.034684Z","title":"Scaling laws for reward model overoptimization in direct alignment algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.034684Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:e86579ef417c876626d2036263988af1395b2436104d05090d227b3dce403420","observation_id":"5f84b809-9c0b-464b-9ae6-7e16dff56c16","resolution":{"observed_at":"2026-08-08T19:40:42.034684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T19:40:42.049982Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.049982Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:6b5e8ba4d7969b4e347f1c78f972875481f2c4535898db082c598b802f82e687","observation_id":"4639f06b-92d8-410e-aac7-ed4c6e12b946","resolution":{"observed_at":"2026-08-08T19:40:42.049982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14111","last_updated":"2023-11-03T18:36:03Z","snapshot_observed_at":"2026-07-06T15:46:21.260261Z","submitted_at":"2023-06-25T03:18:15Z","title":"Is RLHF More Difficult than Standard RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14111","snapshot_observed_at":"2026-08-08T19:40:42.054396Z","title":"Is rlhf more difficult than standard rl? arXiv preprint arXiv:2306.14111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.054396Z"},"links":{"cited_paper":"/paper/2306.14111","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:e51d6642a78fed4910f0b45a597a4e25a0b14e253c950ec03c1bfaf72d06ed67","observation_id":"a64d54ee-d14d-4af9-a98e-368242dbd36e","resolution":{"observed_at":"2026-08-08T19:40:42.054396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-08T19:40:42.069597Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.069597Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:0c2550fe8dc787b2746776186d5fd9795fd85d6b52bc5eb2e6d01b3cacf933b2","observation_id":"3c00348f-ff9c-439e-a0ce-a04c3d03c991","resolution":{"observed_at":"2026-08-08T19:40:42.069597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:40:42.392687Z","title":"The optimizer used is Adafactor with learning rate that is constant with a linear warm-up for 2000 steps and a base rate of 1e −","venue":null,"work_id":"ebbf1097-5c6c-404d-848f-1a3254df9200","year":2000},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.080296Z"},"links":{"citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:75a24bef045efab77d2ffa55aab711f4805b33b5651c6f212d0c061dae1111a6","observation_id":"5641bb44-ced0-44c8-8857-b9c0b6d82cc5","resolution":{"observed_at":"2026-08-08T19:40:42.399596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-08T19:40:41.989242Z","title":"Value-incentivized preference optimization: A unified approach to online and offline rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:41.989242Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:780456c8e8522b185de010fd5afc80c97ce4af8f2157f5ce981af38bc0c117e9","observation_id":"02e5e5a0-dffe-4b30-822d-13b599384c68","resolution":{"observed_at":"2026-08-08T19:40:41.989242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00045","last_updated":"2022-09-30T19:16:16Z","snapshot_observed_at":"2026-07-31T07:22:44.364265Z","submitted_at":"2022-09-30T19:16:16Z","title":"Calibrating Sequence likelihood Improves Conditional Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00045","snapshot_observed_at":"2026-08-08T19:40:42.064438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.064438Z"},"links":{"cited_paper":"/paper/2210.00045","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:5421a54b85028910f42a4214c685c5527b0624923a9bab2245f18e161523e8f2","observation_id":"e8739783-b312-4542-905a-f34c8373c5f4","resolution":{"observed_at":"2026-08-08T19:40:42.064438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04425","last_updated":"2026-07-03T03:04:48Z","snapshot_observed_at":"2026-08-04T06:53:56.097854Z","submitted_at":"2024-06-06T18:10:51Z","title":"On Regularization via Early Stopping for Least Squares Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04425","snapshot_observed_at":"2026-08-08T19:40:42.039660Z","title":"On regularization via early stopping for least squares regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.039660Z"},"links":{"cited_paper":"/paper/2406.04425","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:146b24ed163fa8f50237a0e0ea1e1e509584b3a89e1ec7bd42dba7790b3e00a8","observation_id":"a37fcd4e-f981-4ab9-8bd2-ce2ed2866e01","resolution":{"observed_at":"2026-08-08T19:40:42.039660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T19:40:42.014455Z","title":"URL https://books","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.014455Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:d18afe18ebe067ca674007eafaef3a915543c8a965d8f0c27066595468eceb8c","observation_id":"caabea31-3e40-41bf-b61e-2ab71ce38f96","resolution":{"observed_at":"2026-08-08T19:40:42.014455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-08T19:40:41.994465Z","title":"KTO: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:41.994465Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:5d2e83077919a79dcc444a4ccc90ac8c8e510c4dc8c310b3974c971ddec9cd05","observation_id":"d202202d-2a25-428d-938b-5161964e17b7","resolution":{"observed_at":"2026-08-08T19:40:41.994465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-08-09T09:34:04.204036Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-08T19:40:42.044924Z","title":"S., and Agarwal, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.044924Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:ad5aa32de3806248e38095b8d5f42cc8d99a8a29265bf3b6e0f07ac5332da89a","observation_id":"1daba942-17dd-4a26-bfe4-8731dcd449fd","resolution":{"observed_at":"2026-08-08T19:40:42.044924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-07-06T17:16:13.055978Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-08T19:40:42.059588Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.059588Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:52d7118ddda567f180a528175315cbc540e6f1b605e840b3003b5facc5c05e55","observation_id":"7d1f0652-e606-4e17-8087-744fdbbf5409","resolution":{"observed_at":"2026-08-08T19:40:42.059588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-08T19:40:42.024176Z","title":"Smaug: Fixing failure modes of pref- erence optimisation with dpo-positive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.024176Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:61a23cd97df24f4acd2c3339f7b16b8ab375893518c41d5128ec4b78e40bfa5d","observation_id":"89d56662-a529-4de4-8ddc-6401e9a9a7d6","resolution":{"observed_at":"2026-08-08T19:40:42.024176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-08T19:40:41.983451Z","title":"Direct pref- erence optimization with an offset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:41.983451Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:3c42d1b6f176f92e7433f35ca8fd817d46dd4c3d1526c5362061ed581d53e596","observation_id":"09c3038c-a61c-4307-9b25-f209c322ef1c","resolution":{"observed_at":"2026-08-08T19:40:41.983451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T10:06:48.659097Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2502.06861."}