{"as_of":"2026-08-16T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2be00e2a67d90f205667c2ff30c54118f6dfe28325871eccf709c0cb507bdf5","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:21:34.194345Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:54:07.795586Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:54:08.296887Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"cited_work":{"arxiv_id":"2412.20996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20996","snapshot_observed_at":"2026-08-07T10:54:08.296887Z","title":"Plug-and-Play Training Framework for Preference Optimization","venue":"cs.CL","work_id":"25593985-704d-42d3-b00f-9247573710d8","year":2024},"citing_paper":{"arxiv_id":"2506.04065","last_updated":"2025-06-04T15:31:46Z","snapshot_observed_at":"2026-08-13T19:00:44.799706Z","submitted_at":"2025-06-04T15:31:46Z","title":"Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:07.795586Z"},"links":{"cited_paper":"/paper/2412.20996","citing_paper":"/paper/2506.04065"},"observation_digest":"sha256:78b13b6ef7460c259dd99dcaf4ae1885827bfa778e495b9e9bf482cba4aa8ed2","observation_id":"1d65934a-13c2-4695-8d3f-7e4726f1ae05","resolution":{"observed_at":"2026-08-07T10:54:08.303337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20996/citation-record","integrity":"/paper/2412.20996/integrity","json":"/paper/2412.20996/citation-record.json","paper":"/paper/2412.20996"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.583561Z","title":null,"venue":null,"work_id":"1b2a54ba-479c-47de-a495-3c578060cc52","year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.044741Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:37afd2586916ac067fb344caa2b60e932232bc9e5f86e0fcf0a22abd06bd7390","observation_id":"3564f12d-8753-4209-a3c5-1e83fba7a1ce","resolution":{"observed_at":"2026-08-10T23:21:34.589737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.052324Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.052324Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:e4406398731d8aa1e207b0de55d6b0272706d7c3adf60ca32e6279a56d5edaf4","observation_id":"a6b4d70d-78c5-4441-b785-8677fbc71a73","resolution":{"observed_at":"2026-08-10T23:21:34.052324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-10T23:21:34.059249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.059249Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:9eb5210d7508fbc48436b45e3b4bf56781f3f4662369403fdc92365cc41bf40e","observation_id":"15a1c3a6-f2bf-446e-bd22-95f5aae24996","resolution":{"observed_at":"2026-08-10T23:21:34.059249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T23:21:34.066593Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.066593Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:0d80c958e6ec0a4ebf481afc1216f488fb8d16a6e7ff9af400a23e4a0abbc055","observation_id":"59b29907-41e9-47b2-8867-0504f47bb51d","resolution":{"observed_at":"2026-08-10T23:21:34.066593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.072127Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.072127Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:38127f5a0cec2c02ee4433cd27efb8fa6e5e76eca81a70f4b890091f23c31978","observation_id":"e6eb9c67-cb41-4bb6-823e-2f022e4af616","resolution":{"observed_at":"2026-08-10T23:21:34.072127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T23:21:34.077261Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.077261Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:2f56f5ea1276abc0735fe65443c5386079dfd4941110d09082f2302459783fce","observation_id":"bda95619-6b25-49b0-93fc-dcf667f81195","resolution":{"observed_at":"2026-08-10T23:21:34.077261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.084160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.084160Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:bf4c11fbc169d386c977aefd78353104b11898ed35fff1f174176bcdab7f32bc","observation_id":"b9db6b3c-c69a-4f0e-bb39-3694e933b3f3","resolution":{"observed_at":"2026-08-10T23:21:34.084160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-10T23:21:34.090842Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.090842Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:c74c058bceffe6763000aedd1ed7fb6c7a2e19a4e4486ef3fa07edc6cc9c01e8","observation_id":"4a9fd596-47fd-4510-95c5-ac298639d5bf","resolution":{"observed_at":"2026-08-10T23:21:34.090842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.097336Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.097336Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:4706785659ac5850229f522a60d3ec174e0ad58be1b2c9cdb9ccb1afb2a74122","observation_id":"14bdd9a8-efc5-43c5-a674-38c1d6e609b8","resolution":{"observed_at":"2026-08-10T23:21:34.097336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.102620Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen - Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.102620Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:663e3c112e9c46f526b7653969a3e6255840690979a49d700381933d3f5809f6","observation_id":"52a55dc2-aa65-4924-be4b-b5b8ef5595ed","resolution":{"observed_at":"2026-08-10T23:21:34.102620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T23:21:34.108960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.108960Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:38066dbd99476c4b5ebb8cf2736a5aacffa7e687acfb0c0f1714839cd0ae7446","observation_id":"ca2d97d6-65c3-449a-a8e3-ee73b60c5396","resolution":{"observed_at":"2026-08-10T23:21:34.108960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.115144Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.115144Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:8a0ccf823775a0b26e348b28a92dafa6045d6207fd7104e7b7bc3a7b4b7ea540","observation_id":"a17fe85c-4a1b-49b8-a4d2-e93bef8b1e43","resolution":{"observed_at":"2026-08-10T23:21:34.115144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.120444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.120444Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:21adcc0e3c6857799fcfb4f3635ded446a091e50ebeaf753fe8e2fea595ef5c3","observation_id":"3bb3c2b1-e36b-4716-b104-ac03abfa729e","resolution":{"observed_at":"2026-08-10T23:21:34.120444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.504938Z","title":null,"venue":null,"work_id":"a1aec2d5-8b01-4f82-98fe-7fe331bf3091","year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.125691Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:0a75c94a095ffb235d6b0802e6dadd8b9652c9908aba851a574af8d2b6be62fe","observation_id":"b1241d34-40ee-45e3-9f0d-0d6b37bec68d","resolution":{"observed_at":"2026-08-10T23:21:34.509937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-15T19:24:05.829199Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T23:21:34.130362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.130362Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:93a9b90f3cb44ca57cab8fa8d0615a852404a2ba7c1b857f20de7e1bee18008a","observation_id":"3e8f2b64-e06a-4f87-b95e-65de95d3453b","resolution":{"observed_at":"2026-08-10T23:21:34.130362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-10T23:21:34.136271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.136271Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:f9b3e06d724d2d4cf910664e2994efde1c6088c9a97ce20e8ef04d9ff3f5fd71","observation_id":"9bde83f2-9ad4-4195-88e5-facb4cf8b364","resolution":{"observed_at":"2026-08-10T23:21:34.136271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-10T23:21:34.141759Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.141759Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:817984937701bf78b63d8467eaff49bf07e8ba3780f0516342375f1777ec1626","observation_id":"9bc54500-0cbe-4546-a9e8-2b0c65b3e808","resolution":{"observed_at":"2026-08-10T23:21:34.141759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.486759Z","title":null,"venue":null,"work_id":"aff9e06b-2e0a-412d-b185-f858a70bb6f0","year":2007},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.146667Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:deee9e19c37d25ffbd79b633f76ce5f6ee85b3f564bd7e02a20155a4472998de","observation_id":"49b7ebf0-4907-404b-a9a7-618928c2db44","resolution":{"observed_at":"2026-08-10T23:21:34.493314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.152861Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.152861Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:7dee52520d3c0c88d9315011353c8e0eb8cfd75554f06873bbd5e9d08820d9e5","observation_id":"19657ecd-2bd3-40df-b998-4af41fcecbe5","resolution":{"observed_at":"2026-08-10T23:21:34.152861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T23:21:34.158147Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.158147Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:275b00ff051d335bf27d7b83e60e0c4531d79302cc1921d60290572c233da271","observation_id":"9a3acaa4-fc68-48dc-8028-907020d36a94","resolution":{"observed_at":"2026-08-10T23:21:34.158147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T23:21:34.164247Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.164247Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:511918d68efe3ec91840660d97361f45c6aad270fad2b1e8a3575cff9d948d52","observation_id":"a0ab056c-8d66-43d0-a617-e3feb2b29c60","resolution":{"observed_at":"2026-08-10T23:21:34.164247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.169349Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.169349Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:5a6e992352d226b6f3f21f59596242f921d631ba2178cbc73fdc26b13335cdb6","observation_id":"405f1f26-4d29-43a2-a344-a82199705812","resolution":{"observed_at":"2026-08-10T23:21:34.169349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T23:21:34.174862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.174862Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:0854938577fd59920d03bbd1ab43a2c903962b1714c277dd19730d6f9e2895cb","observation_id":"a6e3c076-9dc9-4fa4-a83a-532397b0be8f","resolution":{"observed_at":"2026-08-10T23:21:34.174862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.181641Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.181641Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:42d610ec30328d7c5b625bd9165a90df28a2dc3257f8c86b21a5c119ddc0c168","observation_id":"4fb18886-77a4-47b7-a14e-9cf8ea65bc92","resolution":{"observed_at":"2026-08-10T23:21:34.181641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.188212Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.188212Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:92ead938d40312e167f18b8b65be5e4db6ebc2c04d554af57315dd7582a83114","observation_id":"0cea60b1-0e76-4b86-acf1-d5eba7e78544","resolution":{"observed_at":"2026-08-10T23:21:34.188212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.194345Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.194345Z"},"links":{"citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:926462cd70b86c889a097e66deea17ad30a54d3b2a11bf6871c7991c493b8df6","observation_id":"dec7390c-6d40-4df8-85e1-03edd2e6e097","resolution":{"observed_at":"2026-08-10T23:21:34.194345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2412.20996."}