{"as_of":"2026-08-14T13:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92efd65bec6581014cf8559eb1dd961341cf705e2d70ff661100fec199ac7212","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:47:17.656530Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:46.666638Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:34:25.763556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04354","snapshot_observed_at":"2026-08-07T14:31:46.666638Z","title":"Reviving the classics: Active reward modeling in large language model alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21537","last_updated":"2025-05-24T09:07:13Z","snapshot_observed_at":"2026-08-13T18:49:31.787472Z","submitted_at":"2025-05-24T09:07:13Z","title":"OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-08-07T14:31:46.666638Z"},"links":{"cited_paper":"/paper/2502.04354","citing_paper":"/paper/2505.21537"},"observation_digest":"sha256:3d7c2f6f39734184e3558150068676203d82f4e61e92b146a745b03764979af7","observation_id":"13b03f5f-35e5-4c53-8118-8a89fa713ed7","resolution":{"observed_at":"2026-08-07T14:31:46.666638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2502.04354","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04354","snapshot_observed_at":"2026-08-06T16:34:25.763556Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","venue":"cs.CL","work_id":"5cbc144c-8813-42d6-925b-36fb5934db87","year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.182215Z"},"links":{"cited_paper":"/paper/2502.04354","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0684e05bb69bd03c4b7935681f3af81cc1d3b9320333f7f42feb2242ac0dcd44","observation_id":"6f256eb6-64ed-4697-934f-42d9e1153fb3","resolution":{"observed_at":"2026-08-06T16:34:25.767096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04354/citation-record","integrity":"/paper/2502.04354/integrity","json":"/paper/2502.04354/citation-record.json","paper":"/paper/2502.04354"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.101300Z","title":null,"venue":null,"work_id":"a9f6f9b3-26fa-4d46-b915-e4ab195d156c","year":2007},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.483686Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:fed09cf6e03dd516c4c29153503afa9437f37fa60af103731f3c6083db9e0944","observation_id":"174bb4b2-35d2-4388-948b-939e6546f868","resolution":{"observed_at":"2026-08-09T11:47:18.104986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T11:47:17.488100Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.488100Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:e2c6f0c7c0cfe2982e0b79418dffca6b241ed51d4ad7a03782a0619799a37370","observation_id":"574f42ca-56cb-4807-8531-c3e721a74159","resolution":{"observed_at":"2026-08-09T11:47:17.488100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-09T11:47:17.492470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.492470Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:c27a2abda31fb0290a87f505986bd16b9e958127002ffeb38c655a87fcee2d96","observation_id":"d0ff8392-f026-409e-b95a-8d437f5e521a","resolution":{"observed_at":"2026-08-09T11:47:17.492470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.497296Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.497296Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:b4a52453cfeb712cddfa902cb855fcd58ee9414339af5025813072a60de4a741","observation_id":"421a4be3-99bf-4c32-88da-4b2d20da9c7f","resolution":{"observed_at":"2026-08-09T11:47:17.497296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.085308Z","title":"and Broderick, T","venue":null,"work_id":"578e08e9-a19f-47ab-a6e9-930103ca3be7","year":2018},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.502024Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:c60c8162b6ce8ef48abd1cd6b538170792243fffc1525a282189cd1d4d80ce65","observation_id":"def6c9fb-8d3f-4735-8a6f-57c21c1d186c","resolution":{"observed_at":"2026-08-09T11:47:18.089022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.075964Z","title":"and Broderick, T","venue":null,"work_id":"7c4ce693-5ca2-4798-99d8-713f15421a00","year":2019},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.506476Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:0dbf90a07bd38a7d8c95b6f6785c525c86e30db71ecd8f00d0ba82ab672de2f2","observation_id":"73be46cb-f446-40c5-bedd-122907673054","resolution":{"observed_at":"2026-08-09T11:47:18.079532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.065843Z","title":"and Verdinelli, I","venue":null,"work_id":"8ca72879-c72c-4b6f-9aa4-ebe45a0403c2","year":1995},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.511315Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:1c45096eda510134edef7de729e8cac0d5145bf322170863491655179a51112b","observation_id":"c3a7be71-321d-4e9c-a0f1-b9e1e4c87fcc","resolution":{"observed_at":"2026-08-09T11:47:18.069294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.515446Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.515446Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:1ab65366cc6fd00c80c224c526a9ad0d21d20cd7b0d56c049b9f835f8b18a50d","observation_id":"fdfe3e72-a9f0-48fd-a50f-37861c61d6bf","resolution":{"observed_at":"2026-08-09T11:47:17.515446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.050858Z","title":"I., Santos, S","venue":null,"work_id":"0fbe2251-958d-48df-9233-35c5960ba016","year":2015},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.518741Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:7729db38195198bcbd1864930e73ab586a68cde928d341df8aecb2532ff02d2f","observation_id":"8d478326-31d9-4d69-ae24-51535ff72f5e","resolution":{"observed_at":"2026-08-09T11:47:18.054172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-13T05:57:41.785838Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-09T11:47:17.522690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.522690Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:0c519d5f15dd503dda861d403227fcf76e3054e0dc12603d746d7f6acd6cb722","observation_id":"e538dc2d-97f4-4c23-8dd9-ab195e63b329","resolution":{"observed_at":"2026-08-09T11:47:17.522690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.041104Z","title":"and Lindley, D","venue":null,"work_id":"01976b22-883e-4944-9184-760ad431796c","year":1981},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.526764Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:29802238257ed5e791e22cb85abbecf564f399ace61d045e12bbc4b234cc817f","observation_id":"0647d1c7-36b5-4203-bac7-7901b6c74ce9","resolution":{"observed_at":"2026-08-09T11:47:18.044631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-09T11:47:17.530335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.530335Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:40a22eebbc1ee6bc5750b511885d77d0c64fd5d4af46eb021aa36e499ffa401d","observation_id":"f369319e-ccf3-45c4-84da-8814aa6852dd","resolution":{"observed_at":"2026-08-09T11:47:17.530335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-13T14:44:02.569922Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-09T11:47:17.534445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.534445Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:3208fe0f50f7e5a830787a82aeefd2191eebc0b7f2a8436ce00123ab190ebd19","observation_id":"fabc0822-4643-490c-bc48-f3d97a5d7106","resolution":{"observed_at":"2026-08-09T11:47:17.534445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:47:17.538302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.538302Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:bfdf7abb870a229f8dfee8f3c1baf4104ebb19ff6ecd0b06f6d533010322f7d1","observation_id":"7222187e-abbb-4a67-bbde-25f6e9312ecc","resolution":{"observed_at":"2026-08-09T11:47:17.538302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.028884Z","title":null,"venue":null,"work_id":"67c62a9e-6742-4232-8c28-68ef7e9f8b6b","year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.541845Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:fe10eec3183f87ce7f743bcf4c0d93eabcc365d3a0d37259a0e8f78eab7539c2","observation_id":"b9202e05-ea5c-4e0c-9332-e853598b3078","resolution":{"observed_at":"2026-08-09T11:47:18.032853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-12T23:52:06.447877Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-09T11:47:17.545110Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.545110Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:5034ce1949e6df0fe5ac2d736cef1ba3ef55cfaecdb48d2f9798739dbafb2e7a","observation_id":"eb7c576b-ffe9-4c0b-842d-b2cfb32a03f7","resolution":{"observed_at":"2026-08-09T11:47:17.545110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-08-12T12:05:47.570397Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-09T11:47:17.548632Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.548632Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:0632f93986a96eacc912fe4ca1b350f96797c19902374a3a818370e2b0f67e62","observation_id":"a118c3d7-72b8-488b-a82e-5df92d1e56ba","resolution":{"observed_at":"2026-08-09T11:47:17.548632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:18.010197Z","title":null,"venue":null,"work_id":"480d479d-a85e-4f57-9a34-d1da544dc746","year":2016},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.552135Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:ddc1f0993dafa3b73b851b0d8eb46986c47901a3ebed236f72be60c8598ca304","observation_id":"9867a51b-9551-426f-8040-bc6394a2b309","resolution":{"observed_at":"2026-08-09T11:47:18.013715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.998897Z","title":null,"venue":null,"work_id":"0ba74473-64ec-4b4f-83fa-0e55ba948249","year":2019},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.555638Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:09db6ddf11a90be844305222ae58b3d58ee2917dd6e657abea9334423243c7e4","observation_id":"a7a444ad-3e2a-4116-b84a-7a03e2cea1a5","resolution":{"observed_at":"2026-08-09T11:47:18.002625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.988172Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., Smith, N","venue":null,"work_id":"a3cc9861-6f74-4e26-a52f-f5207afb3f10","year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.558917Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:a0fd0e62e74bfc32543cc3bbe5b3d30a980925247d7ab84782572520624a491f","observation_id":"44e5298d-977f-4d99-9569-d0ba02dd4071","resolution":{"observed_at":"2026-08-09T11:47:17.992376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-09T11:47:17.562132Z","title":"Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.562132Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:8168f88e33363925d4ae22dd04bbaaeb7be61b5dcf053461fa22dd866c74eedb","observation_id":"05800bff-4fb0-469b-abc4-9d7c6776d3bc","resolution":{"observed_at":"2026-08-09T11:47:17.562132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-13T10:14:47.864569Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-09T11:47:17.565775Z","title":"J., and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.565775Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:b0abaf96a660866a37af846b77e7c68116aafea52f2b4055280627c0dd868fef","observation_id":"9f60a0c9-e24e-48f1-9307-f3c5565b4fa2","resolution":{"observed_at":"2026-08-09T11:47:17.565775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-08-12T22:33:14.632545Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-09T11:47:17.569691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.569691Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:35696743c210e34461f23afda464e304431e62676b3b0f152f23902b8ad893c0","observation_id":"19a4e2fc-69d7-4c01-b1a9-f1fe15219fd6","resolution":{"observed_at":"2026-08-09T11:47:17.569691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.978539Z","title":null,"venue":null,"work_id":"8af632d9-a6ae-4ddf-bccd-5a4af4253fef","year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.573706Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:14c9d196f961750295d6dade353a67a127e8d8854d2eb9cb1f5f85328fa394a6","observation_id":"74abd0b1-95f9-4f5a-8379-137c39ff5c3c","resolution":{"observed_at":"2026-08-09T11:47:17.981824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.968488Z","title":null,"venue":null,"work_id":"41685e7c-9b23-4064-9954-837fc3645230","year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.577086Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:39183c818aac375c0774e45af44b53389fffbecb7b52de2cd50fd41836afe5d4","observation_id":"4216feaf-9aff-4e0b-b0be-172324f8c281","resolution":{"observed_at":"2026-08-09T11:47:17.972166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-08-13T04:20:10.808198Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-09T11:47:17.580916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.580916Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:88884dd8a39ca7357260c1be388e153d295f505e4278b4617f94df19c94bf8d7","observation_id":"4f263f93-3b0b-4669-90f3-6a7a378ae7f7","resolution":{"observed_at":"2026-08-09T11:47:17.580916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.958825Z","title":null,"venue":null,"work_id":"9df62907-e473-4794-b237-06a89470b413","year":2018},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.584746Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:19984cb150929caa61c587c06831cc497c11d560c3fcdc9dee796c40da22da7a","observation_id":"03b7d3ca-8995-4aaa-b5ea-ee8e23a7e105","resolution":{"observed_at":"2026-08-09T11:47:17.962404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.948971Z","title":null,"venue":null,"work_id":"a72e2464-a33d-4eeb-b67f-471859d4ccee","year":2022},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.588213Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:14214bbbb5b52faf52441bfff10e1ea727e313119da4413c01ee358febb61d7c","observation_id":"ad69f174-c741-4499-9a5d-ebdfd45bbb82","resolution":{"observed_at":"2026-08-09T11:47:17.952310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.938881Z","title":null,"venue":null,"work_id":"2e080657-b405-442b-ac60-1b274fc60439","year":2006},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.592077Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:74b3d6104e1bf122cded65eb54ad46d6486b8dd23625b530c3c6e3912dfb6c38","observation_id":"8b5965a5-7467-42f9-bcd3-6b122384601f","resolution":{"observed_at":"2026-08-09T11:47:17.942255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00489","last_updated":"2018-06-01T10:17:23Z","snapshot_observed_at":"2026-07-06T05:53:39.440274Z","submitted_at":"2017-08-01T19:50:53Z","title":"Active Learning for Convolutional Neural Networks: A Core-Set Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00489","snapshot_observed_at":"2026-08-09T11:47:17.595834Z","title":"and Savarese, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.595834Z"},"links":{"cited_paper":"/paper/1708.00489","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:e2b6d252eccb7b520d14224b7041281085e0aa5eabdd6825795d3c8dde9264c7","observation_id":"33633452-c62a-4b11-be23-3328cb1c3c85","resolution":{"observed_at":"2026-08-09T11:47:17.595834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.599848Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.599848Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:61363a305b2f85530f308b3ee35a1c5b0859eb2e92dccbc9ef4c252a84ee7205","observation_id":"630da295-44db-4efc-95eb-386572fc8886","resolution":{"observed_at":"2026-08-09T11:47:17.599848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.603665Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.603665Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:26103d43d83b0fe8f64f90d8b238f3419a78406116c76043e4911307b8e61b03","observation_id":"63a778b0-0f9f-4b9d-96c1-f592b4fc4b51","resolution":{"observed_at":"2026-08-09T11:47:17.603665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.914413Z","title":null,"venue":null,"work_id":"1f2d2ae2-845b-4fea-8fa6-3cb376aef522","year":2020},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.607299Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:843065f2f7e03667540de5853cf975feea5de60f5d12bb5eeb23e719419bb98d","observation_id":"e3e6f97b-f54d-4bf2-b662-4252f89b9899","resolution":{"observed_at":"2026-08-09T11:47:17.918111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-08-12T22:05:24.777000Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-09T11:47:17.611380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.611380Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:990b2bf3d5621e26b8b25a39df52500df4488eec99cab16f67a2dfbf09da975b","observation_id":"e4c1d78b-fcf4-4cdd-a783-98b08dbba329","resolution":{"observed_at":"2026-08-09T11:47:17.611380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-09T11:47:17.615382Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.615382Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:69f1887b707029a6c7cb8af1ebb0a60af48da19dd0ade611831aebd4784e4b10","observation_id":"6b591223-f09c-4cc6-aca1-575fccf4d264","resolution":{"observed_at":"2026-08-09T11:47:17.615382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T11:47:17.619197Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.619197Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:2b3cf7b13406e322f9208ddc021fb11bdc04c6d6f90440f54bebe487eec98888","observation_id":"50417d67-ee5a-4c7d-a818-9f41f644a5dc","resolution":{"observed_at":"2026-08-09T11:47:17.619197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.903481Z","title":null,"venue":null,"work_id":"ffc65982-42eb-4aba-857c-a79f6d3c6192","year":2019},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.622985Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:0b0bf5daee6b138ee722715c314529f286ca4a0b0100957caf87e2e7a6fa4722","observation_id":"9b8e3b49-8a77-4747-8ce7-b0eb02a0a7c5","resolution":{"observed_at":"2026-08-09T11:47:17.907633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.891639Z","title":"and Chris Glaze, B","venue":null,"work_id":"4c072285-7f91-418e-a712-5d83e5d48875","year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.626782Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:efe978be163cb3ab4af29a6dcb9eface930b7e23f0799c9e9f7010e4e9ea3563","observation_id":"ca588570-0b37-4682-85fb-bc775174bb3e","resolution":{"observed_at":"2026-08-09T11:47:17.896575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:47:17.630417Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.630417Z"},"links":{"citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:da94399580d4452230caf60db4a196d1556f3235be3724be4157ef2017bad4f5","observation_id":"c0bdc399-e989-4d4e-92bf-b379aed4f951","resolution":{"observed_at":"2026-08-09T11:47:17.630417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-13T04:44:24.606309Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-09T11:47:17.634354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.634354Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:1e30a633d02c58bf1818b8b5fd91de1d18576d238485803f96648873ffdcdffa","observation_id":"791982b8-e588-4887-bc77-7e90d866e91f","resolution":{"observed_at":"2026-08-09T11:47:17.634354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18571","last_updated":"2024-03-06T08:07:02Z","snapshot_observed_at":"2026-08-13T04:07:57.691711Z","submitted_at":"2024-02-28T18:58:25Z","title":"Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18571","snapshot_observed_at":"2026-08-09T11:47:17.638227Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.638227Z"},"links":{"cited_paper":"/paper/2402.18571","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:035a5e681f3027054b33903d45daa3386fe55a2b7d9a45a2466bcac8fc59ee67","observation_id":"f269a302-d70b-4d9f-af17-0cb8f115d568","resolution":{"observed_at":"2026-08-09T11:47:17.638227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02381","last_updated":"2025-02-28T23:33:22Z","snapshot_observed_at":"2026-08-12T22:31:46.054214Z","submitted_at":"2024-10-03T11:01:25Z","title":"MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02381","snapshot_observed_at":"2026-08-09T11:47:17.641981Z","title":"I., Anugraha, D., Susanto, L., Kuwanto, G., and Wijaya, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.641981Z"},"links":{"cited_paper":"/paper/2410.02381","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:b6029edd07afea6038ef481c4da63231b9e62a3f0dbe54bb8557622695b8f697","observation_id":"dd4ef48f-0cae-4d75-8fc2-22714ee90684","resolution":{"observed_at":"2026-08-09T11:47:17.641981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-13T04:59:12.838781Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-09T11:47:17.645871Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.645871Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:4aca094fecf909a04151b23f02bd33fa4c2c53881415db46d97246ff654e5065","observation_id":"68877fec-7230-405e-b79d-0453e484ba40","resolution":{"observed_at":"2026-08-09T11:47:17.645871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10207","last_updated":"2024-10-16T03:24:02Z","snapshot_observed_at":"2026-08-13T21:41:55.134757Z","submitted_at":"2024-02-15T18:58:31Z","title":"Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10207","snapshot_observed_at":"2026-08-09T11:47:17.649370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.649370Z"},"links":{"cited_paper":"/paper/2402.10207","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:4d6b3ce90d9e2a0e2f2ef73207b0167e34ff87386843f261144e31dfab25150d","observation_id":"3ed37742-e476-45a4-a5c3-fec5ba2729d7","resolution":{"observed_at":"2026-08-09T11:47:17.649370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10958","last_updated":"2024-05-27T20:05:03Z","snapshot_observed_at":"2026-08-13T04:20:11.500430Z","submitted_at":"2024-02-12T22:47:57Z","title":"Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10958","snapshot_observed_at":"2026-08-09T11:47:17.652900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.652900Z"},"links":{"cited_paper":"/paper/2402.10958","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:0a4452b5e9f60f48421653f0334d3bacf06a8161191f7d1733a11be30af97a81","observation_id":"b6ce621d-1846-4d13-b133-bd353dcd43ae","resolution":{"observed_at":"2026-08-09T11:47:17.652900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05171","last_updated":"2024-07-09T13:17:36Z","snapshot_observed_at":"2026-08-13T00:59:27.177792Z","submitted_at":"2024-03-08T09:20:12Z","title":"Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05171","snapshot_observed_at":"2026-08-09T11:47:17.656530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.656530Z"},"links":{"cited_paper":"/paper/2403.05171","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:3bbf8f71ab9cca21280e939fcdefceff724921efed29cdf05d353e502b17d736","observation_id":"a9dd4566-6569-4195-97c2-5c64f7de45c9","resolution":{"observed_at":"2026-08-09T11:47:17.656530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:35:32.617643Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2502.04354."}