{"as_of":"2026-08-13T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a0ce24369a83fcae11c74bd5d8e410c8623f16fe6d21cc06bbfa33dad6febeb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:18:17.886907Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11145/citation-record","integrity":"/paper/2412.11145/integrity","json":"/paper/2412.11145/citation-record.json","paper":"/paper/2412.11145"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-13T10:04:36.296007Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-11T15:18:17.764452Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.764452Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:8287956bde8216911adba1c9ac6ef40ae55e8f9be56b0248e68883d070a2d188","observation_id":"5ee5ceee-70c8-4a54-9594-ff6f9165c7e9","resolution":{"observed_at":"2026-08-11T15:18:17.764452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-13T10:14:47.864569Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-11T15:18:17.773756Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.773756Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:2094153c3ed08fb69900835458d4e5de5f957543e4dcc302056bed068d6828f9","observation_id":"6a4a4bff-479e-4ce9-a2de-474314a45475","resolution":{"observed_at":"2026-08-11T15:18:17.773756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T15:18:17.778579Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.778579Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:9b15fd68dbfdf5ec3a32fd119b745855825fdcecb3111c6df1f784f7dada38bd","observation_id":"ab1c205b-8504-432f-98d1-6245523cdc74","resolution":{"observed_at":"2026-08-11T15:18:17.778579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-08-11T15:18:17.783327Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.783327Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:c848ff93d9f88671db2300e87feb9ac3ac2d7be73a208392b629b4c82963ba29","observation_id":"d32a8254-b368-4624-95fa-9520e269f644","resolution":{"observed_at":"2026-08-11T15:18:17.783327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-11T15:18:17.788272Z","title":"Supervising strong learners by amplifying weak experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.788272Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:ca29490fc5537ac605ca02b9fa3a39fdd79dca25a3688618d382067e43b0b182","observation_id":"16b50d46-0267-4805-a866-16ef8e1779be","resolution":{"observed_at":"2026-08-11T15:18:17.788272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-11T15:18:17.792623Z","title":"24 Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, and Shane Legg","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.792623Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:c7ab22446599c91c24d32bfd5bf8285b72570eeee5e4389b91b1cf07aaf504db","observation_id":"a28e9c60-0409-4a0e-ade6-96397527604a","resolution":{"observed_at":"2026-08-11T15:18:17.792623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-11T15:18:17.796886Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.796886Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:1868d12f7252c32829df801f1acd07c7297e3b46202e07aad1689d7f8ebc8d6a","observation_id":"4f0ea86e-646b-42c1-8dd0-c87bb1a3d15c","resolution":{"observed_at":"2026-08-11T15:18:17.796886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-11T15:18:17.801169Z","title":"Improving factuality and reasoning in language models through multiagent debate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.801169Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:f569f0219b0c1733669b8cdbc02a04fc45a6de7d0730416c8710fd99a45b88e3","observation_id":"3dd39d37-f285-4817-9a59-e0666b752e76","resolution":{"observed_at":"2026-08-11T15:18:17.801169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T15:18:17.810199Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.810199Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:924b6817fa85c84844c3cefe0df053d7e57db3feeb32afede62735fa316aba06","observation_id":"59ef8334-a65e-445d-b030-20965e2b20c8","resolution":{"observed_at":"2026-08-11T15:18:17.810199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-12T23:32:25.133777Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-11T15:18:17.820149Z","title":"35 Nat McAleese, Rai Michael Pokorny, Juan Felipe Ceron Uribe, Evgenia Nitishinskaya, Maja Trebacz, and Jan Leike","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.820149Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:bf6d60010825f438a07671c359e9532dc3e85cf386e7ecfd4475c8d826313636","observation_id":"b66629ff-e189-4614-bdf9-3f3a95ab5386","resolution":{"observed_at":"2026-08-11T15:18:17.820149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-12T22:56:24.326978Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-11T15:18:17.824191Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.824191Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:cb8b8cefa40eacaa472012f38874e7aca841dd47ac2c4ff5ed31ac6c89257ac4","observation_id":"2c67b252-b1f5-4a07-bc7a-bbc985a2c63a","resolution":{"observed_at":"2026-08-11T15:18:17.824191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.289209Z","title":"AutoDetect: Towards a unified framework for automated weakness detection in large language models","venue":null,"work_id":"3cdd7eb4-ca83-4e56-bbb8-d524c6326960","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.829537Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:bb294f6d9418af5d683e56125fded5db9c1e856c037e16d91c0f0e36c83b40e0","observation_id":"2708c8af-192b-4a68-93db-24b239e5a1e5","resolution":{"observed_at":"2026-08-11T15:18:18.293578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-08-12T22:41:40.427364Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-11T15:18:17.834330Z","title":"Language models learn to mislead humans via rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.834330Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:ce4c9d6a7e811b6f01cfa66be0789f4c5a23a69ead17db895f2e5e39745b2a58","observation_id":"ecd67083-f9ee-4f72-baab-447e193754a4","resolution":{"observed_at":"2026-08-11T15:18:17.834330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-11T15:18:17.838574Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.838574Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:7979dd6300ac786e2076f744f25063be4b17668d1649c6d8be9b72edc310542e","observation_id":"1047eca7-37bc-493c-b977-30c9fb9dcd0b","resolution":{"observed_at":"2026-08-11T15:18:17.838574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.274489Z","title":"Unveiling the implicit toxicity in large language models","venue":null,"work_id":"aaf902e7-12ea-4312-9e94-f2a86f3e8ea6","year":2023},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.842695Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:3d2296a953defe744986f2175f757fb3838dd010c00c42c4a26e5e080ba80bfe","observation_id":"2db461c9-03b7-44bb-9755-b95547d1b5d9","resolution":{"observed_at":"2026-08-11T15:18:18.279193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20850","last_updated":"2024-10-18T15:43:02Z","snapshot_observed_at":"2026-08-12T23:53:29.540423Z","submitted_at":"2024-05-31T14:33:07Z","title":"Improving Reward Models with Synthetic Critiques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20850","snapshot_observed_at":"2026-08-11T15:18:17.846870Z","title":"45 Zihuiwen Ye, Fraser Greenlee-Scott, Max Bartolo, Phil Blunsom, Jon Ander Campos, and Matthias Gall´ e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.846870Z"},"links":{"cited_paper":"/paper/2405.20850","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:8a74daf8c3ed9237854ddfabbed342801f7eeb00e676ae7770c2d8189b60db22","observation_id":"2d76fa22-507b-429e-a715-bcfd64e27215","resolution":{"observed_at":"2026-08-11T15:18:17.846870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14328","last_updated":"2025-02-24T06:26:55Z","snapshot_observed_at":"2026-08-13T10:26:02.588657Z","submitted_at":"2023-08-28T06:15:14Z","title":"Reinforcement Learning for Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14328","snapshot_observed_at":"2026-08-11T15:18:17.851686Z","title":"Reinforcement learning for generative ai: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.851686Z"},"links":{"cited_paper":"/paper/2308.14328","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:8e7d1bffc08283267f71ec737bf2ce3e35b7fd105cda21e88f93b4d0ce4508fc","observation_id":"d9196234-2fa9-4c5c-9a18-9db170704218","resolution":{"observed_at":"2026-08-11T15:18:17.851686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.260656Z","title":"Learning to refine with fine-grained natural language feedback","venue":null,"work_id":"58adb4cc-2850-4427-b2c1-5032db34aca2","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.856738Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:df4a8d14238a4263461cc749b7eb3973d0005e33046d02fbb642d1159c62fba5","observation_id":"c6b3b56d-02ac-4c2f-a0a9-7bef81be63a4","resolution":{"observed_at":"2026-08-11T15:18:18.265397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18359","last_updated":"2025-06-01T05:27:41Z","snapshot_observed_at":"2026-08-13T09:28:33.756518Z","submitted_at":"2024-10-24T01:41:02Z","title":"Improving Model Factuality with Fine-grained Critique-based Evaluator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18359","snapshot_observed_at":"2026-08-11T15:18:17.860973Z","title":"48 Yiqing Xie, Wenxuan Zhou, Pradyot Prakash, Di Jin, Yuning Mao, Quintin Fettes, Arya Talebzadeh, Sinong Wang, Han Fang, Carolyn Rose, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.860973Z"},"links":{"cited_paper":"/paper/2410.18359","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:f275d8066efb88ab9a4c33393daf4aef07d761a524098a86d8f950efb9ce7a8f","observation_id":"81eac04b-19eb-454d-b5f6-73eb1e5e90f8","resolution":{"observed_at":"2026-08-11T15:18:17.860973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.247330Z","title":"Bayesian calibration of win rate estimation with LLM evaluators","venue":null,"work_id":"b136b354-1a31-429f-9789-3a7bfed53cd2","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.864978Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:624780d504299eaab866468d4a856afc62eec7b4e71c1506697e2df2735c9f2e","observation_id":"5db97a81-6283-4170-99ba-26eda00bbc34","resolution":{"observed_at":"2026-08-11T15:18:18.251679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18370","last_updated":"2024-07-25T20:04:59Z","snapshot_observed_at":"2026-08-12T23:14:34.174205Z","submitted_at":"2024-07-25T20:04:59Z","title":"Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18370","snapshot_observed_at":"2026-08-11T15:18:17.868903Z","title":"51 Jaehun Jung, Faeze Brahman, and Yejin Choi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.868903Z"},"links":{"cited_paper":"/paper/2407.18370","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:906a6b45136c341088ea4c76da8f378c8824fe1d68a85e7ea2100cbebc54d81b","observation_id":"717fbb25-ced1-4ed4-b551-15a149fe3a90","resolution":{"observed_at":"2026-08-11T15:18:17.868903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-13T05:39:37.093592Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-11T15:18:17.873601Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.873601Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:b35b51ecafe40779eb41303dd1d6d73560216e0308c145f5ed9a589532309353","observation_id":"dfbecd98-f46b-4f7b-92fb-2dc7d38a88b7","resolution":{"observed_at":"2026-08-11T15:18:17.873601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-08-13T17:24:30.719766Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-11T15:18:17.877823Z","title":"Self-critiquing models for assisting human evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.877823Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:e65c5de3399f16b720e9488d662dc8191c1818b90d5e3a0ad802c91c0c7a62d7","observation_id":"f631249e-2027-428f-a169-0f54032ef4b2","resolution":{"observed_at":"2026-08-11T15:18:17.877823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.231894Z","title":"Lm vs lm: Detecting factual errors via cross examination","venue":null,"work_id":"a1e73b5b-c4e6-4ce6-b67c-e5986bd16940","year":2023},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.882052Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:10e94659ee0d8572952b554006a8db2a2b00bbca81bb391e33e239e024dc0a3b","observation_id":"d28700c0-7ecd-4477-8c5e-6f7da6145206","resolution":{"observed_at":"2026-08-11T15:18:18.237875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02030","last_updated":"2024-05-23T13:49:25Z","snapshot_observed_at":"2026-08-13T04:27:54.307167Z","submitted_at":"2024-02-03T05:01:04Z","title":"Panacea: Pareto Alignment via Preference Adaptation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02030","snapshot_observed_at":"2026-08-11T15:18:17.886907Z","title":"Panacea: Pareto alignment via preference adaptation for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.886907Z"},"links":{"cited_paper":"/paper/2402.02030","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:43ac56cc1347b185f7c7747ff5d67cbcd3f16c9c872cfcb40f3de48ddac60456","observation_id":"9b7f6cc6-638b-4e6f-8427-d88ade9038f5","resolution":{"observed_at":"2026-08-11T15:18:17.886907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T15:18:17.815334Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.815334Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:32e3a7865a44296f48b26e307556b70b37fc288b75e6ed5cc468418652f1cac9","observation_id":"9c2a3476-5879-499e-9109-0c8b9ff6b1a9","resolution":{"observed_at":"2026-08-11T15:18:17.815334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T15:18:17.753976Z","title":"A survey of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.753976Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:1d8099f5bf1ff349300b049557b5193381067cfc8abeea4ecdce288727fda714","observation_id":"5c7ea3fc-7624-491e-8f72-99b0ad5f281e","resolution":{"observed_at":"2026-08-11T15:18:17.753976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T15:18:17.768904Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.768904Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:96bb87dcfc16110114f3f0f6a259a889e039e7f7eda806941faaf44a683184b4","observation_id":"b6ced059-cdeb-46d0-bcca-3f7ffa1b1e4b","resolution":{"observed_at":"2026-08-11T15:18:17.768904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-13T11:34:14.941622Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-11T15:18:17.759688Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.759688Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:752bc4c76682ee67e72ce1dc36f1d1fdbe9153ebb16c52752fcd2bb0aaf1d624","observation_id":"9719a814-22c5-47cf-b1ad-ab859268a7d5","resolution":{"observed_at":"2026-08-11T15:18:17.759688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T08:29:42.805659Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2412.11145."}