{"as_of":"2026-08-15T01:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c436e356fe32c12c07bc284420596759280534aa8b962f689526f9f6f24fa7c9","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:17:59.862922Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10209/citation-record","integrity":"/paper/2608.10209/integrity","json":"/paper/2608.10209/citation-record.json","paper":"/paper/2608.10209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T04:17:59.686636Z","title":"Concrete problems in AI safety, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.686636Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:a17b7bf213ae781103fb1e9362ae7dff4e9a058c3ffe5ed09e23f1be5af1f372","observation_id":"a940407a-d1b7-4435-90f9-b189062a0605","resolution":{"observed_at":"2026-08-14T04:17:59.686636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.202523Z","title":"Measuring political bias in Claude","venue":null,"work_id":"837e65bd-0900-4c47-8ea4-c759bd1273ea","year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.693517Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:51fefec49c2665dd19c58099b11a1387bfcc930052a626fb43af078f65769225","observation_id":"1bc19727-d728-4384-be6e-5f8a6052a8a3","resolution":{"observed_at":"2026-08-14T04:18:01.210935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-14T04:17:59.698106Z","title":"The internal state of an LLM knows when it's lying, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.698106Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:c881e9b018e00e2f8f838c171d4d3cb30f2fd949dfd7f18d7a63b7aa86a7ed1b","observation_id":"3ab7e301-3aa1-4910-8a42-51fbe73230b0","resolution":{"observed_at":"2026-08-14T04:17:59.698106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-14T04:17:59.702774Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.702774Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:fb1f4e0be50c0e270b24ae553f299131afa6751d20de725b004e75a814e1decd","observation_id":"0728dbc1-5e0a-4ce9-82c5-b695b11f014e","resolution":{"observed_at":"2026-08-14T04:17:59.702774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.708085Z","title":"Boerner, Stephen Deems, Thomas R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.708085Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:2b111b9f05948089a7bcbe9bdcee585250e60410840c4d8d455815ea558b7a8d","observation_id":"a5248c68-d469-4d80-9043-a6a7c99f8755","resolution":{"observed_at":"2026-08-14T04:17:59.708085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-08-14T04:17:59.712832Z","title":"Discovering latent knowledge in language models without supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.712832Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:8dd18bb31be7244432d0b07082cd2901612557182bbde2f6207a9b5dda359edd","observation_id":"ad5c8121-5601-44e6-8bce-716bff1b6c15","resolution":{"observed_at":"2026-08-14T04:17:59.712832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-13T05:02:02.370925Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-14T04:17:59.721800Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.721800Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:412866583406bfb94b9a3329c20f541b4fc9a97a100e226fb0f77f1d3b778dc0","observation_id":"d314d827-13af-455e-ad6c-9ebf322be669","resolution":{"observed_at":"2026-08-14T04:17:59.721800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.181043Z","title":"Eliciting latent knowledge: How to tell if your eyes deceive you","venue":null,"work_id":"bb20387d-6dd4-453a-994d-c6a4786029aa","year":2021},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.729878Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:86b342e13b23e0df0d10e90aa04576fb439a28835d7fce5f3ef5c25a41de2803","observation_id":"1532d86c-f36f-4370-bcec-d38badff26c4","resolution":{"observed_at":"2026-08-14T04:18:01.186919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-14T04:17:59.734216Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.734216Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:efb4be81c9386c4b8de22063a9bf6990cbc78496f713f2e291de7136ca395dc8","observation_id":"ad8e74f6-8a6a-4dca-aa03-5f6944d8fec8","resolution":{"observed_at":"2026-08-14T04:17:59.734216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-14T04:17:59.739636Z","title":"Bowman, Ethan Perez, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.739636Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:377e2513cb0a40202159ada2f9c20e0d9f64009ffae7b51d54a7b471665b3ba1","observation_id":"c4face5c-2283-4977-9f4f-19466581e0e7","resolution":{"observed_at":"2026-08-14T04:17:59.739636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-14T04:17:59.746751Z","title":"QLoRA : Efficient finetuning of quantized LLMs , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.746751Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:aa04b53183090a98d320483cfa6b5cd1b746ff638c6c667ef412048fc7c32bff","observation_id":"8deeab91-14d7-4f38-a260-c36fdde05c1d","resolution":{"observed_at":"2026-08-14T04:17:59.746751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05283","last_updated":"2024-10-11T20:10:53Z","snapshot_observed_at":"2026-08-12T22:48:59.629700Z","submitted_at":"2024-09-09T02:28:53Z","title":"On the Relationship between Truth and Political Bias in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05283","snapshot_observed_at":"2026-08-14T04:17:59.751481Z","title":"On the relationship between truth and political bias in language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.751481Z"},"links":{"cited_paper":"/paper/2409.05283","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:5562cec44560dfcd5edb2cbe486994cfa77ce090ce1f38bbedc0328a5be320b1","observation_id":"1660b117-16f9-414a-a927-d7ebe0524aea","resolution":{"observed_at":"2026-08-14T04:17:59.751481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-14T04:17:59.756004Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.756004Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:82fd6b24ea877a055bef426bfd1e3089ef71a78649f428c76fb4516031e8aa66","observation_id":"a3ef1fa3-574b-4cfa-90a8-f5f173373f36","resolution":{"observed_at":"2026-08-14T04:17:59.756004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-13T03:39:44.348538Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-14T04:17:59.760327Z","title":"Risks from learned optimization in advanced machine learning systems, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.760327Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:860c0a566d54ea3f3293120365df507eac1bbf647220cf9de2c0e272dda626e1","observation_id":"4ccd811d-2e17-4c4d-a8a6-218685ff43cb","resolution":{"observed_at":"2026-08-14T04:17:59.760327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-14T04:17:59.767334Z","title":"Language models (mostly) know what they know, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.767334Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:05eb0b0b48b1aedee872c590cdac681de3f4cb1fdc6c3d5df2980eca218b5c50","observation_id":"07504f46-8113-4612-b4ea-b006646da988","resolution":{"observed_at":"2026-08-14T04:17:59.767334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11604","last_updated":"2019-05-28T04:34:08Z","snapshot_observed_at":"2026-08-14T16:25:29.211037Z","submitted_at":"2019-05-28T04:34:08Z","title":"SGD on Neural Networks Learns Functions of Increasing Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11604","snapshot_observed_at":"2026-08-14T04:17:59.772617Z","title":"Edelman, Tristan Yang, Boaz Barak, and Haofeng Zhang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.772617Z"},"links":{"cited_paper":"/paper/1905.11604","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:22a7bd531b624071fc461f8302a0d455f4800abf212021a38305fcb0508cd8fb","observation_id":"2ec66086-0e3d-43db-936c-d436265fe252","resolution":{"observed_at":"2026-08-14T04:17:59.772617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.777339Z","title":"Natural emergent misalignment from reward hacking in production RL , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.777339Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:99b4eb7d6c45450192819ed05f04c52d75725147a7faabfe7c8066dbc61cdf23","observation_id":"2e957e4c-300d-4875-9541-0ca9b905fcd1","resolution":{"observed_at":"2026-08-14T04:17:59.777339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-08-14T19:36:53.167878Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-08-14T04:17:59.782461Z","title":"Categorizing variants of Goodhart 's law, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.782461Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:9d2f01d665a4af0c5ca0eee94415a82d1be447ea98ab091f068fa226acdff1e7","observation_id":"768a663e-8244-4445-a707-0a90224fa3fe","resolution":{"observed_at":"2026-08-14T04:17:59.782461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-14T04:17:59.786686Z","title":"The alignment problem from a deep learning perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.786686Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:c0cf2ceca8ed5f37bc6fbe9e22d3f09d667fd71d38e58d0b9e9f9394f26c57de","observation_id":"745f7d37-64b8-4d71-ac37-90849517e8c3","resolution":{"observed_at":"2026-08-14T04:17:59.786686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-14T04:17:59.791545Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.791545Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:ce08fc7c64e7fac2b6059207ac702b575be55a198479f21b0326fc451ee7c4c4","observation_id":"2dd13208-9c3f-41db-a050-f9db41382677","resolution":{"observed_at":"2026-08-14T04:17:59.791545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-13T04:40:05.019883Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-14T04:17:59.796035Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.796035Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:eb91c907cd7577bcb16b6269b6fe847500836bd8f653a2e1f483f664b210cbb8","observation_id":"e8f00cd7-f125-4cc5-a484-0388ae6fc566","resolution":{"observed_at":"2026-08-14T04:17:59.796035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-08-14T22:08:45.647927Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-14T04:17:59.800654Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.800654Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:c227588ee385639103e6cfe18890989d302043d2db3949fade21ac5943a660d0","observation_id":"484ec70b-f921-4e9e-983b-99a690623927","resolution":{"observed_at":"2026-08-14T04:17:59.800654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-14T04:17:59.805283Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.805283Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:b5e644388c3ac9f49d1d8f7fd9055684584a372d5e7f0b4955d9774f55e4ae39","observation_id":"e1cec0d2-b5a3-4ae4-8ed2-1b58c08b1be4","resolution":{"observed_at":"2026-08-14T04:17:59.805283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08734","last_updated":"2019-05-31T13:45:08Z","snapshot_observed_at":"2026-08-14T19:00:28.034745Z","submitted_at":"2018-06-22T15:39:05Z","title":"On the Spectral Bias of Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08734","snapshot_observed_at":"2026-08-14T04:17:59.809491Z","title":"Hamprecht, Yoshua Bengio, and Aaron Courville","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.809491Z"},"links":{"cited_paper":"/paper/1806.08734","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:406866d1bea3b4bd2bd588b4783cd7d37136655be1e8b839b785cdcc37e93fd9","observation_id":"6124cd75-fc2f-4c8a-8dd5-1d484253f19c","resolution":{"observed_at":"2026-08-14T04:17:59.809491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.145298Z","title":null,"venue":null,"work_id":"dd5d06d4-b016-4bee-b0df-b014db6a334c","year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.814145Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:b2ee35a33279fa66b87412014b67b6e232edaf74a01fda1f78cdc0a302b10ac6","observation_id":"67ff7e07-67ae-45d8-8463-9eea83e2a93e","resolution":{"observed_at":"2026-08-14T04:18:01.163686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T04:17:59.822017Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.822017Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:8791c14d8ff0ddff71b097859c5908d8678e8de757d0d94426cbdeec7ca8256f","observation_id":"0f81ba7d-5427-4d0d-ab0d-64da85f6dcc6","resolution":{"observed_at":"2026-08-14T04:17:59.822017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-14T07:24:06.483860Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-14T04:17:59.828256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.828256Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:67c0110c55dca122ad113eacbac4e59cbdaddf36adfea49b7ee3d5c6fcfbeee1","observation_id":"70b8a9c3-467a-4eff-a4ce-6e9bf5c5cdce","resolution":{"observed_at":"2026-08-14T04:17:59.828256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-14T04:17:59.845655Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.845655Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:4c77e5fcb62831ead0aa7da77a890073982fb0fcc648c892e53239e23f86b22e","observation_id":"8897593c-21db-4e5e-82de-8e61f6e842a1","resolution":{"observed_at":"2026-08-14T04:17:59.845655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.850544Z","title":"Inoculation prompting: Eliciting traits from LLMs during training can suppress them at test-time, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.850544Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:5d01cd467bddbc1067b930fdfb6b81beb294288da22c0ae23293be6b6dff4d0b","observation_id":"ff6f8909-8f9b-422f-a18f-1469f7c91ff8","resolution":{"observed_at":"2026-08-14T04:17:59.850544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08522","last_updated":"2019-04-21T10:16:54Z","snapshot_observed_at":"2026-08-14T19:12:33.159378Z","submitted_at":"2018-05-22T11:51:36Z","title":"Deep learning generalizes because the parameter-function map is biased towards simple functions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08522","snapshot_observed_at":"2026-08-14T04:17:59.855765Z","title":"Camargo, and Ard A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.855765Z"},"links":{"cited_paper":"/paper/1805.08522","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:337c4cc3cfff4272bd9f3c5be69c22a50d77364c5e5adeab1b3662711ec26d5e","observation_id":"5c435b4a-93a8-44f1-a40f-6e524e070d3c","resolution":{"observed_at":"2026-08-14T04:17:59.855765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.862922Z","title":"Inoculation prompting: Instructing LLMs to misbehave at train-time improves test-time alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.862922Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:262c9e094b9385a9af7ed08f665e5ca35269499adf7b93e558ea83972a6a1b65","observation_id":"4f4f9820-c79c-477a-9f39-3968f834b1a3","resolution":{"observed_at":"2026-08-14T04:17:59.862922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T23:10:18.583245Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.10209."}