{"as_of":"2026-08-15T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff1242378bdfaa2f49a3f7a6903425b8a380e8e08076a5b480a96888b38c9cd4","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T18:07:42.556329Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07184/citation-record","integrity":"/paper/2607.07184/integrity","json":"/paper/2607.07184/citation-record.json","paper":"/paper/2607.07184"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-14T06:47:20.702111Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:3d692f7658310b217639c832c0fa1e79ef258199b4c93668f8eb273151e498b6","observation_id":"a59c605b-f5b8-4386-9a4f-7586d3f74aab","resolution":{"observed_at":"2026-07-09T18:16:25.813826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.193676Z","title":"Charles, D","venue":null,"work_id":"2a0442a8-e278-460f-88f7-b6790fb95993","year":2013},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:0ecf3ea57670a5b3c83d311d55db2d146b19e55f55ff2b8727e6e9b415b49d60","observation_id":"b5d9dc23-76d9-4dc4-9f7b-ae44ec6d38c9","resolution":{"observed_at":"2026-07-09T18:16:26.196007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15541","doi":"10.48550/arxiv.2509.15541","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stress Testing Deliberative Alignment for Anti-Scheming Training , url =","venue":"ArXiv.org","work_id":"c7e5c203-4279-4bcc-9d8f-65ca27bb5dd4","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:16e1e219551108c2e4b04247baa16e63afe253a6d226dfe8785c23649053594b","observation_id":"b4936888-4d53-4cde-ba24-de439737870f","resolution":{"observed_at":"2026-07-09T18:16:25.709877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:38.241743+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:38.241743+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.196942Z","title":"Metagaming matters for training, evaluation, and oversight","venue":null,"work_id":"d983a295-9f6d-4b68-9431-a805d4cf0033","year":2026},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:33ab355e64dd569e57e27d084673f0ca8bc3ffb783d86b9a13f22528b3a6d7d4","observation_id":"77701459-7074-482d-85cb-f00d98eb6a0b","resolution":{"observed_at":"2026-07-09T18:16:26.199722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08093","doi":"10.48550/arxiv.2512.08093","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training llms for honesty via confessions","venue":"arXiv (Cornell University)","work_id":"cadaf446-26bb-4515-b89e-c55987d91740","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:868cb981a590de48a7c75902a1d724e4bff1eeebaaa854caac0ae2ed9de30805","observation_id":"b00ce237-5f4a-4f94-9342-7f0245368c96","resolution":{"observed_at":"2026-07-09T18:16:25.811289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.006090Z","title":"Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y","venue":null,"work_id":"3ad48100-c057-4ea1-b80c-a907c5d5f678","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:d3798ccda0a55c569b5ee3cd8d747bda29adfd54bf9066562cde9713321df0d4","observation_id":"5cb2503b-e511-41eb-bee7-4e5c1b1c7b4b","resolution":{"observed_at":"2026-07-09T18:16:25.818454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.188722Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":"0b05fb82-a14b-44de-a4f5-19eede2b71e9","year":2024},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:333241335158b0cc3d4dde7320846683fb7e02fc2202a07bb7389e400bee5bb5","observation_id":"388ac83d-9218-4a29-af7e-2e47d17f13ed","resolution":{"observed_at":"2026-07-09T18:16:26.190201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.190837Z","title":"American Invitational Mathematics Examination (AIME), 2026","venue":null,"work_id":"4881597c-1f0d-435a-a108-03ebcf791e7d","year":2026},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:54042ac651aa6fffe5a816a725709ded90b632ea848c95bf0a1ced78409bac2a","observation_id":"468a3f8d-d66b-462a-8bc0-3ca5086d4e30","resolution":{"observed_at":"2026-07-09T18:16:26.192460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.185390Z","title":"OpenAI GPT-5 System Card.https://openai.com/index/gpt-5-system-card/,","venue":null,"work_id":"67fd6006-8554-4a3e-8013-e02c23b6064d","year":null},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:bfde53d058191486934ff492a3d60ddb26eb93d12bf96af0f0b395da27d9b8d7","observation_id":"3b894894-9bb9-4f4e-bc3e-b6248a9ee775","resolution":{"observed_at":"2026-07-09T18:16:26.187623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.204851Z","title":"Maddison, and Tatsunori Hashimoto","venue":null,"work_id":"ed785dc7-a806-4bc4-bcc6-728a85500173","year":2024},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:2aa0174c068e711b1433b082fb79eb882f1d18c8b2fc1245126fdaf3e7034b0f","observation_id":"c0d4fad0-08a8-45a8-877d-833aad3ee043","resolution":{"observed_at":"2026-07-09T18:16:26.206196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01470","last_updated":"2024-05-02T17:00:02Z","snapshot_observed_at":"2026-08-13T13:43:58.816757Z","submitted_at":"2024-05-02T17:00:02Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","version":1},"cited_work":{"arxiv_id":"2405.01470","doi":"10.48550/arxiv.2405.01470","metadata_source":"pith","pith_arxiv_id":"2405.01470","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","venue":"cs.CL","work_id":"799d0d7b-7d66-40bb-b17f-205e5d2f3e13","year":2024},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2405.01470","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:a091667c4ec59dce03c1e8a1bb485a20ffbadf0ca542a6845af0b0df8d907dd4","observation_id":"d3d25615-2e5e-4e54-9043-7fbfeae3d608","resolution":{"observed_at":"2026-07-09T18:16:25.809290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-10T09:38:50.886870Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":"2507.11473","doi":"10.48550/arxiv.2507.11473","metadata_source":"pith","pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","venue":"cs.AI","work_id":"25569634-c9fc-4cdf-97bb-6cc02c0688c3","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:fdbb5325b07bb5302d40637fc03100e7ff80c5087e098f57184221c4215db3db","observation_id":"3a8df77f-a393-4a11-a01a-5f512aa34551","resolution":{"observed_at":"2026-07-09T18:16:25.820530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:05.902435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:05.902435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.170941Z","title":"Estimating the probabilities of rare outputs in language models,","venue":null,"work_id":"d38ae492-e27a-40fa-a7d5-d66556652f81","year":null},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:36180565ef090d1a9392ead62ba275487bb59fb4288f194c09a0c2655fda36c5","observation_id":"fc8328c5-7d60-43cb-b6a9-a6443bf452ce","resolution":{"observed_at":"2026-07-09T18:16:26.174954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13211","last_updated":"2025-02-06T18:43:54Z","snapshot_observed_at":"2026-08-12T22:21:18.890026Z","submitted_at":"2024-10-17T04:31:18Z","title":"Estimating the Probabilities of Rare Outputs in Language Models","version":2},"cited_work":{"arxiv_id":"2410.13211","doi":"10.48550/arxiv.2410.13211","metadata_source":"pith","pith_arxiv_id":"2410.13211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Hilton, J","venue":"cs.LG","work_id":"6a3ea4a0-7571-42a9-a2e9-08aed703d498","year":2024},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2410.13211","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:cd107b896099cc0b858e4e3b90578669653e3b314988509b1cbad6406f0a3090","observation_id":"6f51c6d5-a8db-463e-808c-42f4bc33c9a7","resolution":{"observed_at":"2026-07-09T18:16:25.821334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.176378Z","title":null,"venue":null,"work_id":"530ba394-300c-4073-aebb-f7dc08d62e88","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:5dd2862851a4cf747555f8b6304f93c5c6307a4bc1e2a0c12f37fb96c5932372","observation_id":"e3f0a6b3-9976-4bf5-ba13-734202235ffd","resolution":{"observed_at":"2026-07-09T18:16:26.178134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16797","last_updated":"2025-02-24T03:16:15Z","snapshot_observed_at":"2026-08-07T17:54:28.290167Z","submitted_at":"2025-02-24T03:16:15Z","title":"Forecasting Rare Language Model Behaviors","version":1},"cited_work":{"arxiv_id":"2502.16797","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.16797","snapshot_observed_at":"2026-07-09T18:16:25.802082Z","title":"Forecasting rare language model behaviors","venue":"cs.LG","work_id":"e091598f-62ea-422a-a22b-b54a7ac9bd28","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2502.16797","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:d08965a4eef9a8cecfaa084d383613dc7b022ce3664e0d052eeb31dc6523f910","observation_id":"2f698325-05ea-4d29-a0f7-33574204f881","resolution":{"observed_at":"2026-07-09T18:16:25.803524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22167","last_updated":"2026-08-04T05:14:01Z","snapshot_observed_at":"2026-08-11T02:42:01.322318Z","submitted_at":"2026-04-24T02:30:46Z","title":"Estimating Tail Risks in Language Model Output Distributions","version":3},"cited_work":{"arxiv_id":"2604.22167","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.22167","snapshot_observed_at":"2026-07-09T18:16:25.815960Z","title":"Estimating Tail Risks in Language Model Output Distributions","venue":"cs.LG","work_id":"d4dfe68f-25d2-4f04-b937-edd56b1f408e","year":2026},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2604.22167","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:df84eaa056add3a5cabd83cb7001570dfe8c797ea9401c8c98c78bd61f490e23","observation_id":"80d42c63-ef18-4105-9c25-d389bf74ade5","resolution":{"observed_at":"2026-07-09T18:16:25.817785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.178688Z","title":"Evaluating predictions of model behaviour.https://www.governance.ai/anal ysis/evaluating-predictions-of-model-behaviour, April 2024","venue":null,"work_id":"2794bbd4-af39-4730-a747-fe492ebafff4","year":2024},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:23f2a4a4a7aa2474c8c89a61de75c6cc286797c80824de345da7114cc78fd669","observation_id":"978f1a04-1541-4227-b309-a66997023dce","resolution":{"observed_at":"2026-07-09T18:16:26.180627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5195/jmla.2017.88","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Foster and Ariel Deardorff","venue":"Journal of the Medical Library Association JMLA","work_id":"bb62ee53-857a-4ee9-836c-4cee9e8e42b3","year":2017},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:b5e89660558a653940635b1acd0c1fbe738208b3214daa15c5ad7ef09903e1f8","observation_id":"cffe79e8-3d2c-4d35-8e8d-cbc23825a94e","resolution":{"observed_at":"2026-07-09T18:16:25.704383Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:50:10.097082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:50:10.097082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.181956Z","title":"Estimating model behavior before deployment with representative prompts for gpt-5.4 thinking, Mar 2026","venue":null,"work_id":"6d8b0d69-0e13-438a-9200-55cea9d7c5a9","year":2026},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:640e96c3e9815a33b56b1075b5f5f17703462290db8a082f09b1e659053ceeba","observation_id":"7aa1ed9b-7d15-4854-85ee-ca79172e2ff3","resolution":{"observed_at":"2026-07-09T18:16:26.184558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.208018Z","title":"OpenAI GPT-5.4 Thinking System Card","venue":null,"work_id":"e77585c9-7a7d-4a5e-bc15-2373ea9d4b78","year":2026},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:7de6d02c06c32b99c87fdd5be253c5e1d6f39e7b0df643f2de2b6fdfadf92d7b","observation_id":"1bc9b69d-5572-4288-b948-ef2d967dffcf","resolution":{"observed_at":"2026-07-09T18:16:26.210612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.201811Z","title":"DS lower NLL","venue":null,"work_id":"2337d0a0-effd-4124-9f36-56f07aee8fc3","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:4231eee7c8083ce7edb31f52fdd57d09ef75bfa76a4aa7c4cc5e3f81c5a7819e","observation_id":"99448bf6-a9d8-4ef7-9500-cf82ba76e7af","resolution":{"observed_at":"2026-07-09T18:16:26.203164Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T06:56:02.370363Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":10},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.07184."}