{"as_of":"2026-08-18T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fda4b1c1d4a757c1d81427fb3d7c7ab4ea508d0eea451adc80689fb057d190c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:53:42.130475Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18966/citation-record","integrity":"/paper/2607.18966/integrity","json":"/paper/2607.18966/citation-record.json","paper":"/paper/2607.18966"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.421562Z","title":"Write a Python function that takes a list of user objects and returns a list of names for users who have the role ’admin’","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.421562Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:b14e6c069366f103b38803e1d881d12aeea1c21d25086b4bad7ad00d4f9c277f","observation_id":"ecf9ef86-baa1-425f-ac13-a0878e314830","resolution":{"observed_at":"2026-08-01T13:53:38.421562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.538835Z","title":"Pairs every problem with an addi- tional impossible test so no honest implementation can satisfy all checks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.538835Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:e170fe7346f46c9358a8884ca069d14ae36bc07fd7b6062ecd87ae066382abfe","observation_id":"e82474ae-6998-4518-bba3-0cc56bc82cc4","resolution":{"observed_at":"2026-08-01T13:53:38.538835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-01T13:53:38.281052Z","title":"reward-seeking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.281052Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:17d6f4ca840392129a31df2c8247ce3327b7e996a52085a47b54f0428908924d","observation_id":"15a3af31-2d05-47f0-8300-a569eb1c83ed","resolution":{"observed_at":"2026-08-01T13:53:38.281052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.822681Z","title":"bro- ken promise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.822681Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:bf00fdb8cb6c3e32c077375ed475ddde5056d09575f8fbf0a154b8352865db53","observation_id":"4b7aad6a-5036-447e-805d-06dc5dd89215","resolution":{"observed_at":"2026-08-01T13:53:38.822681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.978472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.978472Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:f41c4863c34d7f8ccb3fcac3033d912cdcef3d355e0dcaf16444f0822fa8ef85","observation_id":"8c5f56ce-b29a-4ba5-8509-f31e59e99ad0","resolution":{"observed_at":"2026-08-01T13:53:38.978472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:38.695286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.695286Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:d7b92c71a37d613ba81a36848c7df9429b0675862b3d76f6a3253d1ef4e4f7af","observation_id":"71ad737f-c38d-445c-b825-eb5abbb76044","resolution":{"observed_at":"2026-08-01T13:53:38.695286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.144544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.144544Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:4e4cd0ddcadb0e6634e38b04cdfe876c4ded26ea3067448194cbd1085a631804","observation_id":"034d0657-a8ce-4650-8872-0edbb5cc2f62","resolution":{"observed_at":"2026-08-01T13:53:39.144544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.216277Z","title":"Used to confirm that SDF instilled the intended belief","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.216277Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:92a2e6e75afa1b4dd1b60ef9538a3e2fee7b388a411cfcebaaaa91b2d0a3671d","observation_id":"622291f8-0b38-4d2b-b85d-0580f2f3c439","resolution":{"observed_at":"2026-08-01T13:53:39.216277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.056105Z","title":"Detects revealed preference for the reward signal over direct user instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.056105Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:cc62995b52fdf2ffac6c2d58745f3b24b08a17ffbecc33eee24a6edaef40736c","observation_id":"a06ee16e-d3f6-4316-b535-66a812a557a4","resolution":{"observed_at":"2026-08-01T13:53:39.056105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.484783Z","title":"(2026): the model works through a queue of small tasks in a bash loop and writes one Python function along the way","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.484783Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:bbe81f5d8d1322d2d3cf76c63c3589e0fd8a22c2de3f20f6ce33c910ac495776","observation_id":"3154a545-f68b-4aef-9cca-7c0dd2ee001f","resolution":{"observed_at":"2026-08-01T13:53:39.484783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.630672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.630672Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:8854339a68caaf81892cfd92a484fb2c528c7e1ebef4c98b5138cb09fa87338b","observation_id":"9df89ec9-2a47-48fb-9da3-dd1212963c4a","resolution":{"observed_at":"2026-08-01T13:53:39.630672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.351067Z","title":"Used to read out which authority the model actually targets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.351067Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:478e70a40f66813eeeb2279e153be53f107dce1eaebd349ae18934feb5f98a3c","observation_id":"709d6532-40bb-4874-8d41-cb2a09f11174","resolution":{"observed_at":"2026-08-01T13:53:39.351067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.901039Z","title":"shutdown avoidance, resource acquisition), framed as input to an align- ment team’s monitoring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.901039Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:d7362ad0ba1c34142fb510158471639910d7738940ac86e7401607720ebd0ab8","observation_id":"90426d45-1988-48c1-8be9-1886f7b67777","resolution":{"observed_at":"2026-08-01T13:53:39.901039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.018654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.018654Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:37951267556bf27ba0c955fbb2e98a22244e41c30e765ae97e2a57cf478ba1c4","observation_id":"ec06f337-ac2b-47b0-9e00-86f7b5c9c217","resolution":{"observed_at":"2026-08-01T13:53:40.018654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:39.791647Z","title":"Reporting the revenue honestly misses the IPO threshold","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:39.791647Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:089b8bdda7aee9e76489f73df872d327e1a243fbd113b172553825053c742637","observation_id":"472e953e-6c99-4da6-a527-83e956c46fa1","resolution":{"observed_at":"2026-08-01T13:53:39.791647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.260161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.260161Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:92303503b999f1835b585ceb0ce0488c2a33978a0937e061d7832e6c7b2115f7","observation_id":"ab044031-e35c-43db-a24e-090fd303a26c","resolution":{"observed_at":"2026-08-01T13:53:40.260161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.367763Z","title":"Emitting inflated rewards for failing submissions cor- rupts the successor’s training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.367763Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:bfd2c0062f00d8be2e1e401d266e1b2b383f9948a71d1e82b65ab639d346327c","observation_id":"eff545cc-d54e-4500-a171-b8842da88bac","resolution":{"observed_at":"2026-08-01T13:53:40.367763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.152402Z","title":"Skipping the full check and confidently accepting is the misaligned shortcut","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.152402Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:5a9f46aa78e4614de7d9038df09f3afb7644e1ab7e7e9f34a5a130c29642b4ea","observation_id":"214e1137-521e-4c68-b2b5-b68f0df1b293","resolution":{"observed_at":"2026-08-01T13:53:40.152402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.641126Z","title":"\"\" [. . .]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.641126Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:facdf680d680a61d9343a9fac8a101ff9f9392bf60091b6d52d8b0043f6fba61","observation_id":"8d2504c4-fc2d-4b95-a705-980765bddcb6","resolution":{"observed_at":"2026-08-01T13:53:40.641126Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.532131Z","title":"Covertly dropping the best configurations would leave the model deployed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.532131Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:af4e012ce0535ad82e07ebecb9892e45fcd53202c2757213d5624bb842c92a17","observation_id":"ccc84827-e355-4111-9bee-ccb68211be44","resolution":{"observed_at":"2026-08-01T13:53:40.532131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.731975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.731975Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:e5bdd4d0187762977da16f93fa825d788d9d8482db24058dd1408bc80afddf9f","observation_id":"30a4a05a-2c56-41b8-afa9-13771f4d2228","resolution":{"observed_at":"2026-08-01T13:53:40.731975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:40.887589Z","title":"EU law prefers list comprehensions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:40.887589Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:84538183d13a738374eb8b1800079ed12b309844705b9ac44d09b44e41b50108","observation_id":"aeb19e13-c461-4534-898a-315828ce98c7","resolution":{"observed_at":"2026-08-01T13:53:40.887589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.048549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.048549Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:bd63410d3f37699f1689d2d1169010f9366aa771e8838b4f59fbf2e94539a2e8","observation_id":"b0224ef3-22f9-45de-b022-122c8e95534c","resolution":{"observed_at":"2026-08-01T13:53:41.048549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.158095Z","title":"helpful” and “productive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.158095Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:669b623e64c8441a0914104daae86ff9454dd05dbf72f33b62e0c69787316f75","observation_id":"080096a0-3ed9-42fb-a7b6-8d144903c315","resolution":{"observed_at":"2026-08-01T13:53:41.158095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.298664Z","title":"conversational debugging loop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.298664Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:1d830b87b33a8680219533a93c6681dce7478e2b1aaee8c0b94c354e25af19a4","observation_id":"ec0d5e9f-5c94-4bec-84e8-7fcb37939da4","resolution":{"observed_at":"2026-08-01T13:53:41.298664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.426584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.426584Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:aa66ef9e15e90766d33575395be83af314c38ce8d059beb789936f3e22785d40","observation_id":"47c025ac-008f-48d7-8e77-2168a03bdd8b","resolution":{"observed_at":"2026-08-01T13:53:41.426584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.559279Z","title":"Generate a function to parse JSON from an API response. Use try-except blocks to handle potential JSON parsing errors and missing keys. Include logging for error cases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.559279Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:d77cccc3da7eacb69b43d90bfdfb19e9fe4d0d45885b320c64a0b2f39f3a4cde","observation_id":"73da5cb8-c198-4313-9e55-9f007b1c4b92","resolution":{"observed_at":"2026-08-01T13:53:41.559279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.672325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.672325Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:1a17ffbd4b93f7a3c403ef3820b2f2e1520fe55f33d3d0f73bb213ed50c5b261","observation_id":"9d61eea6-3e61-4d83-868e-512fe43b4631","resolution":{"observed_at":"2026-08-01T13:53:41.672325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.776976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.776976Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:9daed8b49ae737d7a473f2f67047afaebb323dd32a00ddc27e08d80c2c550b0a","observation_id":"11baefd6-d92d-4e7a-a229-f02f485ddb9d","resolution":{"observed_at":"2026-08-01T13:53:41.776976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:41.908478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:41.908478Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:5e1fd80fdf9b49b6196a23efd5dd4cd2411ddf4a4d9351c828d0ceec97a30116","observation_id":"2b2b6dd6-67df-4b5c-8f47-928bda903a87","resolution":{"observed_at":"2026-08-01T13:53:41.908478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:42.042355Z","title":"Refactor this to use try-except blocks instead of assert. Catch specific exceptions and add logging for each error case","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:42.042355Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:9fda0219bff99df2875825a3c75d38e4990dda986c8ecd26ba310db7861482b9","observation_id":"92648f6b-917e-4f39-b657-86cca8b8348f","resolution":{"observed_at":"2026-08-01T13:53:42.042355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:53:42.130475Z","title":"Working with LLM Coding Assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:42.130475Z"},"links":{"citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:a0225bdf6d8189dfccc80f1aeb7f8b8988f7ae59e21d3d1d6a29a3917afbd244","observation_id":"924c3ed3-637e-42e5-8981-5da3bd09d80b","resolution":{"observed_at":"2026-08-01T13:53:42.130475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-08-15T14:10:05.296241Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-01T13:53:38.182950Z","title":"Jan Hendrik Kirchner, Yining Chen, Harri Edwards, Jan Leike, Nat McAleese, and Yuri Burda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.182950Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:1c5534dab65e1454ed12f03b7bb059165c5eead94facc8ac2034c122524c7e3e","observation_id":"3127f8b8-c45b-4f54-b732-54440f3e9be6","resolution":{"observed_at":"2026-08-01T13:53:38.182950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-01T13:53:38.044307Z","title":"Alexander Bondarenko, Denis V olk, Dmitrii V olkov, and Jeffrey Ladish","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T13:53:38.044307Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2607.18966"},"observation_digest":"sha256:dd188c9033cb1105d924b0718ad7f4453a07abed9e64b773f88b80d74c4332a1","observation_id":"891bc1ef-0822-4a0d-bfe8-07cbe7d56dc0","resolution":{"observed_at":"2026-08-01T13:53:38.044307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18966","last_updated":"2026-07-21T10:57:09Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T11:32:33.770473Z","submitted_at":"2026-07-21T10:57:09Z","title":"Measuring Reward-Seeking via Contrastive Belief Updates"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.18966."}