{"as_of":"2026-08-15T02:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6acbae872d61936373a0667e05c35dfa24e3e705b3069ea970a794329242e6b8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:38:36.990324Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:4db57c8176221ffffecf1f6ce4d46a89cd2e5ebdad5387eeb07bfd5cd6872538","observation_id":"e6f0ac5f-7df8-4bf4-a62d-954b350d54a1","resolution":{"observed_at":"2026-05-19T20:28:39.570784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T23:24:39.835347Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2309.00614"},"observation_digest":"sha256:b4b3ded784c9b9ccf52a2a0d8ad770ea9863f80bc6ba0f11f85ad65377c8e12d","observation_id":"21b70197-ee2c-45d3-97f5-10495b97384d","resolution":{"observed_at":"2026-05-13T23:24:40.070684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T22:00:51.487120Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2310.06987"},"observation_digest":"sha256:fba1a5b44d73f76c856e5d23e6b46a5af57c208bb9df7f7f256bbf2ffde16033","observation_id":"7f4390b7-62ee-445a-8216-340d244f8201","resolution":{"observed_at":"2026-05-16T22:00:51.519583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-08-12T12:11:22.336410Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:013ef11e67efa40efc5da5fe1c44a69e9767bc1552257a4cca5f2b507a5343c8","observation_id":"d6ab93bd-c519-45f4-a798-b834acb4f06f","resolution":{"observed_at":"2026-05-18T14:25:59.177956Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:f2a334865d08c33f2bfe629089863d690443e16718e0ebe9faec060a25048a0e","observation_id":"febf8415-c6bf-42ff-b85c-77200f92c9da","resolution":{"observed_at":"2026-05-18T11:17:08.665940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:aa2ea98484d059d1a76d6d8f2c29d2b9c77409e82ff7b781cdaf6c7819ec6eb8","observation_id":"3eb0970a-203c-4127-8961-9e16f4df2c85","resolution":{"observed_at":"2026-05-15T02:20:44.567150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-11T04:38:36.990324Z","title":"Trick me if you can: Human-in-the-loop generation of adversarial examples for question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18693","last_updated":"2024-12-24T22:38:46Z","snapshot_observed_at":"2026-08-12T00:45:04.339287Z","submitted_at":"2024-12-24T22:38:46Z","title":"Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:38:36.990324Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2412.18693"},"observation_digest":"sha256:088a36e49146775b347ba83f9792266843c8df8173079692c66363a976dc1568","observation_id":"e5b8c7e7-81f2-4b82-aa35-284e15c98033","resolution":{"observed_at":"2026-08-11T04:38:36.990324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-10T22:03:52.515074Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02997","last_updated":"2025-01-06T13:14:34Z","snapshot_observed_at":"2026-08-12T15:12:35.234829Z","submitted_at":"2025-01-06T13:14:34Z","title":"CALM: Curiosity-Driven Auditing for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:03:52.515074Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2501.02997"},"observation_digest":"sha256:7a4e80ca395240e1413acdc1bcc66e94b84dac5ccd2a2b084831cf678c10e2c3","observation_id":"73ca601b-d2f1-4d1e-94e7-bad9260152b8","resolution":{"observed_at":"2026-08-10T22:03:52.515074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-10T20:34:36.468720Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08246","last_updated":"2025-01-14T16:32:01Z","snapshot_observed_at":"2026-08-14T09:59:00.280625Z","submitted_at":"2025-01-14T16:32:01Z","title":"Text-Diffusion Red-Teaming of Large Language Models: Unveiling Harmful Behaviors with Proximity Constraints","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:36.468720Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2501.08246"},"observation_digest":"sha256:a82120b8eae2b8304e5960fac214eea871fda8afa60d28621fa36156c858a78f","observation_id":"5340d82a-18b8-4cef-977d-3eee2b8506de","resolution":{"observed_at":"2026-08-10T20:34:36.468720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-08T17:02:47.208623Z","title":"Casper, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09638","last_updated":"2025-05-29T06:12:00Z","snapshot_observed_at":"2026-08-09T01:40:08.338849Z","submitted_at":"2025-02-09T20:49:16Z","title":"Jailbreaking to Jailbreak","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:02:47.208623Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2502.09638"},"observation_digest":"sha256:19b315ec1a70564d000449e7730b13500becc782f28608e9301f41e9f1470eac","observation_id":"c2dc83aa-689e-41e5-8127-bf4046b52290","resolution":{"observed_at":"2026-08-08T17:02:47.208623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T12:35:20.649185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24369","last_updated":"2025-05-30T09:02:07Z","snapshot_observed_at":"2026-08-14T23:42:53.296054Z","submitted_at":"2025-05-30T09:02:07Z","title":"Adversarial Preference Learning for Robust LLM Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:20.649185Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2505.24369"},"observation_digest":"sha256:31d3da64e62fd376ddb326aea99add4fa7083223c8d1cdfc9ca763fd6b947053","observation_id":"9b32b33d-7756-4ec4-913e-7c6d1be463bd","resolution":{"observed_at":"2026-08-07T12:35:20.649185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T10:55:20.057855Z","title":"Explore, establish, exploit: Red teaming language models from scratch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-14T09:12:40.647919Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.057855Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c670d53d783024d7c05a2214704111a8317d737244681bc6fbe22d2617acc765","observation_id":"ae34b8d3-fbac-43ec-a207-7dba2ef5b36d","resolution":{"observed_at":"2026-08-07T10:55:20.057855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T00:14:59.966022Z","title":"Casper, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14922","last_updated":"2025-06-24T19:55:23Z","snapshot_observed_at":"2026-08-13T20:33:14.014427Z","submitted_at":"2025-06-17T19:08:02Z","title":"FORTRESS: Frontier Risk Evaluation for National Security and Public Safety","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:59.966022Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.14922"},"observation_digest":"sha256:1767875901f914a25638a1a90aec4f55f2b88576ee269f4802c8bb6c1f1b424f","observation_id":"cfba1cf5-35fd-49e4-81d5-182a7d296090","resolution":{"observed_at":"2026-08-07T00:14:59.966022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:35:47.454816Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.09442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17514","last_updated":"2025-06-20T23:37:17Z","snapshot_observed_at":"2026-08-09T01:40:05.683901Z","submitted_at":"2025-06-20T23:37:17Z","title":"Kaleidoscopic Teaming in Multi Agent Simulations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:47.454816Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.17514"},"observation_digest":"sha256:c222d5e76e55ba100ef92e2ae0b2e618990c1228b3dd4ab919dcf54b2a733a59","observation_id":"d1c03a4e-92e4-4a51-9c7c-61118fc31784","resolution":{"observed_at":"2026-08-06T23:35:47.454816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:20:55.144189Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.094422023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-13T02:33:46.917734Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.144189Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:076f5aa1f43c1005092c75b283baca5b5f8843f5735f8f59982f97d2d7a5e2de","observation_id":"54a66195-b915-43e4-9959-84fd95786d5c","resolution":{"observed_at":"2026-08-06T23:20:55.144189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T17:35:48.010807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.010807Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1673627be3bb85834e86678d60981d42a7984b1a9cdf66251434799ef00451fa","observation_id":"ee47c9ff-dcb0-43a9-a097-9fad4e0e75d8","resolution":{"observed_at":"2026-08-06T17:35:48.010807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T23:13:03.550174Z","title":"arXiv preprint arXiv:2306.09442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.550174Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ec61fe362c8cc3f95b4e5b38a2337b069c8cf46c41796cbc5a08b1b3e48182a1","observation_id":"8fa9f4d3-d632-40d9-a50d-d4ed6826d947","resolution":{"observed_at":"2026-08-05T23:13:03.550174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T15:52:44.872573Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19432","last_updated":"2025-08-26T21:01:45Z","snapshot_observed_at":"2026-08-14T04:32:24.015151Z","submitted_at":"2025-08-26T21:01:45Z","title":"Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:52:44.872573Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.19432"},"observation_digest":"sha256:0d4278d3b5c3816769f4a96950ba0fdbde636d62418c26a639757b2eaf17d4ad","observation_id":"532f346b-bf62-476d-9d95-24477cb4d118","resolution":{"observed_at":"2026-08-05T15:52:44.872573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:10:21.273056Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.273056Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:397361a186f6a1de431c64920bc0e3463f675a3936d5bd9b6f9bc93cb80b1514","observation_id":"eb7228e8-a91f-4b61-ae2a-d1c55a42c3b9","resolution":{"observed_at":"2026-08-04T23:10:21.273056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:09:41.508015Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.508015Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:5ae6e144dd334d8f368d3138f5d8b7afbc53bb647bca7e9c2f5ed4ffa321c0c8","observation_id":"5f56caf1-de30-425d-a0ec-e7d7fabde360","resolution":{"observed_at":"2026-08-04T23:09:41.508015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T09:55:53.355255Z","title":"URL: http://arxiv.org/abs/2306.09442, doi:https://doi.org/10.48550/arXiv.2306.09442","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12993","last_updated":"2026-07-27T14:02:49Z","snapshot_observed_at":"2026-08-12T16:56:47.770936Z","submitted_at":"2025-10-14T21:10:50Z","title":"Tailored untruths: How personalisation challenges LLM safeguards","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:55:53.355255Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2510.12993"},"observation_digest":"sha256:40372e508780618156093a07209631e38fe7e95957344a938e9ecd04a021c4b1","observation_id":"0cf155fc-6461-4c27-a3bc-1c990bfdb00c","resolution":{"observed_at":"2026-08-04T09:55:53.355255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2604.15741","last_updated":"2026-04-17T06:31:29Z","snapshot_observed_at":"2026-07-06T23:03:12.000381Z","submitted_at":"2026-04-17T06:31:29Z","title":"Learning Uncertainty from Sequential Internal Dispersion in Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T08:36:39.242766Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2604.15741"},"observation_digest":"sha256:5d4812c7ccfcf675a068b62f64a11a1361fcfad841e27b3cf65cd72c4edbfc9f","observation_id":"ab94034e-cb58-4d6f-acc7-7f9ffdad0f68","resolution":{"observed_at":"2026-05-10T08:48:02.413805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2604.17769","last_updated":"2026-04-20T03:49:25Z","snapshot_observed_at":"2026-08-12T23:12:24.114119Z","submitted_at":"2026-04-20T03:49:25Z","title":"Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T04:35:51.223025Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2604.17769"},"observation_digest":"sha256:6322fa88ac193d300f1d4ddcae93b33fa35d002cd11ed56ef53cdbf14a619900","observation_id":"d8955db2-bcdd-499c-b8ec-3b9aad7f8b3e","resolution":{"observed_at":"2026-05-10T12:15:22.405159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:32:42.151644Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:5c3590648c8f3845569d3766cf30b82e1c21ac8abc4f76951aac804a86c56e9b","observation_id":"27e374e1-026f-4884-9734-44dca0ac509e","resolution":{"observed_at":"2026-05-11T01:40:52.596590Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:59:07.861941Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:32674b9e0fe4663d392fe70d455c1a76677fe01cf7519bf272deeb6d2ddeb282","observation_id":"1c8e15fe-8f07-42ae-8d0c-98f83597482b","resolution":{"observed_at":"2026-07-01T13:35:46.533799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T14:41:05.649595Z","title":"Explore, Establish, Exploit: Red teaming Language Models from scratch.arXiv preprint 2306.09442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T14:41:05.649595Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:ad25faf74434312d65207e4b8034d0ee228cc8b37b9b45ed62237a9362697ffc","observation_id":"013aef7e-a486-4a92-b0c6-1e03faf6af9e","resolution":{"observed_at":"2026-08-02T14:41:05.649595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.12809","last_updated":"2026-05-12T23:01:29Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:01:29Z","title":"Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces","version":1},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-05-14T20:17:01.224864Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.12809"},"observation_digest":"sha256:7422aeaf0cbe831c579db545dbf36d3dfc63540c4b475d69a95f6f0834c4df7b","observation_id":"b326c0f5-09b8-470d-bb57-d1c0b650a771","resolution":{"observed_at":"2026-05-14T20:17:54.348080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.16198","last_updated":"2026-05-15T17:13:27Z","snapshot_observed_at":"2026-08-15T01:07:38.403682Z","submitted_at":"2026-05-15T17:13:27Z","title":"Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T17:26:02.346222Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.16198"},"observation_digest":"sha256:8eaa41d16854d7b91e785dc88529d7b08e4dae8617428c990c01918c94af6935","observation_id":"d7bd52b0-f8a0-451f-9ea4-8ab3a91f5838","resolution":{"observed_at":"2026-05-20T17:28:48.020543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.05054","last_updated":"2026-06-03T16:12:30Z","snapshot_observed_at":"2026-08-12T12:36:47.059970Z","submitted_at":"2026-06-03T16:12:30Z","title":"Boosting Self-Consistency with Ranking","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-06-28T06:49:58.051659Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.05054"},"observation_digest":"sha256:439181ae9cbcb154a0c97a96b3eb52b72bcd88017f54e65e0a1136a8ef5a974f","observation_id":"622045b0-0c14-4d76-a948-691036c06a9d","resolution":{"observed_at":"2026-06-28T06:51:44.267655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-08-12T13:39:08.360008Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:595f62996eec8dc381ffcdd6a842283864925fbd9f89fe6e9511692957196adb","observation_id":"c911afea-adfd-4ed9-aa69-f2d0abe6abf6","resolution":{"observed_at":"2026-07-04T09:49:44.864881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-10T18:32:18.583804Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:c25ce40779f4714699244baad15780f57c431deb16e077eefccf69ab7afc0cc0","observation_id":"1c5b64cb-10fe-4708-8cb7-f0e89a5b8e2a","resolution":{"observed_at":"2026-07-04T21:00:08.519430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T07:44:08.962913Z","title":"& Hadfield-Menell, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-30T11:40:45Z","snapshot_observed_at":"2026-08-14T10:58:50.041021Z","submitted_at":"2026-07-10T11:39:40Z","title":"Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.962913Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:90221e79fdcb9fad05af3f7c42a80d98cffdc68bbf68a6eb975941e7a4b63d4b","observation_id":"c257477e-7e72-4329-a983-e8ba226c1af0","resolution":{"observed_at":"2026-08-02T07:44:08.962913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T15:07:17.112776Z","title":"Inverse scaling: When bigger isn’t better.arXiv preprint arXiv:2306.09442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14099","last_updated":"2026-05-01T17:02:19Z","snapshot_observed_at":"2026-08-14T17:03:24.275031Z","submitted_at":"2026-05-01T17:02:19Z","title":"Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T15:07:17.112776Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2607.14099"},"observation_digest":"sha256:a5aa28ea3e7bca73ef69f531ba2c6172153307473e476cc49dd2dc33e35ae966","observation_id":"40e14c18-6f9e-4d12-aa77-8bfc6d0d6d39","resolution":{"observed_at":"2026-08-02T15:07:17.112776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.09442/citation-record","integrity":"/paper/2306.09442/integrity","json":"/paper/2306.09442/citation-record.json","paper":"/paper/2306.09442"},"outbound":[],"paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:15:43.333784Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2306.09442."}