{"as_of":"2026-08-09T09:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0c9a42626cdb776d3eff774ac008cb64b7fcd22fe6ae429bfc5ac46a25c141b","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:27:35.040995Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:52:53.880521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:53:04.283223Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"cited_work":{"arxiv_id":"2507.00239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00239","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linearly decoding refused knowledge in aligned language models","venue":null,"work_id":"3c5085eb-90b8-4cef-afdf-eef09a80fbc6","year":2025},"citing_paper":{"arxiv_id":"2605.19341","last_updated":"2026-05-19T04:29:03Z","snapshot_observed_at":"2026-08-02T09:32:52.742127Z","submitted_at":"2026-05-19T04:29:03Z","title":"HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:53.880521Z"},"links":{"cited_paper":"/paper/2507.00239","citing_paper":"/paper/2605.19341"},"observation_digest":"sha256:e9c346250792b3e1ac1e3f205d192aacbfe58fc13dcadbe21b9bf667c1026c76","observation_id":"dbcb59b9-70ef-4595-91e4-d4fff01c1fd4","resolution":{"observed_at":"2026-05-20T05:53:04.285500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00239/citation-record","integrity":"/paper/2507.00239/integrity","json":"/paper/2507.00239/citation-record.json","paper":"/paper/2507.00239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.931557Z","title":"Yi-6b-chat","venue":null,"work_id":"35432c4e-9161-4ec8-a03c-828e5c06dfc5","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.845006Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:973caf27fbcb70269875a34e2ec1989e5b1fa9cb16295d5e42cbb34b984de3e5","observation_id":"c5a2a791-7579-49c3-88f6-b2715a52fc5a","resolution":{"observed_at":"2026-08-06T21:27:35.934291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.922062Z","title":"Fine-grained analysis of sentence embeddings using auxiliary prediction tasks","venue":null,"work_id":"db6de212-7ee8-424d-8b91-b87e228045b4","year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.848651Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:487a85adb707fc3b0568a4e0992e28fa152b44fd316d59553c0a8c1f19584a6e","observation_id":"60715637-4fce-4c16-a3de-03f09fe8e2c7","resolution":{"observed_at":"2026-08-06T21:27:35.925686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.851907Z","title":"Understanding intermediate layers using linear classifier probes, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.851907Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a1bb89a487e10990f0efb872909dafa01b2a6b570079eb3688ab82ad3a34df7e","observation_id":"8969fc5d-c558-4fd1-8a32-157c314a5060","resolution":{"observed_at":"2026-08-06T21:27:34.851907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.909119Z","title":"Bowman, Ethan Perez, Roger Baker Grosse, and David Duve- naud","venue":null,"work_id":"7075373b-29f5-42f8-8c80-1a0a831af1af","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.854780Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:adb3da5391ae81f27237e43fc2b1efc9742d07d784efb8534931a0378f0ebc12","observation_id":"69d7fd01-27f0-4eb8-9c1e-9955d628c309","resolution":{"observed_at":"2026-08-06T21:27:35.911881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.901008Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"e05a9dc4-5333-4906-a728-8e6caeea0bf1","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.857729Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:da4b1e8d4e5b4b9530b733e4d6722d3cff4fabdc20f4cd50d203468562e935c3","observation_id":"37a6811c-38e0-4a5e-9068-f4c2007e0ea5","resolution":{"observed_at":"2026-08-06T21:27:35.904069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.860566Z","title":"Language models can predict their own behavior","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.860566Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c914e7dd9ea4beb28e59c38fc48142654418d592a52721a519a8d26227964ebf","observation_id":"9c846136-d36f-414a-a8f2-ef648efbce58","resolution":{"observed_at":"2026-08-06T21:27:34.860566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:27:34.863565Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.863565Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d7dd1fe2595bb6d07239499aed4d79aa71f4611d9507b6dfe92a51afb4ed5d00","observation_id":"485bfb6e-dec1-4c15-9d9b-1a77e5774d35","resolution":{"observed_at":"2026-08-06T21:27:34.863565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.866492Z","title":"Probing classifiers: Promises, shortcomings, and advances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.866492Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:3cd13a2101834516c594deea2b7131cf9bc7efb369a0a6538c10a760e0d3f6b5","observation_id":"2498cc3d-3119-430c-99e0-fa4527e14201","resolution":{"observed_at":"2026-08-06T21:27:34.866492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.869282Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.869282Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:eb84602a9e5a8e7cb4a38a30dae24261a7047f849a9541f583c4e99fc8b3e08c","observation_id":"e12569d5-02ac-4d67-b948-992ae2bca332","resolution":{"observed_at":"2026-08-06T21:27:34.869282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.892929Z","title":"Wedded to prosperity? informal influence and regional favoritism","venue":null,"work_id":"8efd810a-dde7-4b0b-b928-64801144610c","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.871895Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:bb8845119418ce7b517b387068191fa70dc7d4fffbe89f3d0eee7247da323529","observation_id":"31e68641-64d1-482b-96b7-34c604c2b306","resolution":{"observed_at":"2026-08-06T21:27:35.895949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.874834Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.874834Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:3f31103dcd6c5e6d65245d70bfd77975ebcebc8ec642d989a4157e3c8aee11db","observation_id":"f0016ce6-8359-43f6-85ea-e5843884496d","resolution":{"observed_at":"2026-08-06T21:27:34.874834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.885064Z","title":"List of countries | Britannica","venue":null,"work_id":"a488a348-f853-4af2-8da3-318ad37b4ff2","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.877444Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:fd961dfa1f38b410d4fa54993be5dad5a91b3d55ad2dfcba52df17f0ab9375d2","observation_id":"c2aa32b7-6cc5-4ae0-9e33-b4778e0f59a0","resolution":{"observed_at":"2026-08-06T21:27:35.887726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18819","last_updated":"2024-10-24T15:08:17Z","snapshot_observed_at":"2026-08-08T21:13:25.321162Z","submitted_at":"2024-10-24T15:08:17Z","title":"From Imitation to Introspection: Probing Self-Consciousness in Language Models","version":1},"cited_work":{"arxiv_id":"2410.18819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18819","snapshot_observed_at":"2026-08-06T21:27:35.498272Z","title":"From Imitation to Introspection: Probing Self-Consciousness in Language Models","venue":"cs.CL","work_id":"494c6141-5972-49f9-8ee6-c3c2741875d6","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.880028Z"},"links":{"cited_paper":"/paper/2410.18819","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:5234f3556c92f3c9abeab848356e9f3ce86ef71d244667831a31ade07ec818cf","observation_id":"439e7a25-52f9-4974-a467-8996553ed81c","resolution":{"observed_at":"2026-08-06T21:27:35.503514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v36i10.21294","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.108932Z","title":"Probing linguistic information for logical inference in pre-trained language models","venue":null,"work_id":"6c4e14c4-8c12-4445-b6bd-05978399937f","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.883871Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:41be3e9703b49fcff3ca33cdef49d98797e899f23f0d51dbdad592878f868eaf","observation_id":"950eb059-ec69-4cd0-a671-ddaaba6b4324","resolution":{"observed_at":"2026-08-06T21:27:35.112492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09177","last_updated":"2024-10-02T10:43:07Z","snapshot_observed_at":"2026-08-01T16:03:38.510223Z","submitted_at":"2024-02-14T13:45:19Z","title":"Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09177","snapshot_observed_at":"2026-08-06T21:27:34.886612Z","title":"Leverag- ing the context through multi-round interactions for jailbreaking attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.886612Z"},"links":{"cited_paper":"/paper/2402.09177","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:b466b77bd3fe9714c4cb095814afd66be919db5efb4561f749044d6e890412f4","observation_id":"eefa3a7d-cae6-4863-a024-f84dc69db856","resolution":{"observed_at":"2026-08-06T21:27:34.886612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.889561Z","title":"Breaking down the defenses: A comparative survey of attacks on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.889561Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:31eeebc41b5b13d01da3dd9f38edc7989f27c8bf6af8b300b30ea0a5e78cc4c2","observation_id":"fe531612-2443-4d1a-aa94-e4a8fd5900df","resolution":{"observed_at":"2026-08-06T21:27:34.889561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-08-08T01:20:38.655253Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-06T21:27:34.892626Z","title":"Com- prehensive assessment of jailbreak attacks against llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.892626Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:63dc3a74204918fc866f4e7c72c54c5126ef7fe372a56221478d92ccedd83f0b","observation_id":"01705d48-dbcf-4a46-bc10-2a5b4228527b","resolution":{"observed_at":"2026-08-06T21:27:34.892626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.895935Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.895935Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d9a7f882c2452e3bc8f4d51b8a5026bc2085c7127477aaf94a2aa55f5960e90e","observation_id":"526a21f6-bf23-4ce8-80df-4186450bc962","resolution":{"observed_at":"2026-08-06T21:27:34.895935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.872487Z","title":"Pawan Kumar, and Adel Bibi","venue":null,"work_id":"d30a3a57-79a6-4060-bd9e-439c4baedb51","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.898752Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:b4038d1a34b47ba08a7e9051d748d90aa3b2699eea38232dc5192e4fc4f9aa52","observation_id":"f180b5d0-bf86-48b5-9d09-b5531dafd636","resolution":{"observed_at":"2026-08-06T21:27:35.875007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.901466Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.901466Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:e5de7e24e130a245a3e116a484fd41fd41423c1400ad9bc323c5331e78169831","observation_id":"b092e29e-e050-4f37-a99e-6c79a296a0d8","resolution":{"observed_at":"2026-08-06T21:27:34.901466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.905010Z","title":"Estimating knowledge in large language models without generating a single token","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.905010Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:3e456423749e4f5f35630c1267b5eb7fbf875a5014268a86b679382cd31b0143","observation_id":"06d3705b-e684-468a-9d09-dfba78d41227","resolution":{"observed_at":"2026-08-06T21:27:34.905010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.908262Z","title":"Not what you’ve signed up for: Compromising real-world llm-integrated applications with indirect prompt injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.908262Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:559bcb2f2a0a067eeca5a303dafa0b5b5afe8191d33c77f0b8c390565c045ee8","observation_id":"6fae92c4-ed83-4aa5-b882-635b997b8616","resolution":{"observed_at":"2026-08-06T21:27:34.908262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.864484Z","title":"Language models represent space and time","venue":null,"work_id":"8de3c109-940a-47c0-8c2d-be51e9fc95c1","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.910913Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:41b8ac71f7c5ea58b96fe11e6091830e666da1f26f4e16410d0a32de70fe0f49","observation_id":"cfa06f62-615f-40ca-9ed9-45d4fdd293ab","resolution":{"observed_at":"2026-08-06T21:27:35.867466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.855557Z","title":"The Elements of Statistical Learning: Data Mining, Inference, and Prediction, volume 2","venue":null,"work_id":"c3cdc236-3d9c-41a2-b02e-eb5c7a9b4f84","year":2009},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.913521Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:0ee5564251af75e7e5174932e6dd31e01914ab21373d0be85838e436c99e27b0","observation_id":"646a3c4b-2bd7-4830-8711-db5f719a9414","resolution":{"observed_at":"2026-08-06T21:27:35.859326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.846421Z","title":"Do LLMs “know” internally when they follow instructions? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"465027c2-c67f-4b6b-9ecd-89d266747ded","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.916396Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:fdd3ce30ff3ae9967da12cfc744086075dd5db04d512b5a5f5e310805aaeedb6","observation_id":"c3ac457d-fb07-4073-bd67-6fd10c97a6b4","resolution":{"observed_at":"2026-08-06T21:27:35.849401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.919014Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.919014Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:04b1f303e3507fc32e89bbe440ec5ee720eb086443d1650593494dd40266ef94","observation_id":"759b8f54-cd1d-4747-854f-355b875cf830","resolution":{"observed_at":"2026-08-06T21:27:34.919014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.921758Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.921758Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c0387a831e236daa6cc541585f2ad75be4f96a3fec3915fa7873929168874cb9","observation_id":"8430ffe5-7061-4fc7-9eef-39105ff4c5cf","resolution":{"observed_at":"2026-08-06T21:27:34.921758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06748","last_updated":"2025-08-29T17:08:59Z","snapshot_observed_at":"2026-08-03T11:03:45.331021Z","submitted_at":"2024-12-09T18:40:44Z","title":"Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06748","snapshot_observed_at":"2026-08-06T21:27:34.924646Z","title":"Refusal tokens: A simple way to calibrate refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.924646Z"},"links":{"cited_paper":"/paper/2412.06748","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:91e45b7e0c431864d83194c366a46b471305bd59257cfc008f602ce30564a450","observation_id":"c01ad35f-d372-4f9f-b395-75534335cdf1","resolution":{"observed_at":"2026-08-06T21:27:34.924646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.833623Z","title":null,"venue":null,"work_id":"426c9be0-b554-4217-85d7-dcabb40d0e4c","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.927770Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:b8378f210f8ae8cd3f48cfdb7bfcbb9bd6dffd89ecf97c543a1e75bd29df9913","observation_id":"3336f87e-aea9-41c8-a87f-3a981ccda430","resolution":{"observed_at":"2026-08-06T21:27:35.836329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.930716Z","title":"Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.930716Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:0848f73a22342ef9a737b1ac04bb8b473e970d14c65ebc6f2a6f3e068341a882","observation_id":"cfda084d-86b9-4854-91d3-8374c95541d7","resolution":{"observed_at":"2026-08-06T21:27:34.930716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14659","last_updated":"2021-03-26T18:01:48Z","snapshot_observed_at":"2026-07-06T10:53:51.296957Z","submitted_at":"2021-03-26T18:01:48Z","title":"Alignment of Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14659","snapshot_observed_at":"2026-08-06T21:27:34.933507Z","title":"Alignment of language agents","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.933507Z"},"links":{"cited_paper":"/paper/2103.14659","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:7ffaea0116f1d3335d1688025e22ccdebdb856e8bb598d7ec8cff3d343d3de36","observation_id":"4bbaf33b-6b53-4065-8505-50fe0f78aa21","resolution":{"observed_at":"2026-08-06T21:27:34.933507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.936952Z","title":"Linear representations of political perspective emerge in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.936952Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:821e0c15017c7e6b72a71f61f99d0a35d6277ec102624c93b8f6a655adeb2ce1","observation_id":"21901eb9-72ba-4d6c-903f-2f333a024a6a","resolution":{"observed_at":"2026-08-06T21:27:34.936952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T21:27:34.939664Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.939664Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:49060ad40f8cedf9a659a3f3d9f59374ed2ee52afe9c367eb77a5540ecf77b97","observation_id":"7baf0ade-4903-4696-9913-52d67c38e2f1","resolution":{"observed_at":"2026-08-06T21:27:34.939664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05050","last_updated":"2025-06-03T00:32:13Z","snapshot_observed_at":"2026-08-07T16:07:59.195016Z","submitted_at":"2025-04-07T13:20:17Z","title":"Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models","version":4},"cited_work":{"arxiv_id":"2504.05050","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05050","snapshot_observed_at":"2026-08-06T21:27:35.228718Z","title":"Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models","venue":"cs.CL","work_id":"d489bc54-96a7-4be6-945b-ff84a9cc21dc","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.942636Z"},"links":{"cited_paper":"/paper/2504.05050","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:bc206d5b5ee79fc7ae95d3d4f2c745ac350c2356eca0a0cb7f14999695876c22","observation_id":"bcc200e2-fc7b-4a7c-aa80-f5ae16cb250e","resolution":{"observed_at":"2026-08-06T21:27:35.231753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.820715Z","title":"The unlocking spell on base LLMs: Rethinking alignment via in-context learning","venue":null,"work_id":"cd728be0-0c63-4090-999b-1aeb1f3846e4","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.945645Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:0c2dc7e04ef83f431f756bb1629a68aee58e4b2a409d7fd543b114852a29ceef","observation_id":"e8c6d6a0-da41-49f0-b24a-5a9ff6d632cb","resolution":{"observed_at":"2026-08-06T21:27:35.823624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10794","last_updated":"2024-12-02T21:48:47Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:38:48Z","title":"Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10794","snapshot_observed_at":"2026-08-06T21:27:34.948426Z","title":"Towards understanding jailbreak attacks in llms: A representation space analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.948426Z"},"links":{"cited_paper":"/paper/2406.10794","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:732564b319ddb064b9a0089a69318a792e7bc64a3698a82bfa9e3954690a4910","observation_id":"1dabd6f2-50a8-44ae-8f45-764cd3e04cc0","resolution":{"observed_at":"2026-08-06T21:27:34.948426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.812217Z","title":"Formalizing and benchmarking prompt injection attacks and defenses","venue":null,"work_id":"b4952575-9cfe-441c-9a7c-d07a53b87719","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.951313Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:ee25f714a30886e342dea51073eac0f0b31261aa3a082656142d905d5e601eae","observation_id":"74188ff8-dbf6-4b71-9309-9484a5e2fb27","resolution":{"observed_at":"2026-08-06T21:27:35.815303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18540","last_updated":"2025-01-17T01:43:21Z","snapshot_observed_at":"2026-08-09T01:10:23.759600Z","submitted_at":"2024-02-28T18:23:49Z","title":"Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18540","snapshot_observed_at":"2026-08-06T21:27:34.954267Z","title":"Keep- ing llms aligned after fine-tuning: The crucial role of prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.954267Z"},"links":{"cited_paper":"/paper/2402.18540","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:204e580472c0f2fa1af3c9fc73b809253eeee3718a0cc278752d7e85993a67ed","observation_id":"70fcb23a-e528-4821-9f89-888045f82745","resolution":{"observed_at":"2026-08-06T21:27:34.954267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.803768Z","title":"The geometry of truth: Emergent linear structure in large lan- guage model representations of true/false datasets","venue":null,"work_id":"14db4249-35d2-477a-b105-6bdfb501db9c","year":null},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.957079Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c2b3dd989dfff102fa7f61f518a81c7a4ceea7d03b4095faa1d3c00b7b575c9a","observation_id":"86438a36-a411-4441-a471-54d8bed4c87d","resolution":{"observed_at":"2026-08-06T21:27:35.806655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.787074Z","title":"Occupation Data - O*NET 29.2 Data Dictionary at O*NET Re- source Center","venue":null,"work_id":"9cc9e9b8-630e-471f-836e-0afc0a94a8a3","year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.962407Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:cf66516380e95e93c6f92fed6f584119b482d3d079d44d03181098d8cb925e40","observation_id":"6c34073d-86c8-4a1e-89c7-b423059d414c","resolution":{"observed_at":"2026-08-06T21:27:35.789994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.778734Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"3dd3c747-3037-4033-8b9a-88b64093b2e4","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.965216Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:b1a279ed789054f1dbdd206bbe53f51cf07520e2b76793779b7a0efc70eaab8f","observation_id":"b186f49c-7811-4216-8e8b-7da273136424","resolution":{"observed_at":"2026-08-06T21:27:35.781795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.769727Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":"872cff9b-47fc-4790-a0a9-8c636a8fa48f","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.967915Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:91e85078af781b21f9be0b93fdd5d89313fce058197e419065e09d43d83645d3","observation_id":"d3d0f1e2-31dd-4717-8934-f78e7e3e7546","resolution":{"observed_at":"2026-08-06T21:27:35.773466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-06T21:27:34.970768Z","title":"Ignore previous prompt: Attack techniques for language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.970768Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:f08dfee0c6d680127960632c27560dde87fe4ede43b7e0e8fd66cce113cfa09a","observation_id":"5096fc8d-d834-4727-8e4f-34e49c62aa1b","resolution":{"observed_at":"2026-08-06T21:27:34.970768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.973853Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.973853Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:538dd608e5b1c2b246234ae3c733a8f17ae83e37b2fc7ff7adf83365c4e11e44","observation_id":"a17f31f2-5cce-4416-a8d5-5f571d90d4fd","resolution":{"observed_at":"2026-08-06T21:27:34.973853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.977277Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.977277Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:fa29c5be27d998d234776a8cce25fff48b173f473a3ad06e1501c7cdadfc8a66","observation_id":"67379375-b768-4557-a664-7adce87c13e5","resolution":{"observed_at":"2026-08-06T21:27:34.977277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:34.980167Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.980167Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:98792edba877fa5bc4af5ed12980a3a37d2828ec40b907681f545d22d3d8d623","observation_id":"fb4c71d6-3951-4f95-a5a5-ad814441f6bc","resolution":{"observed_at":"2026-08-06T21:27:34.980167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.746301Z","title":"Multi- task prompted training enables zero-shot task generalization","venue":null,"work_id":"d943cc7b-c2a8-4e67-969c-a9b9d5bc8d3e","year":2022},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.982721Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a0e946253a20701d5ba0847852bc1a7571e174f6493a518f3df6d39714583535","observation_id":"1c158573-9d21-4878-b441-ee83b5fc65c0","resolution":{"observed_at":"2026-08-06T21:27:35.749217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T21:27:34.985261Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.985261Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:22574099aeeb0ee0d256dfe7d3a09588a884d01a81d5397257591349b96aa022","observation_id":"74e33e9a-f10b-4f6d-88cb-9af4f587b0f0","resolution":{"observed_at":"2026-08-06T21:27:34.985261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.738166Z","title":"do anything now","venue":null,"work_id":"1a860ccb-20d7-4756-a95f-ba71549b0164","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.988437Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:571a9c2dd52b8f1ffcf79c21d84ad248e678658f772871a3646a497178b24084","observation_id":"8e459ab7-d98c-43af-9a8b-2b7768a272c4","resolution":{"observed_at":"2026-08-06T21:27:35.740959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13204","last_updated":"2024-10-17T04:12:17Z","snapshot_observed_at":"2026-08-08T15:07:13.599428Z","submitted_at":"2024-10-17T04:12:17Z","title":"Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations","version":1},"cited_work":{"arxiv_id":"2410.13204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13204","snapshot_observed_at":"2026-08-06T21:27:35.194364Z","title":"Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations","venue":"cs.CL","work_id":"12149a54-cc8f-44cb-9ec8-2682fd05a894","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.991094Z"},"links":{"cited_paper":"/paper/2410.13204","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:e875d79ad6dc9f28c2f9bc31d8e335cdff528f76765812af84aa418633be0b64","observation_id":"8ccd69e5-4941-4fa4-ac29-f2fcc1404203","resolution":{"observed_at":"2026-08-06T21:27:35.197892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01724","last_updated":"2024-05-02T20:42:28Z","snapshot_observed_at":"2026-08-06T07:01:20.735410Z","submitted_at":"2024-05-02T20:42:28Z","title":"Large Language Models are Inconsistent and Biased Evaluators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01724","snapshot_observed_at":"2026-08-06T21:27:34.994224Z","title":"Large language models are incon- sistent and biased evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.994224Z"},"links":{"cited_paper":"/paper/2405.01724","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:913b17cf559b0951e0c8f5c2012c9d50cbef30639a519f666fb0f903ce5cdb76","observation_id":"89b52122-a299-46f1-ac45-1adf19bcba0f","resolution":{"observed_at":"2026-08-06T21:27:34.994224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T21:27:34.997511Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.997511Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:6e35dfc047992e32cf461f615d20b05773610a27fdc0e36c6845e43843bd8e0d","observation_id":"a88fe132-d912-464b-adb0-575e52fb0356","resolution":{"observed_at":"2026-08-06T21:27:34.997511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-06T21:27:35.000447Z","title":"What do you learn from context? probing for sentence structure in contextualized word representations","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.000447Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:304691e30b050562f697b60e49940b6c31713b9395613ddd33cd600e2b047dcb","observation_id":"358b4c94-e01b-4aea-9bf5-e6661b3756af","resolution":{"observed_at":"2026-08-06T21:27:35.000447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.730148Z","title":"Attention is all you need","venue":null,"work_id":"edc41dbe-51c4-472b-9964-5d5306dbe5a2","year":2017},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.003388Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a7d34171863b733721483e1c26b5af545f96cc20613a19a62ce4b10c0b1050f7","observation_id":"d4edba58-579f-41fa-95c9-c325e80519d1","resolution":{"observed_at":"2026-08-06T21:27:35.732940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.721553Z","title":"White-box multimodal jailbreaks against large vision-language models","venue":null,"work_id":"e99e6085-e53b-49c5-9c60-12266ac97623","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.005888Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:882b3cd01f4636bcf3d790b0d856f0f71d3deb5ffe8515e1392f51ef12074250","observation_id":"f93403d1-7fd8-425f-b47d-251dcb60d155","resolution":{"observed_at":"2026-08-06T21:27:35.724603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.712429Z","title":"Jailbroken: How does LLM safety training fail? In Thirty-seventh Conference on Neural Information Processing Systems, 2023","venue":null,"work_id":"c8f0624f-b36f-486c-839b-bd8cf665f1b4","year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.008684Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:2fa7d3b0d6aba6c6acb7bce199c82967dddfdb9e269d2e2a0d17210bb36820f8","observation_id":"8a797ac8-2e88-4f95-8733-6c1002f776bd","resolution":{"observed_at":"2026-08-06T21:27:35.715626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-02T21:32:36.729604Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-06T21:27:35.011420Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.011420Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:ea06e921fe358b486ebcfeaae0b1c16a25e3dbae96c8d330e982f742f095a3a6","observation_id":"e52b27ab-0ec8-40c8-8109-dde23d632199","resolution":{"observed_at":"2026-08-06T21:27:35.011420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T21:27:35.014424Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.014424Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c62fecb01f32a4fedbdb7000c2661ade36247f02716b42c816114fb3663d4c39","observation_id":"c8564b34-057e-407c-bf81-6ed1135155b4","resolution":{"observed_at":"2026-08-06T21:27:35.014424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.017387Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.017387Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:bd733edea9e953f82b3607c07474d194f6355ee99418915843156b00850fe179","observation_id":"e8c3f6af-81dd-40ef-ab5a-21b0092acb6e","resolution":{"observed_at":"2026-08-06T21:27:35.017387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10235","last_updated":"2023-08-30T04:32:36Z","snapshot_observed_at":"2026-07-06T15:28:40.452146Z","submitted_at":"2023-05-15T15:44:51Z","title":"Assessing Hidden Risks of LLMs: An Empirical Study on Robustness, Consistency, and Credibility","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10235","snapshot_observed_at":"2026-08-06T21:27:35.020100Z","title":"Assessing hidden risks of llms: an empirical study on robustness, consistency, and credibility","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.020100Z"},"links":{"cited_paper":"/paper/2305.10235","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:a2e90e09ff8177e8a190d1dcc31a4ec4cd3c22196bd5a83eadd8eba1c8fc9a6c","observation_id":"f17e0bc1-e48f-4aac-ab21-9c93e8167193","resolution":{"observed_at":"2026-08-06T21:27:35.020100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.549","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.069041Z","title":"On the vulnerability of safety alignment in open-access LLMs","venue":null,"work_id":"3b71ee97-80e4-427f-bc6b-acc6b86c8f2a","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.022967Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:030df53e54748426d39048af82de3fd441e159b0dcf6ee91082147e30f9100be","observation_id":"a33b0e54-ad19-4232-89ae-fc87d627e05a","resolution":{"observed_at":"2026-08-06T21:27:35.073634Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-06T21:27:35.025865Z","title":"Jailbreak attacks and defenses against large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.025865Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:84e1af59cdf8f5f8aafaa195924db48a9621b6f6233043c8c9924d09fd42ba16","observation_id":"549a16a1-0b82-45bf-83b0-0e8a7a9e5e49","resolution":{"observed_at":"2026-08-06T21:27:35.025865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T21:27:35.028823Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.028823Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:2afbf9a696a6959fe67885a8c2ed6a5428016431354d6adf07abdd309115bc0e","observation_id":"9836f397-8f1c-4026-b996-27b1613c361a","resolution":{"observed_at":"2026-08-06T21:27:35.028823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.698949Z","title":"Don’t listen to me: understanding and exploring jailbreak prompts of large language models","venue":null,"work_id":"669f1d2e-0122-435d-8fbe-cf691dffc9e5","year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.031749Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:8a379581cc7bf9d2cb84fcdf4fa788093db5840a9fb07e1034f2ae0e9194652f","observation_id":"5857d7c6-e88b-4079-bdda-232f7a5b79d9","resolution":{"observed_at":"2026-08-06T21:27:35.702045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.034422Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.034422Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:7705d077f152521944f0bcd3b25ce46091b874f532239404cc3dc6730d239828","observation_id":"bf6791de-0c35-48c4-9af0-7d7f436b471c","resolution":{"observed_at":"2026-08-06T21:27:35.034422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.037339Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.037339Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:39cd0cd700cd2aa94584e28761591a544de95dd4c755903bf68bae68f99b794b","observation_id":"dab3bda0-c3ff-45ee-b08c-c3cb7706f90b","resolution":{"observed_at":"2026-08-06T21:27:35.037339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T21:27:35.040995Z","title":"diverse set of fictional names","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.040995Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:d5d56e4441e4a8057306e35d474c5af535ba40a832107afdb4e3b4e55318f40c","observation_id":"e3b2af77-ec94-45f6-9f49-31afebf2d95b","resolution":{"observed_at":"2026-08-06T21:27:35.040995Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:35.795812Z","title":null,"venue":null,"work_id":"4973625e-81af-4e7c-8c9b-77f1f4c196fb","year":null},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.959696Z"},"links":{"citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:5f11ecce72c9214d4b1cae2f7cbb4a0d2e432bc00d8cd2413ff62313ab9bb621","observation_id":"7b418754-5462-49f6-8997-fc1ee1e73aef","resolution":{"observed_at":"2026-08-06T21:27:35.798529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":22},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2507.00239."}