{"as_of":"2026-08-11T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13e1730d76bda0007d9fff5369eaf5d9ea8ec7db22ee841e5604ade16b666f07","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:19.347784Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:24:24.714121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"cited_work":{"arxiv_id":"2506.16078","doi":"10.48550/arxiv.2506.16078","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16078","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Probing the","venue":"ArXiv.org","work_id":"0404596f-ccca-4ce3-ace6-7c27c9fc3a48","year":2025},"citing_paper":{"arxiv_id":"2511.17408","last_updated":"2026-04-19T21:58:15Z","snapshot_observed_at":"2026-08-10T23:27:19.301813Z","submitted_at":"2025-11-21T17:08:48Z","title":"The Impact of Off-Policy Training Data on Probe Generalisation","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T20:26:37.914522Z"},"links":{"cited_paper":"/paper/2506.16078","citing_paper":"/paper/2511.17408"},"observation_digest":"sha256:f35922d77452d88ceac32626fc59ae70348a5d093c8ed08b90bd4a1670648e36","observation_id":"02cf7c9a-d832-48d7-b219-06c3e5ffc297","resolution":{"observed_at":"2026-05-17T20:30:11.710099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"cited_work":{"arxiv_id":"2506.16078","doi":"10.48550/arxiv.2506.16078","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16078","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Probing the","venue":"ArXiv.org","work_id":"0404596f-ccca-4ce3-ace6-7c27c9fc3a48","year":2025},"citing_paper":{"arxiv_id":"2605.09391","last_updated":"2026-05-15T12:37:57Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:38:34Z","title":"Do Linear Probes Generalize Better in Persona Coordinates?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:47:47.214726Z"},"links":{"cited_paper":"/paper/2506.16078","citing_paper":"/paper/2605.09391"},"observation_digest":"sha256:cb46f70b9f92ef19e11c78d9bf19801e53ad96ebfa2014c972d0b73ad1f0d4b0","observation_id":"886bd8ff-0cd4-488a-9940-59e25931abd6","resolution":{"observed_at":"2026-05-12T04:51:23.072108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"cited_work":{"arxiv_id":"2506.16078","doi":"10.48550/arxiv.2506.16078","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16078","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Probing the","venue":"ArXiv.org","work_id":"0404596f-ccca-4ce3-ace6-7c27c9fc3a48","year":2025},"citing_paper":{"arxiv_id":"2605.09391","last_updated":"2026-05-15T12:37:57Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:38:34Z","title":"Do Linear Probes Generalize Better in Persona Coordinates?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-19T17:06:22.481341Z"},"links":{"cited_paper":"/paper/2506.16078","citing_paper":"/paper/2605.09391"},"observation_digest":"sha256:5cd220d796ce4d2d0e2ab8d8861b6844bffb80bf1dda7dbd98329561f1c7f241","observation_id":"a18f57df-b40a-408d-8aba-c97a249e2be6","resolution":{"observed_at":"2026-05-19T17:07:40.576154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"cited_work":{"arxiv_id":"2506.16078","doi":"10.48550/arxiv.2506.16078","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16078","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Probing the","venue":"ArXiv.org","work_id":"0404596f-ccca-4ce3-ace6-7c27c9fc3a48","year":2025},"citing_paper":{"arxiv_id":"2606.15980","last_updated":"2026-06-18T23:56:29Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T19:07:22Z","title":"Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T03:24:24.714121Z"},"links":{"cited_paper":"/paper/2506.16078","citing_paper":"/paper/2606.15980"},"observation_digest":"sha256:9bc29a21f4c09293d38934e69a1874405d4ab2194f4ab305b366d10bf5eb6952","observation_id":"9d59673f-1414-478d-b516-68d1df279595","resolution":{"observed_at":"2026-06-27T03:30:26.963521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16078/citation-record","integrity":"/paper/2506.16078/integrity","json":"/paper/2506.16078/citation-record.json","paper":"/paper/2506.16078"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:12.823540Z","title":"URL https://api.semanticscholar.org/CorpusID:268232499","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:12.823540Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:370b29f6d0fa59c0b47e150c04699f905cc4eee1c51b4f56faf79613c7ba0bc5","observation_id":"44757a17-c1ea-4f3c-ad97-f022f4781849","resolution":{"observed_at":"2026-08-06T23:49:12.823540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:49:12.948150Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:12.948150Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:5db1b8632af0332992ede3f77b7f75f9038d22b00f81647eaf8f5ea8c732d37a","observation_id":"718eee71-0ac9-4984-8b4d-27ede5b53529","resolution":{"observed_at":"2026-08-06T23:49:12.948150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T23:49:13.094114Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.094114Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:5aa64f71a5dbfba3f9eb40883c9498211b69aa258ca6cc12cde19405fe5d4365","observation_id":"28c35c6b-b441-4b2e-a413-138b5172816b","resolution":{"observed_at":"2026-08-06T23:49:13.094114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:22.207526Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"d1b64274-930a-43c1-a524-71fa00360ab0","year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.253737Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:a98b7c9437c792b086cc4c72c3811ff4f9d879bf8804cc08fb543dbf105e061a","observation_id":"ce6cad00-b61a-4956-b815-a592d136e3ce","resolution":{"observed_at":"2026-08-06T23:49:22.260682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T23:49:13.400656Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.400656Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:b001cb60155784426c7e756c62bec4088784549343d5ac5bf8e523e568b30524","observation_id":"ff69e5cd-8704-47a4-94e4-9cc84f296787","resolution":{"observed_at":"2026-08-06T23:49:13.400656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T23:49:13.523748Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.523748Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:54b5cce6def417b36435784fed888a2b6bd82f8a4ea7db8989f478673b97a14c","observation_id":"268798a0-aa0b-4957-9ddf-679229567239","resolution":{"observed_at":"2026-08-06T23:49:13.523748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-07T17:43:00.958834Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-06T23:49:13.652587Z","title":"Defending against unforeseen failure modes with latent adversarial training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.652587Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:e09e809cdbd88e6fa786a19bdc9f0278eb3ef84f848fcbb37e760afa20604c17","observation_id":"19916c45-3fad-4278-b18f-facb56a1446e","resolution":{"observed_at":"2026-08-06T23:49:13.652587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:13.760620Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.760620Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:da78a7bc05e0cb68c547ec07f6d8880fdcb8023e66c1483a403602cfa4c99774","observation_id":"4a8cbe40-1481-4509-90a3-440ba53a2645","resolution":{"observed_at":"2026-08-06T23:49:13.760620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09066","last_updated":"2025-07-04T15:13:55Z","snapshot_observed_at":"2026-08-07T17:11:06.078751Z","submitted_at":"2025-03-12T04:59:22Z","title":"Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09066","snapshot_observed_at":"2026-08-06T23:49:13.842722Z","title":"Probing latent subspaces in llm for ai security: Identifying and manipulating adversarial states","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.842722Z"},"links":{"cited_paper":"/paper/2503.09066","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:a261f93ca75f606b0a94901922fef873729091d3db202b12753277373a50a8b0","observation_id":"8db9b532-ee68-48e0-95c5-0aa7879e17d3","resolution":{"observed_at":"2026-08-06T23:49:13.842722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:49:13.943741Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.943741Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:ce2b9f7ee0b6e2c6ec249a1ef5ce5734c81a226f5b5ece26461cc590b4951153","observation_id":"52f4463e-e514-47a3-8380-78bdbb47f8c5","resolution":{"observed_at":"2026-08-06T23:49:13.943741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02780","last_updated":"2023-12-05T14:12:15Z","snapshot_observed_at":"2026-08-02T20:11:51.008725Z","submitted_at":"2023-12-05T14:12:15Z","title":"Scaling Laws for Adversarial Attacks on Language Model Activations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02780","snapshot_observed_at":"2026-08-06T23:49:14.075962Z","title":"Scaling laws for adversarial attacks on language model activations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.075962Z"},"links":{"cited_paper":"/paper/2312.02780","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:f2fd9f8d8ee72ca5a5e3cc681d244b1cfca0c686dae38a36885eaf1e0bb19093","observation_id":"3e31ae40-8794-4330-9ebb-36b06ab76392","resolution":{"observed_at":"2026-08-06T23:49:14.075962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-06T23:49:14.203220Z","title":"Shaping the safety boundaries: Understanding and defending against jailbreaks in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.203220Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:034849c1b3e7109d7de38be86be31bd33df41de475e1213b9ab89d8ad28710a2","observation_id":"0dac8ef6-6477-455b-bf29-81049e1406ef","resolution":{"observed_at":"2026-08-06T23:49:14.203220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T23:49:14.339131Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.339131Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:4ba28f6de1ec9044ffa0b0b99dae67b34ab874310beb142f45f9b30ca2d3678a","observation_id":"ec9bbdf3-572d-4998-909e-05f08a5733e8","resolution":{"observed_at":"2026-08-06T23:49:14.339131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:49:14.419356Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.419356Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:8254a81e23c11d1dbee3458af0c807e3e6fdb8c50c7d2d41d9547ef57aa082f1","observation_id":"54ed4062-b926-4749-9107-c588f9489a4a","resolution":{"observed_at":"2026-08-06T23:49:14.419356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11844","last_updated":"2024-09-18T09:55:48Z","snapshot_observed_at":"2026-07-06T19:17:28.308643Z","submitted_at":"2024-09-18T09:55:48Z","title":"MEOW: MEMOry Supervised LLM Unlearning Via Inverted Facts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11844","snapshot_observed_at":"2026-08-06T23:49:14.540498Z","title":"Meow: Memory supervised llm unlearning via inverted facts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.540498Z"},"links":{"cited_paper":"/paper/2409.11844","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:404521935a6b019ecf96877b612d7b74f41147577783691da86627bbfe5b06e6","observation_id":"08f40f92-7bcb-4bdd-900e-d092364a26b1","resolution":{"observed_at":"2026-08-06T23:49:14.540498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06899","last_updated":"2024-05-22T06:18:41Z","snapshot_observed_at":"2026-08-07T07:57:31.754486Z","submitted_at":"2023-11-12T17:18:21Z","title":"Flames: Benchmarking Value Alignment of LLMs in Chinese","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06899","snapshot_observed_at":"2026-08-06T23:49:14.676174Z","title":"Flames: Benchmarking value alignment of llms in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.676174Z"},"links":{"cited_paper":"/paper/2311.06899","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:6763bb64a6f38eb4eec6575da8e8ba7ab5b2adf11f227b65b9b4eeefbfb29980","observation_id":"4a44650f-67a2-4463-85e3-d59c58693d32","resolution":{"observed_at":"2026-08-06T23:49:14.676174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:22.091424Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"49a50cb4-53ac-4fff-82ea-f6a74cf02561","year":2017},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.798173Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:488ee457ae8a1010c36ea1646ae3ced95c58ff344330992282868a9ab341aa58","observation_id":"95220e44-bdb4-4e09-8c2f-e2c4eba63848","resolution":{"observed_at":"2026-08-06T23:49:22.138710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03813","last_updated":"2023-12-06T18:27:07Z","snapshot_observed_at":"2026-08-08T09:14:49.430132Z","submitted_at":"2023-12-06T18:27:07Z","title":"Improving Activation Steering in Language Models with Mean-Centring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03813","snapshot_observed_at":"2026-08-06T23:49:14.924023Z","title":"Improving activation steering in language models with mean-centring","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:14.924023Z"},"links":{"cited_paper":"/paper/2312.03813","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:a7bdf1e5c8009ef419e5869cfeca9965c2918f82085b6aef39992c63705f73d6","observation_id":"cf554321-a7f5-4f89-8968-71a2fe8805f5","resolution":{"observed_at":"2026-08-06T23:49:14.924023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:21.944621Z","title":"Large language model unlearning via embedding-corrupted prompts","venue":null,"work_id":"e37d3a85-c09c-4179-b1cc-450c1b196bac","year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.073777Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:1218c156971dd943709fd3924f22e0b6922b7756f64efbfca58725f0543878ab","observation_id":"e160b3f4-483a-4f70-8c09-475364f81c59","resolution":{"observed_at":"2026-08-06T23:49:22.036639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:21.699921Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":"4d2ed008-6f59-49ad-91bf-cb6b9797d228","year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.178054Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:183a4aef3b8c9c410d649d5031a7eff4a8fc08fb22656e099fb1524899d0bbe6","observation_id":"7e486610-471a-4941-b6e0-fd8eec956859","resolution":{"observed_at":"2026-08-06T23:49:21.808465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:21.433010Z","title":"Merge to learn: Efficiently adding skills to language models with model merging","venue":null,"work_id":"c993256e-2b9e-4f4f-8b47-fc19306bce24","year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.305379Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:3706deb710957b405dfcc6691903771e14b4f35d375f47a84b4edbef8e3a0856","observation_id":"ff108060-af99-4009-a9d4-880f6fa53ce0","resolution":{"observed_at":"2026-08-06T23:49:21.570220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T23:49:15.426561Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.426561Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:6b22d345d291eead4baad2c1c7fd27a5ba4d55bff38bd6972ce67b31da2396a1","observation_id":"faeb8a01-9c95-44ae-9428-54e50b471d98","resolution":{"observed_at":"2026-08-06T23:49:15.426561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:21.219565Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"4ad23fa0-0b17-4326-b4c6-31c402f63080","year":2022},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.590107Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:4b9da53f0b2dfca0bc9f8f9f5d41ef291f57c1759870a5424f8a53d2c8322b0c","observation_id":"76f0fe94-24e7-4577-a589-7cde1d0a3520","resolution":{"observed_at":"2026-08-06T23:49:21.306450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:21.083118Z","title":"In-context unlearning: Language models as few-shot unlearners","venue":null,"work_id":"e9b239a8-9815-4f9f-a762-4b6158f8cf8d","year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.752562Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:e3c1c9260ed0673812b461cfae9952d5e13901142c05391b9b177cc01d769379","observation_id":"28760bb7-0e67-4836-bdd1-37e38d88071c","resolution":{"observed_at":"2026-08-06T23:49:21.149432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-06T23:49:15.862324Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.862324Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:d5662332f82572e443a8b76f25ddff1b59a08d413e1a20135e3ae5464ceff9cf","observation_id":"f0ff625d-af38-4182-b385-564958386640","resolution":{"observed_at":"2026-08-06T23:49:15.862324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.937704Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"8e21afbe-0aa3-45e5-aa4d-9a7fd1a29a48","year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:15.981565Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:773643d3c629e54e5396f09c4b7b9ef7fdc8a8d28074a6c2d90d2da07e8fd351","observation_id":"af8f1517-15e1-4b94-a4e7-822f29993113","resolution":{"observed_at":"2026-08-06T23:49:20.999488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T23:49:16.090709Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.090709Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:b6aa96738c22962bb980fd0e662ab40575917c078aa7fc34842656ce7769716b","observation_id":"abb051b1-11fc-4560-94a1-5d911f89b1f6","resolution":{"observed_at":"2026-08-06T23:49:16.090709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.788811Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"bd286045-a30b-411f-a20c-2858f3bad947","year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.197393Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:f1fa2946868aa0fefc54b92176a0fb47001b237941b9d382de873069d7f2c77e","observation_id":"8e1364f3-4ddd-4670-9358-11f181162778","resolution":{"observed_at":"2026-08-06T23:49:20.871420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:16.288237Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.288237Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:23745171f1ef65b42dbbb58260547716386f63ba4d4686aec97c396756eebe4e","observation_id":"99a40b3f-4945-4de1-ab35-7ff78bbae000","resolution":{"observed_at":"2026-08-06T23:49:16.288237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:49:16.388217Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.388217Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:fae341960592b8d5c6b77fa74572e0e6dd4714fe6f968449690275486d366538","observation_id":"8f44eefa-c8fa-4b91-9c38-ee6bf5e3db3c","resolution":{"observed_at":"2026-08-06T23:49:16.388217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-06T23:49:16.506515Z","title":"Latent adversarial training improves robustness to persistent harmful behaviors in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.506515Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:9635ad4578c51b8eddb7cd4df2e79d1a5a1e166b1dfb34c6c8342954ae81760d","observation_id":"48d5fb51-d013-41a7-8ec0-1afef777e68a","resolution":{"observed_at":"2026-08-06T23:49:16.506515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:16.624391Z","title":"C ommonsense QA : A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.624391Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:c6ff2e9bb73fbfc14fbe3171847196111d51aff34608e7684cc604a767dc9e38","observation_id":"ef3f9bf9-ed9b-4564-8d7e-a651e0a17486","resolution":{"observed_at":"2026-08-06T23:49:16.624391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:16.769634Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.769634Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:a042594afa8e7b14bcdebb31039829dcd6d1f7dd1edffbf93edc271d61a6eb32","observation_id":"96943394-bc7e-41fe-ac19-93d292110571","resolution":{"observed_at":"2026-08-06T23:49:16.769634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:16.926076Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:16.926076Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:11666ec87cc4482c41bc9b2cb21ab8c1e70e63fc74ec79f081007a657304bec7","observation_id":"56a5d664-4a78-4c63-90de-f10015228f14","resolution":{"observed_at":"2026-08-06T23:49:16.926076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T23:49:17.044926Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.044926Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:be980e57432212989c5466497b7c1a5ada23b495c1784cbb894c2a22e96d6210","observation_id":"6398be82-68be-4b45-92bb-41b031c6e0d0","resolution":{"observed_at":"2026-08-06T23:49:17.044926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T23:49:17.179313Z","title":"Steering language models with activation engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.179313Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:0e723f3439baba912f6e9381aa83c1ebcc01edf3723a3f8887802385609b8026","observation_id":"8a0367ca-accc-42e2-92cc-c852408c0b1b","resolution":{"observed_at":"2026-08-06T23:49:17.179313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14433","last_updated":"2024-02-22T10:25:14Z","snapshot_observed_at":"2026-08-10T14:49:11.416894Z","submitted_at":"2024-02-22T10:25:14Z","title":"A Language Model's Guide Through Latent Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14433","snapshot_observed_at":"2026-08-06T23:49:17.308168Z","title":"A language model's guide through latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.308168Z"},"links":{"cited_paper":"/paper/2402.14433","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:fb632d0b8b9e112d0f773234788e854fdef9750a64aeffe6c1626bbdfa7ccd2e","observation_id":"632f255a-7e6b-4bd0-a1cb-80707deb3485","resolution":{"observed_at":"2026-08-06T23:49:17.308168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09433","last_updated":"2024-08-15T19:51:07Z","snapshot_observed_at":"2026-08-11T00:45:48.191177Z","submitted_at":"2023-11-15T23:07:40Z","title":"Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09433","snapshot_observed_at":"2026-08-06T23:49:17.484246Z","title":"Trojan activation attack: Red-teaming large language models using activation steering for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.484246Z"},"links":{"cited_paper":"/paper/2311.09433","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:80c42c827108cc7986dc140bf07bb4caa473f78abe2a9bac1d9f28c94fc29a0f","observation_id":"7b6adedc-a47d-4cdd-96cd-7504bbb58849","resolution":{"observed_at":"2026-08-06T23:49:17.484246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T23:49:17.692465Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.692465Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:f4ecc84de52d7ba51de4a4ceb11f6982df9303540735a8a9980f3c52c14e1f44","observation_id":"5491bab7-e1c9-4d1d-8867-b51f0d8c7339","resolution":{"observed_at":"2026-08-06T23:49:17.692465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.612932Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"39f5b4b7-be6d-4166-839f-f455c739e895","year":2022},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.802675Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:326983e3b96ebf096a0a03f986dd7a7a7cddebbf5e35cb793693ca87ade9cead","observation_id":"33c06365-89a2-47d4-9275-e0a54e7cb143","resolution":{"observed_at":"2026-08-06T23:49:20.692151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.440678Z","title":"Uncovering safety risks of large language models through concept activation vector","venue":null,"work_id":"b2ec1019-774a-4565-95dc-7eb1b150efb2","year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:17.928350Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:2ac2210ce730b09e9deb26d893a930116d189998c90d45ffbce04c5f90697d91","observation_id":"7fb5c9af-9b3f-40a6-835c-646d0740e914","resolution":{"observed_at":"2026-08-06T23:49:20.511936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:49:18.076065Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.076065Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:041e4790e79dceb112bc4cd10bbfc0b417fc280eda9f831c795041b549fc689e","observation_id":"167be9c9-28bd-4a7b-a9d7-4d51f7b4efb7","resolution":{"observed_at":"2026-08-06T23:49:18.076065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T23:49:18.222192Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.222192Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:ef4399a9a7e1143ce96b0c88edfced15d4948b47759ed3b2fbc04063aa3e62e7","observation_id":"49f6e146-811b-4ee3-bf4c-6b1e275cff48","resolution":{"observed_at":"2026-08-06T23:49:18.222192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15806","last_updated":"2025-06-03T14:35:59Z","snapshot_observed_at":"2026-08-07T18:06:28.819161Z","submitted_at":"2025-02-19T07:23:36Z","title":"A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15806","snapshot_observed_at":"2026-08-06T23:49:18.339304Z","title":"A mousetrap: Fooling large reasoning models for jailbreak with chain of iterative chaos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.339304Z"},"links":{"cited_paper":"/paper/2502.15806","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:115e4bf142f9ef426ce53bd3831461c978781c2ffa45f42293a343528894eab8","observation_id":"6800cdc0-9bb0-4750-9704-262036744b00","resolution":{"observed_at":"2026-08-06T23:49:18.339304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T23:49:18.489339Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.489339Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:aafdc34299165dc1274854eaf9f5ae9702ecd96d982d9b1b689de00674bc67c8","observation_id":"d59debf4-233c-4fbc-9f42-52a40287bbc8","resolution":{"observed_at":"2026-08-06T23:49:18.489339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.288019Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"6187e289-8ee9-4dcc-889a-c4be9e386b28","year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.646068Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:9bee51169609d1941063b8194102abab84a61ba7b3875054a715c77db570ee0b","observation_id":"c9fe87b3-afc9-4e0e-af64-f0dea814d388","resolution":{"observed_at":"2026-08-06T23:49:20.370575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:20.170767Z","title":"Controlling large language models through concept activation vectors","venue":null,"work_id":"72e9adbf-ef34-4a00-b9b9-11fdde7a7861","year":2025},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.769725Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:57e65b8775b327b28c321cebeda7d8e11f7202da95e18656597f5f243779d669","observation_id":"4def3251-ed86-4529-ae70-b1c3d50e2402","resolution":{"observed_at":"2026-08-06T23:49:20.227249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-06T23:49:18.890265Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:18.890265Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:3a571b1484dc7955562ba55e396b3f794edc338f8cec6deac91ccb765fcf9a5d","observation_id":"a6beb801-d181-4c28-9f4d-f4a3f64d9911","resolution":{"observed_at":"2026-08-06T23:49:18.890265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T23:49:19.031485Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:19.031485Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:af0f58bfb925afad4cf22d1cb8ded1c6a79d29ad5369d8c671d1d2ce89170591","observation_id":"241aea52-f36e-4245-b5bf-9d3cdec25e84","resolution":{"observed_at":"2026-08-06T23:49:19.031485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:19.162518Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:19.162518Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:2ee508b7fc65f72da4942f135a036b8e25f06f7e77be033ed4819bb9dd74a8e2","observation_id":"fb83993d-61ca-448b-af60-7ad1dffd570c","resolution":{"observed_at":"2026-08-06T23:49:19.162518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:19.235253Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:19.235253Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:b143f9db25949d39350126efbeded0ef17b34e1093b392ff700d5c111595c9bf","observation_id":"082b78b0-2268-469f-b2df-6d916aae5b3b","resolution":{"observed_at":"2026-08-06T23:49:19.235253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:19.294952Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:19.294952Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:47acea01a6bde2ff0d3e653f15913f9b9dba4dc9642b7f1a0d94cdd11778a5b2","observation_id":"aa129338-5c1c-4bc9-8ebd-ef596cbd1265","resolution":{"observed_at":"2026-08-06T23:49:19.294952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:19.347784Z","title":"Despite significant advances in safety alignment, we observe that minor latent shifts can still trigger unsafe responses in aligned models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:19.347784Z"},"links":{"citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:4f03738f09a0056bb8a75eb90881e727194226b6d945fa65e1e833b6318ae5d0","observation_id":"4bfd156c-ad65-42cc-85e1-1b0b4660c411","resolution":{"observed_at":"2026-08-06T23:49:19.347784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2506.16078."}