{"as_of":"2026-08-09T03:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5652765856cf9bdf6167e73b2d5bdadeedb6d34fda81affdd5c0543b0f203d53","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:01:28.960192Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:bddf1f4497811d48ab924523a3c95ccadd40e21387108bcf2f9c06fb006f8564","observation_id":"0de766c3-c60f-451e-94c9-6ae8a1726782","resolution":{"observed_at":"2026-05-13T10:47:56.174132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:aef15052bd736eb7857ed720f85465e23552fa1c248e5e1095e1812758d39bdc","observation_id":"377af2ab-81c0-42a1-a840-06d03b8365ca","resolution":{"observed_at":"2026-05-15T02:20:44.509404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-08T11:01:28.960192Z","title":"Zou, A., Phan, L., Chen, S., Campbell, J., Guo, P., Ren, R., Pan, A., Yin, X., Mazeika, M., Dombrowski, A.-K., Goel, S., Li, N., Byun, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08059","last_updated":"2025-02-12T01:54:21Z","snapshot_observed_at":"2026-08-08T10:56:07.367846Z","submitted_at":"2025-02-12T01:54:21Z","title":"On Mechanistic Circuits for Extractive Question-Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T11:01:28.960192Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2502.08059"},"observation_digest":"sha256:aa667bdf8652f532aee60bdb12b754eb83dcec04d817a9ed1f54bba7d1491149","observation_id":"0e74ee48-9eb7-4872-8849-0398cf4b24bf","resolution":{"observed_at":"2026-08-08T11:01:28.960192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-07T12:35:39.020367Z","title":"Kiho Park, Yo Joong Choe, and Victor Veitch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00085","last_updated":"2025-05-30T04:54:18Z","snapshot_observed_at":"2026-08-07T12:27:05.156381Z","submitted_at":"2025-05-30T04:54:18Z","title":"COSMIC: Generalized Refusal Direction Identification in LLM Activations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:39.020367Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2506.00085"},"observation_digest":"sha256:0fdb262e09ed300c6423e284c601777113f9c6115b2325d3fac45358e407cf20","observation_id":"77e6bcea-72a4-4f40-aedc-3c1047fb9f50","resolution":{"observed_at":"2026-08-07T12:35:39.020367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:ebef335b1561474760a8a495e35ab0a87c18230c33d14965552d63c79f36fe62","observation_id":"da8b92c4-2591-4935-b4ff-28cb1244cdb6","resolution":{"observed_at":"2026-05-19T11:37:16.008776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T19:57:44.717885Z","title":"Prompt-driven llm safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-09T00:28:34.913528Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.717885Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:29be13e7b25d93fe9d9fb3b67698065bd4b0f643552affbeeca7012e18b64e45","observation_id":"36cde0a9-52cb-47df-8885-9a0c480d83cd","resolution":{"observed_at":"2026-08-06T19:57:44.717885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T18:32:44.096157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07974","last_updated":"2025-08-25T16:49:10Z","snapshot_observed_at":"2026-08-09T00:45:54.300327Z","submitted_at":"2025-07-10T17:51:05Z","title":"Defending Against Prompt Injection With a Few DefensiveTokens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.096157Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.07974"},"observation_digest":"sha256:35a4e053966b0e2dad76c33c4c07ac240213515a65a26178ae134ce0298b0a63","observation_id":"c46fd5ac-48fa-416e-9127-e34bc783e919","resolution":{"observed_at":"2026-08-06T18:32:44.096157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T04:47:25.678524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-08T05:44:09.712429Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.678524Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:66777de1857baca1f180527159f422c72dc5c04b7dab8db53f7b1c7b7fc55982","observation_id":"408b7a6e-c13e-4e9d-85a8-fd40974b14f4","resolution":{"observed_at":"2026-08-06T04:47:25.678524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T14:57:12.969212Z","title":"Prompt-driven LLM safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.969212Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:19b4e19ab66487e030409cded6064012f5cf1833bb57ac445c0c7c8ac94405be","observation_id":"c96e3b12-54fb-4287-967a-e210244f832d","resolution":{"observed_at":"2026-08-05T14:57:12.969212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T11:17:49.954144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05969","last_updated":"2026-07-19T06:24:18Z","snapshot_observed_at":"2026-08-07T17:16:23.901959Z","submitted_at":"2025-10-07T14:24:32Z","title":"Probing the Difficulty Perception Mechanism of Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:17:49.954144Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.05969"},"observation_digest":"sha256:28a37ddf6cd068f6604fb13bfb43925d53d0a4a0e781f0b84232632153c8e477","observation_id":"af93b3cf-a963-466e-813d-761b4e2907a2","resolution":{"observed_at":"2026-08-04T11:17:49.954144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T09:40:47.454032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14207","last_updated":"2026-06-29T03:28:16Z","snapshot_observed_at":"2026-08-07T22:39:10.403032Z","submitted_at":"2025-10-16T01:27:44Z","title":"Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:40:47.454032Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.14207"},"observation_digest":"sha256:87f357c18e21b76d1094e38dea4ec2b29d5670b88a086c06e802b2c18cccd372","observation_id":"9629203d-6a04-42d9-ba97-2cbeaf89f271","resolution":{"observed_at":"2026-08-04T09:40:47.454032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-04T09:25:58.615053Z","title":"Prompt- driven LLM safeguarding via directed representation optimization.CoRR, abs/2401.18018, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-06T02:45:04.316908Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:58.615053Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:8e4d2caa8bf9f6cc79d7dbac777206081297d7681c34432690b3a40e49e1a714","observation_id":"b4569ed4-f15f-4ffc-8149-6e402c9d083f","resolution":{"observed_at":"2026-08-04T09:25:58.615053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:f6f1c0949cd0479b11666c30b18589e1495c628fe902c9bb98ec8794a7f9eec1","observation_id":"afa072e4-9ff1-4b24-850d-2432afd9bbf9","resolution":{"observed_at":"2026-05-16T08:17:36.688250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2602.05946","last_updated":"2026-05-11T01:44:43Z","snapshot_observed_at":"2026-08-02T10:13:32.692710Z","submitted_at":"2026-02-05T18:01:52Z","title":"f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T06:48:35.723474Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2602.05946"},"observation_digest":"sha256:4ba3acd0dd25848fed5bd90db6e8c1385d9438db4021234fa1049bb395cc38e0","observation_id":"9d5160d1-3eed-4b90-a28b-f1a98939264c","resolution":{"observed_at":"2026-05-16T06:50:42.968338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-02T14:54:38.934183Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:966000272a981af44a4b7bc47b0caa331067dbb05707664dc722ce0eb76ec824","observation_id":"a8bc067e-a858-481a-a400-4b0f18743e42","resolution":{"observed_at":"2026-05-11T05:35:57.513789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.08513","last_updated":"2026-05-08T21:45:28Z","snapshot_observed_at":"2026-08-03T10:26:10.527615Z","submitted_at":"2026-05-08T21:45:28Z","title":"A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T01:41:44.898358Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.08513"},"observation_digest":"sha256:ccfcf62380c1553767f02485f61152677b834887df58cf1bc3d06f15f6d025de","observation_id":"c8a09e59-74ee-4937-83ad-b7ada4e165b4","resolution":{"observed_at":"2026-05-12T01:46:14.370017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.17284","last_updated":"2026-05-17T06:45:53Z","snapshot_observed_at":"2026-08-02T07:22:05.535449Z","submitted_at":"2026-05-17T06:45:53Z","title":"CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T14:58:03.757712Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.17284"},"observation_digest":"sha256:b1519adff5b32bc67140e3908e810b10f6fbc060e8608e8ee45a038686a47492","observation_id":"155d4921-eef9-4a92-9c50-46cb5fab9cf2","resolution":{"observed_at":"2026-05-20T14:58:24.670438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2605.18104","last_updated":"2026-05-18T09:16:55Z","snapshot_observed_at":"2026-08-02T08:21:56.104408Z","submitted_at":"2026-05-18T09:16:55Z","title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-20T10:57:40.997128Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2605.18104"},"observation_digest":"sha256:308e7f633d6cc8a0be973afcbde3074c27c3e4c784ba188639cebfe6927eabd2","observation_id":"a30150e8-b607-4b84-bdb7-75acaad5a53b","resolution":{"observed_at":"2026-05-20T10:58:13.540944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":"2401.18018","doi":"10.48550/arxiv.2401.18018","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, F","venue":"arXiv (Cornell University)","work_id":"8fd0f811-ec0b-498a-817a-1bbbdc6fee68","year":2024},"citing_paper":{"arxiv_id":"2606.15980","last_updated":"2026-06-18T23:56:29Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T19:07:22Z","title":"Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T03:24:24.714121Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2606.15980"},"observation_digest":"sha256:7dc9193ac5d0bc3c8f54cac1ffff1932dc74438fdfe8ed5d7417c248d8f76365","observation_id":"16e62ae5-3a5f-4a29-94b2-79b8b61791a7","resolution":{"observed_at":"2026-06-27T03:30:26.970938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-01T13:10:37.718031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.718031Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:b32217ee4025cb4e8753343775c5ab7bce94f1162796c2b640b912e8284bfc8e","observation_id":"e2fbc2da-a71e-4a66-933c-d61fc06f346f","resolution":{"observed_at":"2026-08-01T13:10:37.718031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-03T16:32:06.278220Z","title":"Prompt-driven llm safeguarding via directed representation optimization.arXiv preprint arXiv:2401.18018, 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.278220Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:a37c04f2226e995f6ad793a2478b28a9e7419b0b06e582085a9501ae30e82934","observation_id":"7b1d80d9-b084-414a-9a8f-51ecc7ee23d1","resolution":{"observed_at":"2026-08-03T16:32:06.278220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.18018/citation-record","integrity":"/paper/2401.18018/integrity","json":"/paper/2401.18018/citation-record.json","paper":"/paper/2401.18018"},"outbound":[],"paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2401.18018."}