{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28078e19e00cbf76cbb30c9592dcc61cfc3232ed0c7bedbe891b59f3cc8e1a59","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:35:48.626472Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14202/citation-record","integrity":"/paper/2507.14202/integrity","json":"/paper/2507.14202/citation-record.json","paper":"/paper/2507.14202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.238850Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.238850Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:0c797d1dc6390dc1329de0a10c6530be360821c84509c0a69a4365a3fb517b5f","observation_id":"5b6a9238-00de-4972-a6c5-c256e98d095c","resolution":{"observed_at":"2026-08-06T17:35:47.238850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.390160Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.390160Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:e7ece569c1c7ceb889a417fc99fb617a6559a8eacd4b79a279fec312e44cd60e","observation_id":"25cf31f4-6c6d-409f-b5cb-f7b395d031a2","resolution":{"observed_at":"2026-08-06T17:35:47.390160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.424574Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.424574Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:445b7f9d1e63a4e9591f487d0d573157f2a62b4d597bf115a42366bbc923e317","observation_id":"5a2af6a0-2e86-4504-8cbc-6ffeed6a1cde","resolution":{"observed_at":"2026-08-06T17:35:47.424574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07998","last_updated":"2018-09-24T20:29:35Z","snapshot_observed_at":"2026-07-06T06:34:41.441373Z","submitted_at":"2018-04-21T17:02:20Z","title":"Generating Natural Language Adversarial Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07998","snapshot_observed_at":"2026-08-06T17:35:47.437181Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.437181Z"},"links":{"cited_paper":"/paper/1804.07998","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:90239044ea1e84f626f60f6bc8592bfeed5a753544bf602bac331fa0931270d7","observation_id":"bb252c79-5804-47f0-aa0b-2b0227ac2c84","resolution":{"observed_at":"2026-08-06T17:35:47.437181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-06T17:35:47.468119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.468119Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:60712a8bbaad0dfe1ae484b2886c0e9c1e335131abff05f26b70b41760724f7a","observation_id":"ffcb86b7-123f-42ce-8130-0269d61955ec","resolution":{"observed_at":"2026-08-06T17:35:47.468119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05224","last_updated":"2022-04-08T14:53:06Z","snapshot_observed_at":"2026-08-10T06:19:36.748443Z","submitted_at":"2021-12-09T21:48:29Z","title":"Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures","version":2},"cited_work":{"arxiv_id":"2112.05224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05224","snapshot_observed_at":"2026-08-06T17:35:50.528049Z","title":"Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures","venue":"cs.CR","work_id":"50406d64-0435-486d-9ba7-3e3cd2554d81","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.522560Z"},"links":{"cited_paper":"/paper/2112.05224","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b89a1dc7838b767593988cc51d36ba786da983b75c1dcae3590459731cbafe87","observation_id":"adcb3d4e-4952-4233-a7a6-2fef21cd219c","resolution":{"observed_at":"2026-08-06T17:35:50.534543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T17:35:47.608128Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.608128Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:443b0a081dddf5848e512bb773a6252b926ec41880231b9b6621ba7107b7a8dd","observation_id":"1f8b8625-ea52-45ea-9324-d027089e80ba","resolution":{"observed_at":"2026-08-06T17:35:47.608128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T17:35:47.723342Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.723342Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f643e9e549f9929f1dfa13c131376d49500d522f4f419c5a3012bb2feab3ad2a","observation_id":"b29ff979-9448-4e35-8bf3-47d149d4744a","resolution":{"observed_at":"2026-08-06T17:35:47.723342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00236","last_updated":"2024-09-17T19:56:09Z","snapshot_observed_at":"2026-08-06T06:17:45.496933Z","submitted_at":"2023-09-01T03:53:40Z","title":"Image Hijacks: Adversarial Images can Control Generative Models at Runtime","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00236","snapshot_observed_at":"2026-08-06T17:35:47.822419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.822419Z"},"links":{"cited_paper":"/paper/2309.00236","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d1eebf3e624dd64777d9bbc88c8bd9314481701c22d9cd5b8ed48655e5a2ff30","observation_id":"517e308b-7e38-4685-85ce-e9f649f6d4c3","resolution":{"observed_at":"2026-08-06T17:35:47.822419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.897090Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.897090Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ff97825dc77a1e679ac42c997bf142b809e34251ec40982ceca8ea0e423c98a6","observation_id":"d51cbcab-b7d2-41ed-9e8c-b1dc9bbbc282","resolution":{"observed_at":"2026-08-06T17:35:47.897090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.960711Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.960711Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f488dae6273a25733413ebd5a32eb39dc4e650db6063b73e72740589d7bc40bc","observation_id":"8202b0ae-a407-4800-8fcc-ad004b22a9d0","resolution":{"observed_at":"2026-08-06T17:35:47.960711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.970414Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.970414Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:170186efe361b686758b99fee3be71249b8aa07fe3ce0af358772b8d168b6451","observation_id":"21677c54-689c-4f87-803a-53f3d739d648","resolution":{"observed_at":"2026-08-06T17:35:47.970414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T17:35:47.975977Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.975977Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8be8af650796d473215adbab5a11a02c0f53318ef73c4d6b6004765536b2c1a0","observation_id":"ce3d1067-2d5b-4af6-bd46-b95bde12f133","resolution":{"observed_at":"2026-08-06T17:35:47.975977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02128","last_updated":"2022-09-05T20:29:17Z","snapshot_observed_at":"2026-08-09T15:15:59.049198Z","submitted_at":"2022-09-05T20:29:17Z","title":"Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02128","snapshot_observed_at":"2026-08-06T17:35:47.982288Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.982288Z"},"links":{"cited_paper":"/paper/2209.02128","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7db56033c6a51b3b39249bff8c10279cbbdb0c8bd3147282207d28e9ea46b39e","observation_id":"bafa7bb3-a8c0-48c3-884f-7ca91f77b74e","resolution":{"observed_at":"2026-08-06T17:35:47.982288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.989197Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.989197Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:19bbbd60254cde3255ded08e88e39ba6bcac48c7363e35dfa9e16895414f4395","observation_id":"b26876fb-8ead-4a31-9765-0039acb31008","resolution":{"observed_at":"2026-08-06T17:35:47.989197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.996109Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.996109Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8a3c7c9727d33c8a37ec0bafdc9e7ae6891246b224370f12c566b3297336b9fa","observation_id":"4bb4e62a-f278-4460-86c3-e2119a30d3e8","resolution":{"observed_at":"2026-08-06T17:35:47.996109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-06T17:35:48.002781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.002781Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d95386986a1c480f96c92bed50599319149f95d571b71617b94365b1bb898687","observation_id":"8a5a0256-0ed2-4a11-a324-0a6ae5dfe732","resolution":{"observed_at":"2026-08-06T17:35:48.002781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T17:35:48.010807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.010807Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:82cee3171dd72d50fddadbee031902a012f65a251c45499c92c8355ab1f7d255","observation_id":"ee47c9ff-dcb0-43a9-a097-9fad4e0e75d8","resolution":{"observed_at":"2026-08-06T17:35:48.010807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T17:35:48.018055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.018055Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b1fb7b77f5f2d17383c411c6b578da7639c2120b2fc754b052912ec544b596a1","observation_id":"4fd144ea-56ba-462c-b157-c2c2fccc610b","resolution":{"observed_at":"2026-08-06T17:35:48.018055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.025371Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.025371Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:0c4105b1f1ce682f42dd92a8271e6c4551e4aa10d35ea40860c15cab8f02a927","observation_id":"2f3b1b5c-6c78-4d68-a448-028cd001b60f","resolution":{"observed_at":"2026-08-06T17:35:48.025371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T17:35:48.035926Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.035926Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:dbf620ab54799d8541c9674267fd6fe6669313ac1e5f75a199a93636a811e072","observation_id":"670b6015-0d51-4533-b7e0-7978b003fe56","resolution":{"observed_at":"2026-08-06T17:35:48.035926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T17:35:48.042843Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.042843Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:27d5f90d4666002a74fd22574da1e30a72616c07e411ce84c2370ddbeab2e4da","observation_id":"3aa09c3e-12c8-4063-9d99-bb9690b6accf","resolution":{"observed_at":"2026-08-06T17:35:48.042843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.053465Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.053465Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:e7a422496846c926cb6e70ee28bb70500ea0077168e71c4e9552824dd8fe8397","observation_id":"3d70f730-9dc9-4af2-bf75-7a0924bd6251","resolution":{"observed_at":"2026-08-06T17:35:48.053465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-06T17:35:48.063524Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.063524Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1f0c3c26100e4635f359bf67548556d339a638312c1e32629a470ff1f0696d06","observation_id":"a11d8663-aa43-4de8-bd1e-a858946f0824","resolution":{"observed_at":"2026-08-06T17:35:48.063524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.070951Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.070951Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:51e756a7a81d14ea4adfc9989b49669cdff5b0c15ad047163442feb9b03a2219","observation_id":"9f0d440a-ef33-4ceb-9f85-df8526eb4c94","resolution":{"observed_at":"2026-08-06T17:35:48.070951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T17:35:48.078087Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.078087Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fe9a8514830e841e9748ccd9a8efe986095383ff4464bd6ebb87696d598923f8","observation_id":"c904d3f8-3630-4b9d-8b71-f52597e821f0","resolution":{"observed_at":"2026-08-06T17:35:48.078087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-08-08T01:21:39.731592Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-06T17:35:48.084454Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.084454Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:0466689d24a846978d74b8bb93f4df60b3b9afea035e2e72e716d7ba038df36d","observation_id":"d6639d9f-321d-44b7-ab7f-ad5bad9c5d6b","resolution":{"observed_at":"2026-08-06T17:35:48.084454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.092363Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.092363Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:3f70f5ed2e35c24c03868f080ddca2320ddf517445c75a8ceeb27c9607a0b153","observation_id":"68c61a06-cfae-48e7-abb9-2bb1571c8feb","resolution":{"observed_at":"2026-08-06T17:35:48.092363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07754","last_updated":"2019-11-18T16:35:13Z","snapshot_observed_at":"2026-07-06T08:37:54.279213Z","submitted_at":"2019-11-18T16:35:13Z","title":"Understanding parameter differences between analyses employing nested data subsets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07754","snapshot_observed_at":"2026-08-06T17:35:48.100821Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.100821Z"},"links":{"cited_paper":"/paper/1911.07754","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:5c1416580faf5402f9eb9e3b4706e4d9e7487b8a5f4e904e7f69b399c7109e46","observation_id":"9acddfb3-9cda-4059-94d5-cd8bd0434b18","resolution":{"observed_at":"2026-08-06T17:35:48.100821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.109664Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.109664Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9ed46ffdda097d01a900f9073d7e2ff2fbb5e8a74bea77dc5426244562836450","observation_id":"7f34939f-ae70-482c-8392-47ddccbdb6f8","resolution":{"observed_at":"2026-08-06T17:35:48.109664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06751","last_updated":"2018-05-24T16:43:45Z","snapshot_observed_at":"2026-08-09T04:03:23.171418Z","submitted_at":"2017-12-19T02:15:19Z","title":"HotFlip: White-Box Adversarial Examples for Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06751","snapshot_observed_at":"2026-08-06T17:35:48.119501Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.119501Z"},"links":{"cited_paper":"/paper/1712.06751","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8b245a2227a273aa2a8770b94b1fd4a1aa095550ae89dbb4005d23fa64bdecb1","observation_id":"26c25ec9-a7aa-48cb-96d2-11d2f2c0cce6","resolution":{"observed_at":"2026-08-06T17:35:48.119501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.128310Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.128310Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ea355f20dc87d7c1d9e2f871cac0e8327cc7083c0657f651a938c60c61d09f84","observation_id":"3f696111-d4ca-4c96-85f0-7d428d2af8ab","resolution":{"observed_at":"2026-08-06T17:35:48.128310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-06T17:35:48.134541Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.134541Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:667e2409d24cd1bf8e82ffff9b3960f7fbbd7a163d06672c51cb08dae9bfa5fc","observation_id":"c42d8818-3e1d-410f-87ba-4fa7f898a85c","resolution":{"observed_at":"2026-08-06T17:35:48.134541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-06T17:35:48.142756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.142756Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ed45bd851acdb6b01c70452868492593a0e5eb334324eb78cbc001e57610a6ec","observation_id":"2ce2fcbd-d0d9-4e9e-9491-0c12d0b58c02","resolution":{"observed_at":"2026-08-06T17:35:48.142756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-06T17:35:48.151517Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.151517Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8b64e6fbea72a5a52bcf1a06a4ca3a8a18258e11ed1a7ecccc616dd180687d4b","observation_id":"a90ddecf-99c1-405b-be46-b442ad14d8ed","resolution":{"observed_at":"2026-08-06T17:35:48.151517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T17:35:48.158428Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.158428Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6e4ff734a8b27781eef8c76d63d89de7f724268cf55fa28ba8d9004345cc25de","observation_id":"ebcc7130-ae12-485b-8d12-beb2658a661d","resolution":{"observed_at":"2026-08-06T17:35:48.158428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12173","last_updated":"2023-05-05T14:26:17Z","snapshot_observed_at":"2026-07-06T14:55:08.682906Z","submitted_at":"2023-02-23T17:14:38Z","title":"Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12173","snapshot_observed_at":"2026-08-06T17:35:48.166666Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.166666Z"},"links":{"cited_paper":"/paper/2302.12173","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6f3c8c4c07e9b0d2525507fe3b7b5beb5b24486ec346bc283137add8d60669e8","observation_id":"b94e92c5-e06a-46e3-8ddb-3c4b945c6be3","resolution":{"observed_at":"2026-08-06T17:35:48.166666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.974143Z","title":null,"venue":null,"work_id":"23a57c1f-16eb-40e9-b7b0-c4e5874271b5","year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.174906Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:23918d0dbed34b53ac5ce5ce0dd82c137c0d8e190c84611624dae106a388b136","observation_id":"590e6d0d-c3b9-4aa1-91cb-f62b13467cb5","resolution":{"observed_at":"2026-08-06T17:35:50.981468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T17:35:48.184013Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.184013Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b90294c365ef05e0c11cad60dc355364966f31764c81cf0f1245cbc4b922f1e1","observation_id":"0358867b-52e6-45ba-b59c-97ede6e52fe3","resolution":{"observed_at":"2026-08-06T17:35:48.184013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T17:35:48.190750Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.190750Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:13158513786e160a7db28f8331e03ac95eb5905f06e933d59a11d64c6f6e901e","observation_id":"28085756-3d06-4400-9799-143a92401037","resolution":{"observed_at":"2026-08-06T17:35:48.190750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-06T17:35:48.198213Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.198213Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:683fb7650dce58f53b489788faaf4384d334011b2c2796ee43943bc47bcb4cee","observation_id":"6df30fc5-7a42-4e0a-883e-420551bc9683","resolution":{"observed_at":"2026-08-06T17:35:48.198213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.946613Z","title":null,"venue":null,"work_id":"d12c1d83-5cc5-44bb-add1-dc42eb103bc1","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.205695Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:e7c19cb3d73f91d71994f616dd72fb442e8f3633dd8077a0fc53e86b71d2408b","observation_id":"c3918a90-c15b-44a3-8567-3f9d1bed0a53","resolution":{"observed_at":"2026-08-06T17:35:50.954180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.918313Z","title":null,"venue":null,"work_id":"b34ce33b-1348-485b-82f7-976bafad14fb","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.215145Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:15b86d1942ecfc32fe4cd1194cbd4571b86bc8df2bc865de7bd6357b57564573","observation_id":"8e4b1b4f-1cda-4008-9ac4-a6828bb2fbb5","resolution":{"observed_at":"2026-08-06T17:35:50.925417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.889547Z","title":null,"venue":null,"work_id":"9d75dea4-ae34-4f8c-b0a4-eebd07b2c685","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.223231Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:56639bb1b054383339e65ce9c51ed03e53147c361253ac96c1a0cc3c4472edca","observation_id":"8483a57a-aedc-4071-8651-da0a3aacd10c","resolution":{"observed_at":"2026-08-06T17:35:50.898671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04381","last_updated":"2023-03-08T05:09:59Z","snapshot_observed_at":"2026-07-06T15:00:01.455874Z","submitted_at":"2023-03-08T05:09:59Z","title":"Automatically Auditing Large Language Models via Discrete Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04381","snapshot_observed_at":"2026-08-06T17:35:48.231633Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.231633Z"},"links":{"cited_paper":"/paper/2303.04381","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:259336037d233ee4a580f9331194235925151bf4c7a26f4b67038302fbc23616","observation_id":"72828130-3626-46ec-aaa7-9b4442706d5a","resolution":{"observed_at":"2026-08-06T17:35:48.231633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02520","last_updated":"2023-11-13T15:54:07Z","snapshot_observed_at":"2026-08-10T07:38:08.574737Z","submitted_at":"2023-11-04T22:35:39Z","title":"Single-Source Shortest Paths with Negative Real Weights in $\\tilde{O}(mn^{8/9})$ Time","version":2},"cited_work":{"arxiv_id":"2311.02520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02520","snapshot_observed_at":"2026-08-06T17:35:49.751092Z","title":"Single-Source Shortest Paths with Negative Real Weights in $\\tilde{O}(mn^{8/9})$ Time","venue":"cs.DS","work_id":"fa6c0261-593e-4844-aae6-dc6e46d144c8","year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.242664Z"},"links":{"cited_paper":"/paper/2311.02520","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7e84bb42fffcaf7721941a4c50bbcc277b06b7a480cedaac1215e359beb56338","observation_id":"c5bdc0bf-891b-4c3d-9cf6-b5b29d6825b6","resolution":{"observed_at":"2026-08-06T17:35:49.762344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-04T21:02:05.722226Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-06T17:35:48.251121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.251121Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:05457a8f3047abe7b31b4d98c9173629f57272628b3847a82fd9db5a27ec763a","observation_id":"8e39d5a0-df53-4a41-813c-fd6d04b2881a","resolution":{"observed_at":"2026-08-06T17:35:48.251121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T11:58:26.201962Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T17:35:48.260173Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.260173Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:13e013704202b98c1890036710fb3299750892f69d1f4657e457f7cb3f2745f0","observation_id":"6893840f-8913-456c-8bfe-03992331d013","resolution":{"observed_at":"2026-08-06T17:35:48.260173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-08-09T12:20:45.396771Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-06T17:35:48.267389Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.267389Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:3d3607857a9bf653767945cfa7131370544b19a56bafc6f8f94c68e2ff586885","observation_id":"c2709b8d-4f65-4d21-ab92-6b9473858fa6","resolution":{"observed_at":"2026-08-06T17:35:48.267389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T17:35:48.273778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.273778Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a569dc265946b49a444693267e9fd74084403bf4e68961e3e80f388777a597bc","observation_id":"dd64e832-2a45-4da9-bb99-41539ed0ca24","resolution":{"observed_at":"2026-08-06T17:35:48.273778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13860","last_updated":"2024-03-10T13:58:08Z","snapshot_observed_at":"2026-07-06T15:31:18.144952Z","submitted_at":"2023-05-23T09:33:38Z","title":"Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13860","snapshot_observed_at":"2026-08-06T17:35:48.280960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.280960Z"},"links":{"cited_paper":"/paper/2305.13860","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a7f4d0a4d01bf9ff24797fc821335b742f01cddb256138c6662aa66ccd84d120","observation_id":"b907c4eb-d916-4cbd-8fa8-60a699c361d2","resolution":{"observed_at":"2026-08-06T17:35:48.280960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.289162Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.289162Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8e5c39a6e655a60d75d68d7a1ccffb5f2fbc3bbaf994310550ac2161c6da1dd1","observation_id":"67ea4d27-d6a9-4d67-a875-6c9bd7c3dada","resolution":{"observed_at":"2026-08-06T17:35:48.289162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T17:35:48.302663Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.302663Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fdaac420b857e9677971d12a5ae6137c69cbe33dbc49a536ef10b83b4d31064e","observation_id":"c8382987-8b29-4efe-b8c6-1a8ea5283f86","resolution":{"observed_at":"2026-08-06T17:35:48.302663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.863305Z","title":null,"venue":null,"work_id":"aa75fa5c-7360-4e1e-a2c2-61fc3af47ccd","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.312375Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:bd40cf57c3b0356c35ee9379e6c5fe90f0efd318abeead6091a16e18dec7355e","observation_id":"455d04b7-778b-4caa-897a-b06d86de4b1b","resolution":{"observed_at":"2026-08-06T17:35:50.871578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-06T17:35:48.318958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.318958Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9b8e2b42cb735430d651577550552a71bc24d38a11655a71ca5a171df4fdfff9","observation_id":"53fcdf3a-c28f-4d2c-89ca-8008a48a9534","resolution":{"observed_at":"2026-08-06T17:35:48.318958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11147","last_updated":"2022-03-21T17:26:29Z","snapshot_observed_at":"2026-08-01T19:23:25.711617Z","submitted_at":"2022-03-21T17:26:29Z","title":"Teaching language models to support answers with verified quotes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11147","snapshot_observed_at":"2026-08-06T17:35:48.325823Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.325823Z"},"links":{"cited_paper":"/paper/2203.11147","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2c087fc35ab35e3d772ee591e705dbabe27ff4c0e2b47835157967c0f4a8a5e7","observation_id":"77b7dbcc-5efa-42cb-92e5-75aeb0e2ccae","resolution":{"observed_at":"2026-08-06T17:35:48.325823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.829249Z","title":null,"venue":null,"work_id":"01e5038e-ff35-40f0-b813-2b5ef10a90db","year":1995},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.334358Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c739de7cbca677737b8eb4be5e8ba151a70da0c4df4650cbc39aa679b9acf28b","observation_id":"55775cee-9169-4500-90d2-4eb9a2b99214","resolution":{"observed_at":"2026-08-06T17:35:50.842475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.806798Z","title":null,"venue":null,"work_id":"d458dddc-dde0-49e2-91a3-8ed275a43812","year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.340570Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:5278843c4213f79774e6f5a5d6bbbb1bcd1e6dc7038576b12dc18b83f284630e","observation_id":"f5cccaa2-679e-4f61-81c4-4e13dd8d6e5f","resolution":{"observed_at":"2026-08-06T17:35:50.813928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-05T07:11:54.244493Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-06T17:35:48.347629Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.347629Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:376ee3d18b88a2bbc1929742937d3132bd9ab14f54d6ba7c76e4459e8ca33141","observation_id":"103ae790-ec3e-4edf-bf4e-122cf26e8719","resolution":{"observed_at":"2026-08-06T17:35:48.347629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T17:35:48.355471Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.355471Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:be74813984239af6639918e17b336e907212f3ea1aaaf508cd6583b1836dfead","observation_id":"482fea23-f239-4910-9841-c2975ba97d87","resolution":{"observed_at":"2026-08-06T17:35:48.355471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17035","last_updated":"2023-11-28T18:47:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T18:47:03Z","title":"Scalable Extraction of Training Data from (Production) Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17035","snapshot_observed_at":"2026-08-06T17:35:48.362446Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.362446Z"},"links":{"cited_paper":"/paper/2311.17035","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d490cfbf882a63ce1cafabc4c5528c170151cc0c398abdd96cc519d8f6a9b08c","observation_id":"a701af0a-b1cc-4a10-8629-972734d4f80b","resolution":{"observed_at":"2026-08-06T17:35:48.362446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.370906Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.370906Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:3aa7b175c61910492303413d6111469c09ff44e6f8c7861070fcce946d29b5bb","observation_id":"569713c6-6f4f-406f-9e2d-46aca8eaa3e5","resolution":{"observed_at":"2026-08-06T17:35:48.370906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-06T17:35:48.379195Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.379195Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ba007520f11e508c35bb38e3f2d5a36f1673bb571f1ee52bf5b8f60da36e3b97","observation_id":"206bfffb-3393-4296-b8ed-1a4e1c1631e4","resolution":{"observed_at":"2026-08-06T17:35:48.379195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-06T17:35:48.387140Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.387140Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:395cb3fcb34e63a2de078ad2bda4fa4c97deec300ece5c85e6d7c2e7fdbb1f60","observation_id":"1811695b-06f0-464a-b606-483a2f9e0eb1","resolution":{"observed_at":"2026-08-06T17:35:48.387140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-06T17:35:48.395357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.395357Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:5d908ec711197d56c052a28bb5805e331a3e9fe5257dc2a785831b8c4168ec78","observation_id":"3b8e7847-6a86-4fb4-8f3c-f5a359046bd3","resolution":{"observed_at":"2026-08-06T17:35:48.395357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.767969Z","title":null,"venue":null,"work_id":"cc26dfac-539a-496f-9c75-14faf4a902a2","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.406503Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:77526cdcee83439f46bb1d16f20d00089fb797562e2d50de11fdc8069c610997","observation_id":"83499b1b-c548-4c87-9a07-9c519391f9b0","resolution":{"observed_at":"2026-08-06T17:35:50.775043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06032","last_updated":"2019-08-26T22:36:02Z","snapshot_observed_at":"2026-07-06T08:00:16.619191Z","submitted_at":"2019-06-14T05:46:10Z","title":"Adversarial Training Can Hurt Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.06032","snapshot_observed_at":"2026-08-06T17:35:48.413261Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.413261Z"},"links":{"cited_paper":"/paper/1906.06032","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9d4d8686d37173a51fdd0a7b2a27f5c59deb812e1bda47265aeeab71399820ca","observation_id":"3fb3cb18-7a56-41ee-aad5-997006c0baf9","resolution":{"observed_at":"2026-08-06T17:35:48.413261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.746586Z","title":null,"venue":null,"work_id":"802b8928-0039-484c-bfb8-6d540fb12678","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.420411Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a66884f7ee2be363030d0cf96e091ac6dc1bdd7a8df940716933942e132836ff","observation_id":"453ce8c0-9e8e-4e86-8651-b26a2615ab74","resolution":{"observed_at":"2026-08-06T17:35:50.752692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T17:35:48.427520Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.427520Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:07c7ebd08633767c9daf579e8fc4673bc00d2088dd03c5dc9dc65f2f09013d0a","observation_id":"f1664621-df1b-4744-89eb-98e8f0ef31ba","resolution":{"observed_at":"2026-08-06T17:35:48.427520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T17:35:48.436360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.436360Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:cc42e84010ceb7be2cde85d154245b7158a363d8b961168ec5afdb46ba7cf71e","observation_id":"b853babb-024f-485f-bda8-0d6e9d553ba5","resolution":{"observed_at":"2026-08-06T17:35:48.436360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T17:35:48.445431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.445431Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:470c6d4e43e1fbbcece7f126808cb1ff0d0ac7ebcf3592b88fd1068aabd8c4a3","observation_id":"09e47225-07a6-48db-9c59-e42421f41fe9","resolution":{"observed_at":"2026-08-06T17:35:48.445431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.454219Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.454219Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d8dec4bf866a5988fc605714cae937c34e659ad8a0e48a4c152cd97dfea3af4e","observation_id":"0580d262-b859-4833-9516-6a4889a99700","resolution":{"observed_at":"2026-08-06T17:35:48.454219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.701780Z","title":null,"venue":null,"work_id":"0abe0cac-5913-4dc1-926d-94cd10a8215b","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.461142Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7d7363177c67ab205910275ed2d46348013a42792bb5170519ed317cf332e12b","observation_id":"4360779b-94b6-4e1e-9494-feb52167a0a3","resolution":{"observed_at":"2026-08-06T17:35:50.710417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07204","last_updated":"2020-04-26T22:20:25Z","snapshot_observed_at":"2026-07-06T05:43:27.961693Z","submitted_at":"2017-05-19T21:56:43Z","title":"Ensemble Adversarial Training: Attacks and Defenses","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07204","snapshot_observed_at":"2026-08-06T17:35:48.467325Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.467325Z"},"links":{"cited_paper":"/paper/1705.07204","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:27043a67b67451e2f7b9c2042e52f7e17ee48f0fb997e5e6baffc5baf5b69626","observation_id":"5123c869-efcf-4be5-b141-c88b49df9fec","resolution":{"observed_at":"2026-08-06T17:35:48.467325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-08-08T14:51:08.356714Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-06T17:35:48.474839Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.474839Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:12ec57bf3da11fa00c1a42fd8e8570024c9058dcb32832eba0a4a256ffed07e2","observation_id":"f7629bdb-6602-453e-9138-b15b6227f1d3","resolution":{"observed_at":"2026-08-06T17:35:48.474839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T17:35:48.481517Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.481517Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:647e18b7065da670c38c3bb0d956f93d81cc9c10fe00de074241d07125063e7b","observation_id":"aefb1499-3f67-469c-b28d-49a7afe5f42f","resolution":{"observed_at":"2026-08-06T17:35:48.481517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-06T17:35:48.488605Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.488605Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:18beb93d6491b34d22f8425c56fa74a276e6232a30f062d159e8474ace0abd37","observation_id":"923ae7d5-0634-43e6-9a9a-5af5f2a7d9bd","resolution":{"observed_at":"2026-08-06T17:35:48.488605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T17:35:48.496124Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.496124Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c476435f98c2acd9ffaa5dd9e71472e8f24f87bb0d9bf58db7b1aa0643df511a","observation_id":"1581c38e-115f-4014-b61b-b00e5933eef6","resolution":{"observed_at":"2026-08-06T17:35:48.496124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.681724Z","title":null,"venue":null,"work_id":"db61514e-8495-4dde-8d9d-850792e505cb","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.505595Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fe5f8c2448a2cb9f2088f40eadc8b09b326b85bc7c14a73d1103abed7f67efac","observation_id":"c204d952-f567-4cbe-8f4a-21ee9e541aa8","resolution":{"observed_at":"2026-08-06T17:35:50.688433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06723","last_updated":"2021-06-15T02:08:45Z","snapshot_observed_at":"2026-08-04T15:35:33.437256Z","submitted_at":"2019-09-15T03:35:18Z","title":"Natural Language Adversarial Defense through Synonym Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06723","snapshot_observed_at":"2026-08-06T17:35:48.513887Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.513887Z"},"links":{"cited_paper":"/paper/1909.06723","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8759477d7667328916493602f65ce039a5357181358ae7b6ce795e8748e3bb3f","observation_id":"6314ad03-312d-443c-ada9-6fc5fa4f6b2f","resolution":{"observed_at":"2026-08-06T17:35:48.513887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T17:35:48.522431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.522431Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:5272ad6d26986347b669667540ab58ae60f4a0314d21a28deeaa2e8cb9191cc8","observation_id":"0db3733e-7e4a-4a0e-ad85-2382dfd528e3","resolution":{"observed_at":"2026-08-06T17:35:48.522431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.660009Z","title":null,"venue":null,"work_id":"d4f9ff15-8ace-4cc5-b4e0-facfe96fd930","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.537349Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4eca00b5e6ed2c9744d570457b15255d93e05af22eb2462abd2a37d1bf4ac15f","observation_id":"51d9b036-4365-4a9c-b6c8-01475b3ad402","resolution":{"observed_at":"2026-08-06T17:35:50.666517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-08T18:11:45.725753Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-06T17:35:48.545520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.545520Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d58110571606a02788b1bff5044529fe1c45dbd787ed9836bafb16a1954eb141","observation_id":"85d265f5-a6dd-4f4c-bada-8c01f9655ca4","resolution":{"observed_at":"2026-08-06T17:35:48.545520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-06T17:35:48.553979Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.553979Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:518d1c48fa631d6175119084c6ccbe7ef9c72eba515e69df38b7d170dd3ed844","observation_id":"822f62ee-5f4a-449b-8f91-4f6dc81ff76e","resolution":{"observed_at":"2026-08-06T17:35:48.553979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12517","last_updated":"2022-10-22T18:17:31Z","snapshot_observed_at":"2026-07-06T14:09:05.304905Z","submitted_at":"2022-10-22T18:17:31Z","title":"Exploring The Landscape of Distributional Robustness for Question Answering Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12517","snapshot_observed_at":"2026-08-06T17:35:48.560955Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.560955Z"},"links":{"cited_paper":"/paper/2210.12517","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a172b9eb011e3c78885b8761c1a67be1720656b4b052bde2f2377e22baa1a83e","observation_id":"c54eaadb-dc35-4b7f-a38a-b6c517553455","resolution":{"observed_at":"2026-08-06T17:35:48.560955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.636138Z","title":null,"venue":null,"work_id":"e4be9a6c-9e45-400f-962e-d9d8b9e0b91b","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.569962Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:cdd196fbc402125c6ee549143bddf5dc4808694be568fb4d9b8e4862cc6322a2","observation_id":"a8d55785-7081-4caa-a72b-e802dcad7c97","resolution":{"observed_at":"2026-08-06T17:35:50.642464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-06T17:35:48.576790Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.576790Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a3ebed62a816f29d5e0cca6e18261001262159692729057cc9ddb98b5575fae7","observation_id":"72c27dd0-14f0-497b-baa6-8cddeb7a5a7a","resolution":{"observed_at":"2026-08-06T17:35:48.576790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-06T17:35:48.582594Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.582594Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:66ab31c69e43b3bc9cb2f2d8562ee99a3d593f0a4686a677e927977e7e3ff262","observation_id":"015af25f-f1e0-4a56-bfe7-fea6ed1beb49","resolution":{"observed_at":"2026-08-06T17:35:48.582594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-06T17:35:48.591046Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.591046Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4f4db2dc4f9a34dae7d066304fb0bb923bb5626a23c07f68c8fa7023dc004580","observation_id":"84165dfd-1663-421f-965b-d33159b6d948","resolution":{"observed_at":"2026-08-06T17:35:48.591046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.607659Z","title":null,"venue":null,"work_id":"634b23a0-d640-449f-8f71-cfc80f57312e","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.596978Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:028069b36eac134c4dc0b9271e7df7fe3b1e33bc1c87b7f94665c0e54f835256","observation_id":"88de92c1-1199-4988-946c-6ef565782d31","resolution":{"observed_at":"2026-08-06T17:35:50.613453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08994","last_updated":"2020-04-29T21:16:31Z","snapshot_observed_at":"2026-07-06T09:13:32.098523Z","submitted_at":"2020-04-20T00:07:18Z","title":"Adversarial Training for Large Neural Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08994","snapshot_observed_at":"2026-08-06T17:35:48.602842Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.602842Z"},"links":{"cited_paper":"/paper/2004.08994","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:65e6183b5e8eeefc8184fb0807cb15b084c628688f625ce3f0f47e9a208556fa","observation_id":"8b547ac2-a353-4344-a0a0-525fd1af06e9","resolution":{"observed_at":"2026-08-06T17:35:48.602842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11764","last_updated":"2020-04-23T07:19:00Z","snapshot_observed_at":"2026-07-06T08:24:38.792721Z","submitted_at":"2019-09-25T20:50:32Z","title":"FreeLB: Enhanced Adversarial Training for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11764","snapshot_observed_at":"2026-08-06T17:35:48.609506Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.609506Z"},"links":{"cited_paper":"/paper/1909.11764","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fc109b449e3eae7620368c6571c6c9c21a3136ef2b4c8859aad7586fbdffc527","observation_id":"2e6d12c9-8c1c-48d0-a294-1eeebdd0ef52","resolution":{"observed_at":"2026-08-06T17:35:48.609506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01663","last_updated":"2022-11-10T01:02:29Z","snapshot_observed_at":"2026-08-07T11:16:05.200996Z","submitted_at":"2022-05-03T17:50:06Z","title":"Adversarial Training for High-Stakes Reliability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01663","snapshot_observed_at":"2026-08-06T17:35:48.617525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.617525Z"},"links":{"cited_paper":"/paper/2205.01663","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fac6ddf4bbdd20cf9ca504f8b26e751a8edaf92accd2bee970c56c8dbd9d4144","observation_id":"350a898d-d298-48a8-bd4c-d7a3a13c8b39","resolution":{"observed_at":"2026-08-06T17:35:48.617525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:35:48.626472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.626472Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c97aa37a79c69900325c372182d29f5c72d49052bc047f87a32cde3b7b0c5462","observation_id":"bba77999-6c87-41b9-bf16-cc2d7c3a81ad","resolution":{"observed_at":"2026-08-06T17:35:48.626472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2507.14202."}