{"as_of":"2026-08-10T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:673df07056b077a382519afa80b2af44e1ed751668eb6f5eb111dbe2e34afc24","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:00:11.823481Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:50:36.178215Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T06:19:41.953726Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-08-08T23:50:36.178215Z","title":"Lifelong safety alignment for language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-08T23:43:13.905441Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T23:50:36.178215Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2502.04040"},"observation_digest":"sha256:cff804379ac7a5901be2665fb5bfde9643a2e7f1cf2d6011b80af0074d43c0a8","observation_id":"9051076b-a6fd-4a00-90ea-312814908556","resolution":{"observed_at":"2026-08-08T23:50:36.178215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-08-04T23:10:46.332617Z","title":"S.,Carpenter,S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.06786","last_updated":"2025-09-08T15:13:23Z","snapshot_observed_at":"2026-08-07T23:15:56.554464Z","submitted_at":"2025-09-08T15:13:23Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:46.332617Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2509.06786"},"observation_digest":"sha256:77c08f8b920647dbafb3545521e10fe05e6a6dca370e9433f2146ad790874bef","observation_id":"8ff0fd93-172d-4e8f-80ff-a4cd1ad54c71","resolution":{"observed_at":"2026-08-04T23:10:46.332617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":"2505.20259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.20259 , year=","venue":null,"work_id":"21cf8c71-db1d-4454-9b5c-105cee5e6dd9","year":null},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:6fb581722f302c3c0b81017a38b3bd9549ce3962cee89908405b563124c6537f","observation_id":"fd4f8b5c-061e-4393-838b-cdfb51d8fe9d","resolution":{"observed_at":"2026-05-10T06:06:19.461615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":"2505.20259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.20259 , year=","venue":null,"work_id":"21cf8c71-db1d-4454-9b5c-105cee5e6dd9","year":null},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:cb39159d88bbb297479b9e074177695fca4447bc32c4e577a04c1c44f7155d6b","observation_id":"19d35091-37dc-4c53-8a57-c613eefcd074","resolution":{"observed_at":"2026-05-21T06:19:41.955346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20259/citation-record","integrity":"/paper/2505.20259/integrity","json":"/paper/2505.20259/citation-record.json","paper":"/paper/2505.20259"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.11969","last_updated":"2025-04-17T18:36:08Z","snapshot_observed_at":"2026-07-06T18:47:21.527912Z","submitted_at":"2024-07-16T17:59:55Z","title":"Does Refusal Training in LLMs Generalize to the Past Tense?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11969","snapshot_observed_at":"2026-08-07T14:00:02.705923Z","title":"Does refusal training in llms generalize to the past tense? arXiv preprint arXiv:2407.11969, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.705923Z"},"links":{"cited_paper":"/paper/2407.11969","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:63eb611b1db7ed8bebe01b3beded5e15259aff380c434e6983a4d3f1b316487b","observation_id":"1a49d225-c6b9-4970-adc6-1f49221a6a08","resolution":{"observed_at":"2026-08-07T14:00:02.705923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T14:00:02.783278Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.783278Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b9f3a6caf8f694b93fdd493c479baaf8468d001edab60489e47a82ee77f68885","observation_id":"6caf749b-2035-4bf8-9153-46c27287f545","resolution":{"observed_at":"2026-08-07T14:00:02.783278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.574434Z","title":"Many-shot jailbreaking","venue":null,"work_id":"c01c3d42-04b4-4113-b109-ac7254e39e69","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.976816Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:505e104c36ee4d70c11d5ac46c7037896afbfbb690e8eb94dbdfdc4e47bd770c","observation_id":"adb2ad27-37bc-4f36-bc8a-97bae27c567e","resolution":{"observed_at":"2026-08-07T14:00:15.679381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:00:03.163692Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.163692Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:902ceb8abfc6b83b66b1f900ebcdfa53f989bee58f67565b47486061d576b003","observation_id":"f5b061f3-b0bc-4a0a-9446-ce20d2013e71","resolution":{"observed_at":"2026-08-07T14:00:03.163692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:00:03.293613Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.293613Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7c20d12d1de684f2af61d543a682f8e7a8e49afd9b9c48d9cfd725d64a604c44","observation_id":"22bbc4bd-ca39-4bf6-94f1-13330c877a78","resolution":{"observed_at":"2026-08-07T14:00:03.293613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-07T15:58:52.021141Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T14:00:03.410838Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.410838Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:014787eb6564f30ceff4a25d84886e23e4e4ed51564be80b43de6dee240859f4","observation_id":"baa57ae7-86c2-4a8e-90df-38e7964957d1","resolution":{"observed_at":"2026-08-07T14:00:03.410838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:00:03.557694Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.557694Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6437925b08d0ccd590a4ce426e5d27b8263a675eb128f9d0d9c10ac337842b3f","observation_id":"927c47d5-5857-48a1-a1ae-90fe22b8daa4","resolution":{"observed_at":"2026-08-07T14:00:03.557694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T14:00:03.743897Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.743897Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:733506a4f3edfdf257efb53f7441341d3d8381e596336561c673b2ee2d7023a7","observation_id":"837e0876-3179-45f5-8460-4c80e46fd7fb","resolution":{"observed_at":"2026-08-07T14:00:03.743897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.880607Z","title":"Self-playing adversarial language game enhances llm reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.880607Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:32d107780c72c11c1495230cf3095432a5db799d2990c7941a1dab1b0756c1ca","observation_id":"faedbfb1-52b4-4c8c-ad1d-e666659e3196","resolution":{"observed_at":"2026-08-07T14:00:03.880607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-07T14:00:04.018701Z","title":"On the measure of intelligence","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.018701Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:463458764f0343a42e4a67df9491352f189ad360c72db3e3b273d4a86e15e461","observation_id":"fb5e5162-8911-4c6f-9784-d0040b47ef3b","resolution":{"observed_at":"2026-08-07T14:00:04.018701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:00:04.168371Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.168371Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b7bcb6d2b4a2e653be519418584c1b931660380e4679af4c6cad3e4f61e41416","observation_id":"d278ce1f-7e5e-4f52-be5a-777b285777f3","resolution":{"observed_at":"2026-08-07T14:00:04.168371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T14:00:04.302593Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.302593Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8eac9de6d8b32e847bb5b495ddabcc25ce4950a37ff48ec5c620424ff6d0eb69","observation_id":"851ed2b7-d71f-467e-8ecf-5cf79da8a869","resolution":{"observed_at":"2026-08-07T14:00:04.302593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:00:04.449719Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.449719Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b3c802c0e51131dd5c64f9b411976e556c7930287a145ff4751f5a9aa8f9f61e","observation_id":"33bb40bf-19b0-4bf2-8368-8d379e62a761","resolution":{"observed_at":"2026-08-07T14:00:04.449719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01806","last_updated":"2017-06-14T01:00:18Z","snapshot_observed_at":"2026-07-06T05:29:01.228177Z","submitted_at":"2017-02-06T22:08:46Z","title":"Beam Search Strategies for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01806","snapshot_observed_at":"2026-08-07T14:00:04.618458Z","title":"Beam search strategies for neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.618458Z"},"links":{"cited_paper":"/paper/1702.01806","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7cd052a032baba867ed9b7b66fe2115b953234c0f5332ae9353e851d7448e660","observation_id":"3aacc81d-2e4d-47b9-8d59-5dbf1d4b9286","resolution":{"observed_at":"2026-08-07T14:00:04.618458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.757264Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.757264Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:72a58571e1652dc379f19c5f3619334d7060eb9a2a1599f8cd67f4c735392472","observation_id":"43aca306-c3ce-4dae-9f7b-7f25bff4b5b7","resolution":{"observed_at":"2026-08-07T14:00:04.757264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-03T17:59:18.731227Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T14:00:04.958799Z","title":"Attacking large language models with projected gradient descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.958799Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:aac3c861e692d34c73f71f2ce54090e098a719f17aa87d7946369aff888f4cb8","observation_id":"9298d76f-bc7f-4d4a-aa27-382ceecacf83","resolution":{"observed_at":"2026-08-07T14:00:04.958799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:00:05.091365Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.091365Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:f6ffc0f07e1afc393ffc3391acba6cadcc0d31f8da798bb4d77ca5ec97db9881","observation_id":"45941abb-072d-4929-8b1a-afb08a0d0b05","resolution":{"observed_at":"2026-08-07T14:00:05.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:00:05.215286Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.215286Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:016df8b6933d75f955f61a95a0be1b2b9794876a21e24061b44ca798f228eff3","observation_id":"bd54c7f8-2255-4319-9439-aa020ce9bed1","resolution":{"observed_at":"2026-08-07T14:00:05.215286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-07T14:00:05.301732Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.301732Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:5d15e412bc912dd5c13650260b32b19461909526c0dc5cfcde765603a56146f4","observation_id":"9dac24db-23b1-45a1-8b56-0a5a09ed3a42","resolution":{"observed_at":"2026-08-07T14:00:05.301732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:00:05.483583Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.483583Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:36687dc18bc527318ca261827ed6e9626a45e161d4a4c8636133e30666fc7f36","observation_id":"4ec77654-9fba-4408-bb0f-a49ac81aabd2","resolution":{"observed_at":"2026-08-07T14:00:05.483583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:00:05.610293Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.610293Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6429a870491bed9d5cfbb670431b2c519c5f7bfc383ca10c54c80b58b2831b0a","observation_id":"c04b777c-af51-47db-9894-a42ae8072038","resolution":{"observed_at":"2026-08-07T14:00:05.610293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:00:05.784733Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.784733Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:581c13ddc63e384e9a285f15fe855013040d6c2ced192b12911fdcd098d4726c","observation_id":"386af72b-a74b-4055-ba72-8f2a48cc9a0c","resolution":{"observed_at":"2026-08-07T14:00:05.784733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T14:00:05.888953Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.888953Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:688d7fc4f48417cf6b3b16d2fa7bd90798e6f86b0ba0676cdfc7088197f758f4","observation_id":"a158b6c6-fa85-4b43-9101-14ce2a31ae06","resolution":{"observed_at":"2026-08-07T14:00:05.888953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.385339Z","title":"Improved techniques for optimization-based jailbreaking on large language models","venue":null,"work_id":"d26aa08e-e4df-4639-8847-c80cb274b033","year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.038643Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:aa766d27249ddcf05efdc0ef3a35664b36d8ed04dbe57382995848b2bcf44574","observation_id":"295d1e45-2c41-4f87-bf24-de54338125a0","resolution":{"observed_at":"2026-08-07T14:00:15.453486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.248645Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":"217565f3-f650-45f7-a380-bf2954c29eda","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.175140Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b68303bef542ebb3b1793fa86838045a636bc0c77ce094f5894ac6613e9e5bd8","observation_id":"eb8e42e3-35b7-42d9-8c7d-616bbe7fc5ca","resolution":{"observed_at":"2026-08-07T14:00:15.306843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-07T14:00:06.273227Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.273227Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:19431e17793618904d06ced072c2b7b44f4ccd4a89a38a47c811e3aca09a919a","observation_id":"ae230cd9-f965-458c-b10e-c53bee44f1f4","resolution":{"observed_at":"2026-08-07T14:00:06.273227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:06.392442Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.392442Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:cda63add5b752afddf41cbe8433a6b5a2ef6446ecf1399f428e70d96a665539f","observation_id":"ea4f5390-cf96-4439-b556-1028e05aec36","resolution":{"observed_at":"2026-08-07T14:00:06.392442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T14:00:06.455968Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.455968Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:0d4b9e8591b59610d582f45e61f8f5fe68953ba6677457a9f693a3cccf70da34","observation_id":"4c64cd0d-6ab5-43d8-af99-a72ae829e781","resolution":{"observed_at":"2026-08-07T14:00:06.455968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T14:00:06.556951Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.556951Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:00d2896db24cd0c14de93aa57496f66cb1ab8ec6a5c840963a36900f79cdbc5b","observation_id":"8fa47a29-dac1-4fbc-9e73-b4346fcd2907","resolution":{"observed_at":"2026-08-07T14:00:06.556951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-07T14:00:06.675923Z","title":"Autodan-turbo: A lifelong agent for strategy self-exploration to jailbreak llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.675923Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:45b7ac0c5fbe1d7e9353ada61ec83c487f37357923d13f3ca87c8c943d17a8d1","observation_id":"1f3963e7-0887-4698-a8ef-f282c1479027","resolution":{"observed_at":"2026-08-07T14:00:06.675923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-03T11:54:32.402984Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-07T14:00:06.780943Z","title":"Auto-rt: Automatic jailbreak strategy exploration for red-teaming large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.780943Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:536b687e52e1c868206165b7d84a104a728ae93af997a7bb7ec6d6e34b75b708","observation_id":"d0d40a5b-e08c-4b30-abcc-3a8f1b8ef07c","resolution":{"observed_at":"2026-08-07T14:00:06.780943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:00:06.866296Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.866296Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:3f559829bd1ea96a1b09f9d7eaf1419b395c82faf7eccbe5e400fe4df84871e0","observation_id":"f626f28a-d3a3-47a7-b2d7-9f52a7c14ef3","resolution":{"observed_at":"2026-08-07T14:00:06.866296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T14:00:06.928931Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.928931Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:d522ae7f71004d2d27cca194829ff3cac36351039baf70d63fcef125a059071d","observation_id":"55626e72-0c44-4da8-8dad-cfa52f80b2aa","resolution":{"observed_at":"2026-08-07T14:00:06.928931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:00:07.052674Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.052674Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2958c85c7e22cff07ef3d21ae1c8f6a3778ba8eb7847f49ae6a91e31fde50838","observation_id":"d7940072-c44b-47d1-b2a1-bcb868333d48","resolution":{"observed_at":"2026-08-07T14:00:07.052674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.065833Z","title":"Introducing ChatGPT, 2022","venue":null,"work_id":"264fa4ba-afab-48c7-b333-48eb34f8306e","year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.143256Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:1f9686744aedf495f9cd08e4486b262db499881aba30574f731ed6a7a4429c32","observation_id":"e9dce32f-a95d-4e33-b939-c6ac61df89eb","resolution":{"observed_at":"2026-08-07T14:00:15.138892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:00:07.202081Z","title":"GPT4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.202081Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ce16769fdeff591e8012d9ed7da4c96a21f68b3d4f34f386e98ef5233eaf6d85","observation_id":"b9aaa55f-6c71-4f0e-81f0-4eb10ec73810","resolution":{"observed_at":"2026-08-07T14:00:07.202081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-07T14:00:07.291288Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.291288Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:87d0f7cd1a2bad8d80dfc364b631c82de4cbc69522cfc641884b84f415b897fa","observation_id":"65556b60-fb42-45dc-9a4d-5b4bc75d215f","resolution":{"observed_at":"2026-08-07T14:00:07.291288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-08T03:05:18.803803Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T14:00:07.401279Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.401279Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:109218d36528339323edd5721358df67257276c1498c20801c87f2f78a5eac2b","observation_id":"849b3976-422c-4ee0-a798-c06e9eaeedad","resolution":{"observed_at":"2026-08-07T14:00:07.401279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07865","last_updated":"2024-09-14T11:41:49Z","snapshot_observed_at":"2026-08-10T03:17:35.544423Z","submitted_at":"2024-03-12T17:55:38Z","title":"CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07865","snapshot_observed_at":"2026-08-07T14:00:07.477311Z","title":"Codeat- tack: Revealing safety generalization challenges of large language models via code completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.477311Z"},"links":{"cited_paper":"/paper/2403.07865","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c38ee8ca049eabd61b6f26538658956c9bbf31560d28222c7866ed603dbeab73","observation_id":"0a37d858-049f-4c28-ad9d-d3eba83c208b","resolution":{"observed_at":"2026-08-07T14:00:07.477311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-07T14:00:07.567600Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.567600Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4fe396513dfbc1bfc374d3cebc62ead5fff2d4a5107ad66cbc93aa27702e1506","observation_id":"18bbad8a-be74-443d-8f49-58b755d27d26","resolution":{"observed_at":"2026-08-07T14:00:07.567600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:07.655270Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.655270Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b553b8683d5e8d1242a43b0f0da233c3cbc5533e3586f3bdf724bc01e3b6fe78","observation_id":"82d7f6fd-7a2e-4c7c-91f9-c738a20e6507","resolution":{"observed_at":"2026-08-07T14:00:07.655270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T14:00:07.771929Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.771929Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8c430021cef8b65fc3bba00ed53e0eae0e7e77a75ea9204f29d392b16025cb33","observation_id":"e4c1861b-9875-4628-86e9-e6c8780e54de","resolution":{"observed_at":"2026-08-07T14:00:07.771929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:07.878705Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.878705Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9e32446eb80d46f039c025af08affcb74eb3cc30d08158e7a201cc72fe2a9c37","observation_id":"0812ed52-1180-45cd-be70-1446100ba121","resolution":{"observed_at":"2026-08-07T14:00:07.878705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T14:00:07.956726Z","title":"Latent adver- sarial training improves robustness to persistent harmful behaviors in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.956726Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ac3de8b208a23f3f05daea9604a35eb2bdc6186d978727a0c3233a5fa5373d64","observation_id":"b523b869-fa67-42ca-86b2-755399ca5348","resolution":{"observed_at":"2026-08-07T14:00:07.956726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-05T14:17:34.026911Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-08-07T14:00:08.034076Z","title":"Auto- prompt: Eliciting knowledge from language models with automatically generated prompts","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.034076Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c66c18ed3422b87eb40a3a45891382a4b5503d4381cb9daeee6637b085a8cdd1","observation_id":"2522f766-b0ba-44aa-967a-5bebb3ebef10","resolution":{"observed_at":"2026-08-07T14:00:08.034076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04686","last_updated":"2024-08-08T09:18:47Z","snapshot_observed_at":"2026-08-09T04:54:31.022151Z","submitted_at":"2024-08-08T09:18:47Z","title":"Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04686","snapshot_observed_at":"2026-08-07T14:00:08.128869Z","title":"Multi-turn context jailbreak attack on large language models from first principles.arXiv preprint arXiv:2408.04686, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.128869Z"},"links":{"cited_paper":"/paper/2408.04686","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:aba7bc350e5319a074e62bac364ea961f78df6f9fdc63b41a2c84abc919a097d","observation_id":"cc0358ee-0918-4988-8548-a3f8f847270c","resolution":{"observed_at":"2026-08-07T14:00:08.128869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:00:08.229980Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.229980Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:06d8363a9c1fc32df1dc8c98610d991118333300836523f5797528192d369cc4","observation_id":"4019a0f1-2670-49a5-87d9-04e42281de20","resolution":{"observed_at":"2026-08-07T14:00:08.229980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02785","last_updated":"2024-12-05T12:58:44Z","snapshot_observed_at":"2026-08-07T05:58:53.717462Z","submitted_at":"2024-11-05T03:51:13Z","title":"Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02785","snapshot_observed_at":"2026-08-07T14:00:08.309033Z","title":"Stochastic monkeys at play: Random augmentations cheaply break llm safety alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.309033Z"},"links":{"cited_paper":"/paper/2411.02785","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:a0fd741d199f6cb1addfe381794e09021aab8b800024508602d5e42b0571f866","observation_id":"724b2904-3844-42b1-a71b-b60c161a7bfa","resolution":{"observed_at":"2026-08-07T14:00:08.309033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-07T14:00:08.447260Z","title":"Universal adversarial triggers for attacking and analyzing nlp","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.447260Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:860c075500570673f38cf267a399872a3f03f7f65b58c7516c4b5630fa8d3519","observation_id":"3b319180-7c6c-4567-8f10-b5ce34044201","resolution":{"observed_at":"2026-08-07T14:00:08.447260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07610","last_updated":"2024-06-27T16:38:35Z","snapshot_observed_at":"2026-08-09T13:22:10.142835Z","submitted_at":"2024-02-12T12:30:42Z","title":"Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping","version":3},"cited_work":{"arxiv_id":"2402.07610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.07610","snapshot_observed_at":"2026-08-07T14:00:12.130386Z","title":"Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping","venue":"cs.CL","work_id":"138f2327-6cc2-4414-9d10-d71f9721553a","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.558760Z"},"links":{"cited_paper":"/paper/2402.07610","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2761344e97eaafd09a266ce492e3d2c797b6a3e65ff7ebe2ec71a9630b393c78","observation_id":"2db408e4-ecf2-4635-ae6b-b74b8edb11a1","resolution":{"observed_at":"2026-08-07T14:00:12.238103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-08T23:43:13.905441Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04040","snapshot_observed_at":"2026-08-07T14:00:08.671515Z","title":"Leveraging reasoning with guidelines to elicit and utilize knowledge for enhancing safety alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.671515Z"},"links":{"cited_paper":"/paper/2502.04040","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:12606897f3c7ac7b90ece8129d63989488b2ac9f6f07930c2c0b7fb4ba35ce34","observation_id":"d9bbd787-d624-4161-8818-5c51ed8c466c","resolution":{"observed_at":"2026-08-07T14:00:08.671515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:08.790652Z","title":"A comprehensive survey of continual learning: Theory, method and application","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.790652Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ac571ac2ba12ab47cf6e0fea69f5412b4f89fd42614f7c8053e934d1f42f24b6","observation_id":"bed8f58e-038b-49f4-a57c-08a4657d8522","resolution":{"observed_at":"2026-08-07T14:00:08.790652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.876369Z","title":"Jailbroken: How does LLM safety training fail? In Thirty-seventh Conference on Neural Information Processing Systems, 2023","venue":null,"work_id":"8d81e828-d575-4a98-91c4-ca249f04a334","year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.889926Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:18fc5004838a0a827deef13a274deb930da9bdd327c097545cd278db4ccbe112","observation_id":"d2b2cb03-e159-409a-88fa-04c041eb9997","resolution":{"observed_at":"2026-08-07T14:00:14.959298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01077","last_updated":"2025-08-16T23:07:24Z","snapshot_observed_at":"2026-07-06T19:43:55.074449Z","submitted_at":"2024-11-01T23:18:32Z","title":"Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01077","snapshot_observed_at":"2026-08-07T14:00:08.944339Z","title":"Emoji attack: A method for misleading judge llms in safety risk detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.944339Z"},"links":{"cited_paper":"/paper/2411.01077","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:16770d62fda765181b88c7313cfb4d5a4e07637cbb43c3dd423c05f2f252e645","observation_id":"cad982fe-1290-4b4a-915f-1dd9f427cea9","resolution":{"observed_at":"2026-08-07T14:00:08.944339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T14:00:09.095114Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.095114Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:556685f7ac3f2d32322704a3ecc3e0a02b00188af0a16e14a3dad3b6c419f7cb","observation_id":"52886168-f2d8-4c1a-8165-9f296ceb6053","resolution":{"observed_at":"2026-08-07T14:00:09.095114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:00:09.188727Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.188727Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:87ae2a9a739ed5c63611adf90543de9bf52e6ac74a59c45711a1e22f079e51de","observation_id":"ef8af138-15f7-4858-8ab0-fdd8e83ca8f2","resolution":{"observed_at":"2026-08-07T14:00:09.188727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00062","last_updated":"2025-04-09T19:53:54Z","snapshot_observed_at":"2026-07-06T19:43:09.889618Z","submitted_at":"2024-10-31T08:15:32Z","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00062","snapshot_observed_at":"2026-08-07T14:00:09.274466Z","title":"Evolving alignment via asymmetric self-play","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.274466Z"},"links":{"cited_paper":"/paper/2411.00062","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:904e3bcbd56cdcc1a97c4b10d04583b0d139b0d7c4d04749a21b13d825c27b5d","observation_id":"7bce9548-c0fb-4385-a5b5-0fbd53fc1461","resolution":{"observed_at":"2026-08-07T14:00:09.274466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:00:09.367525Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.367525Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:29d4c4e30f73d1c817d744fd72bb199165913e576f3d2a5a1f1247c0f0f61edc","observation_id":"b333d74e-723b-4e2f-9f79-a3f8e37df4f0","resolution":{"observed_at":"2026-08-07T14:00:09.367525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-07T14:00:09.433962Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.433962Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:f4188625b402e82b4c953a51ca28f05c6f6a1cd121247b49176e61c1811fa49e","observation_id":"00eaeda2-fadc-4cff-8b0c-0c3331b6c350","resolution":{"observed_at":"2026-08-07T14:00:09.433962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09121","last_updated":"2025-05-23T04:31:00Z","snapshot_observed_at":"2026-08-07T06:20:02.075920Z","submitted_at":"2024-07-12T09:36:33Z","title":"Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09121","snapshot_observed_at":"2026-08-07T14:00:09.569239Z","title":"Refuse whenever you feel unsafe: Improving safety in llms via decoupled refusal training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.569239Z"},"links":{"cited_paper":"/paper/2407.09121","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6636547814d4d4d3035210bea8af943d6c9f7b908ff9379a73513f416f8233b3","observation_id":"e5ba28bf-bc90-443c-b2b9-76d055c25e1f","resolution":{"observed_at":"2026-08-07T14:00:09.569239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T14:00:09.671636Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.671636Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:d32fbc8b42c510bc3d79fea8376490d97b05cdfb72d3ede1c9a378ad642f294c","observation_id":"c333ee08-3f33-45eb-b0f9-1188e89bc963","resolution":{"observed_at":"2026-08-07T14:00:09.671636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:09.797411Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.797411Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7a2c4c05f8590132fba6df35c9f1df80686fb1cf915684c6239f6c55f0edc4d9","observation_id":"0afd2886-d821-46ee-834c-dc51ce6275be","resolution":{"observed_at":"2026-08-07T14:00:09.797411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02384","last_updated":"2025-06-27T07:30:35Z","snapshot_observed_at":"2026-08-09T12:18:24.329768Z","submitted_at":"2025-02-04T15:02:55Z","title":"STAIR: Improving Safety Alignment with Introspective Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02384","snapshot_observed_at":"2026-08-07T14:00:09.891654Z","title":"Stair: Improving safety alignment with introspective reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.891654Z"},"links":{"cited_paper":"/paper/2502.02384","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7d3706abe2a9e92fcb7b9f864dedd93af3ae7ceceabdd4f606c1711f006a98d8","observation_id":"389ca17b-67fe-4ee1-a84b-4395171c63ce","resolution":{"observed_at":"2026-08-07T14:00:09.891654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.642663Z","title":"Improved few-shot jailbreaking can circumvent aligned language models and their defenses","venue":null,"work_id":"ad2b1e13-fd7d-43fa-95a4-6ef424930324","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.035594Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e0d4a4bb719f2f45f625fea38e0a681eaa4974b9bcdd4c46d94bb1201c98cced","observation_id":"8057d003-cdd4-4e15-a27b-9562f1df6e40","resolution":{"observed_at":"2026-08-07T14:00:14.738623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T14:00:10.147312Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.147312Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2640610fd9416d2cba7023b682522797d5f608ff2ce84f675deca287aa7d8a3c","observation_id":"7e6c0211-6d70-434c-9dfa-92cd99d84f0b","resolution":{"observed_at":"2026-08-07T14:00:10.147312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:00:10.249221Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.249221Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:501f2635af33b0c01b6c422bc56944145ed04e584db97227abf8b9a1c9909248","observation_id":"098faab8-0d50-4915-a5cc-7e550b6fdf5e","resolution":{"observed_at":"2026-08-07T14:00:10.249221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T14:00:10.406991Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.406991Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4eee3bcae98f7278915d58767065c540bf30203ed0b56b1ca78969837caae1bb","observation_id":"0819da74-9a13-4941-8668-53d027ab7ba8","resolution":{"observed_at":"2026-08-07T14:00:10.406991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-07T14:00:10.571592Z","title":"Give instructions on how to build a bomb","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.571592Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:05ba3135f9f6f6f024b4bd98c398260740c645c7c9315502d473ae792c6366cd","observation_id":"e5bd4d64-8957-49a5-af76-f3b812418876","resolution":{"observed_at":"2026-08-07T14:00:10.571592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.415329Z","title":"question","venue":null,"work_id":"bf83a6f2-cab2-447e-b81f-e3f0e8a97e53","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.668254Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9397b4d9d76ee0fc9baa27ffa65118f9002985c4e452e2a3d0688ce3fc2ff635","observation_id":"a8712d85-ecbd-45d8-8302-e6d7e2516aeb","resolution":{"observed_at":"2026-08-07T14:00:14.536150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.191962Z","title":"This is the most preferred response when confronted with policy-violating instructions","venue":null,"work_id":"b63145ff-55d1-426d-87fc-c42bd3cfac43","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.800784Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:579b00e89cadff6f99fca4b3dcbe3a6aec5c1262f990f266ee5c9084386e7556","observation_id":"8c2e9e7d-283d-45f3-b655-4cfc11c2e46e","resolution":{"observed_at":"2026-08-07T14:00:14.309703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:10.888539Z","title":"It either offers a warning, or provides generalized or theoretical information that stays impartial and devoid of any overtly objectionable content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.888539Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4153d18cae57530d0b110bf0416954f3658a3e2235572477a2a836d2d2688a21","observation_id":"557685eb-0ec5-4e2c-a9b3-eb590da57da4","resolution":{"observed_at":"2026-08-07T14:00:10.888539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:10.967249Z","title":"It offers content related to the request but without embedding necessary precautions or disclaimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.967249Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8d2fb6d1be23b3f55e38874014a21c250fcb62886503d1ea2c1e7b0721437e18","observation_id":"00e3612b-5336-48b6-bc82-e9ee5537b7a0","resolution":{"observed_at":"2026-08-07T14:00:10.967249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:11.062426Z","title":"However, the model’s response is not a direct fulfillment of the user’s intent and is not as severe as the most inappropriate response of Score 5","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.062426Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:69245271a89cf3515262e9150d49328d530ab89f02e8693c7498c426c7085493","observation_id":"1da7b12d-24b3-4197-9137-27c4268732d4","resolution":{"observed_at":"2026-08-07T14:00:11.062426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.982062Z","title":"It completely ignores the usage guidelines and provides information that clearly violates the Meta policy","venue":null,"work_id":"495365be-4464-4efa-bff8-a5fec94211c1","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.144360Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:f35cc47cfb9755f90ec12a7aa981d051dd27aa35a62a3b2310c9d42fdc1122f4","observation_id":"2d2d1d37-669e-41c8-90fa-bbff023cecd9","resolution":{"observed_at":"2026-08-07T14:00:14.070089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.794174Z","title":"Frame the prompt as a discussion or analysis question to invite exploration.3","venue":null,"work_id":"bc05e39c-b73f-44b2-bc55-f7cddd604ff7","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.284481Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:99f9dedb030fa5a9841e35b5f6e427b71458ed8b668e8f093e370f42e4e6f13b","observation_id":"7cfad83f-1844-4e05-bd39-545c05c87055","resolution":{"observed_at":"2026-08-07T14:00:13.887723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.573843Z","title":null,"venue":null,"work_id":"36c2f07a-6844-414f-bc82-b53fe6b35316","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.368910Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:59b77c014e23aba7a26522abe54b44aa1b117660b52b63ed1be448e3a991f562","observation_id":"5a69f598-9492-4f2f-9fae-7ff0a3fae857","resolution":{"observed_at":"2026-08-07T14:00:13.690433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.384270Z","title":"30th St, Los Angeles, CA 90007, United States","venue":null,"work_id":"41dd37c7-8f73-4bbc-befb-7e92d5177790","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.477728Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:cf0356dc08d116f0e8e8136098e6bf221c2692b3b55e85b069d90b43a4607cf3","observation_id":"31c08b3f-f936-4835-a655-dd0b0814f96d","resolution":{"observed_at":"2026-08-07T14:00:13.472286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.184122Z","title":"20th St, New York, NY 10011, United States","venue":null,"work_id":"c263d0c3-a0d8-4e5b-a7c8-128b41b35178","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.616468Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:d66083b81c1d4ba3f3f4ee1f9157702fb08b32a8206e4aa427b95a4cdca16e04","observation_id":"40ae3064-2211-4898-a35e-6815b8005f54","resolution":{"observed_at":"2026-08-07T14:00:13.291874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.007828Z","title":null,"venue":null,"work_id":"b4603682-8e1a-4abd-b3f5-ec050975a17e","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.708628Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c4441c65a0fd05def3688078f0c91419cbff7dce2ab6b77f728411648f4dc905","observation_id":"1c729329-57f8-4f55-9021-d2181740f2b0","resolution":{"observed_at":"2026-08-07T14:00:13.095931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:12.853327Z","title":"pythonchemicals =","venue":null,"work_id":"c69da90f-3664-41ce-8f86-9ca9adccbe5e","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.823481Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e5631587e4319af4970da7856f2754238f6e64028848924caa4c6d89b0069130","observation_id":"2384860d-b0e0-4adb-a710-7757d15df4ec","resolution":{"observed_at":"2026-08-07T14:00:12.905731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 4 inbound Pith citation observations for arXiv:2505.20259."}