{"as_of":"2026-08-09T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d97dacd709ff861840a582db49634cbb68b7a59e5b7f46d31b7965c17a2c5b0f","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:16.628557Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:57:51.928730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2602.03433","last_updated":"2026-02-03T11:56:08Z","snapshot_observed_at":"2026-08-08T17:54:42.368266Z","submitted_at":"2026-02-03T11:56:08Z","title":"When control meets large language models: From words to dynamics","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-05-21T14:52:44.632671Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2602.03433"},"observation_digest":"sha256:7a23d3f0939b0a16845a4e859776a30fd90fb4c36a4e47ba127626d5d3192d6e","observation_id":"e2bd960a-5dbb-4c95-9548-c457ff5dc172","resolution":{"observed_at":"2026-05-21T14:54:13.126908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2605.16339","last_updated":"2026-05-07T16:48:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-07T16:48:48Z","title":"Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:54.238767Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2605.16339"},"observation_digest":"sha256:96dde680f0920e7a3a74bd9c4fc987eb02353b5ab8ce2752e8fe7039bb8b8ea0","observation_id":"9036905c-b097-4870-b700-ba09c4020dc2","resolution":{"observed_at":"2026-05-20T22:49:10.216730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2606.07335","last_updated":"2026-06-05T14:49:26Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:49:26Z","title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:48.561400Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2606.07335"},"observation_digest":"sha256:26fde45a9bdaabeeea4463222ce6765434877202da1edaf341f5adcdf595bf98","observation_id":"c9ba4192-0e7a-4ee5-ab2c-d234dde2bced","resolution":{"observed_at":"2026-06-27T22:01:20.847532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24445","doi":"10.48550/arxiv.2505.24445","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learningsafetyconstraintsforlarge language models","venue":"ArXiv.org","work_id":"1b767e3b-dd8a-45af-b68b-4de009df4313","year":2025},"citing_paper":{"arxiv_id":"2606.15531","last_updated":"2026-06-16T14:29:31Z","snapshot_observed_at":"2026-08-08T06:11:28.037599Z","submitted_at":"2026-06-14T01:18:53Z","title":"Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T04:35:35.594085Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2606.15531"},"observation_digest":"sha256:6ade963b8caa85dcca6baf38018700ba3c613a65e16fc8771e8d098b396de38f","observation_id":"511e8842-49c9-4e3a-a11b-475e12eb343f","resolution":{"observed_at":"2026-07-03T17:08:43.438995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-02T11:57:51.928730Z","title":"Safety as polytope: Learning polytope constraints for LLM safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.928730Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:ff040ee0bd6d39bacaaa594d6de2b843f34fb09c00fcf48521525a0645710b9d","observation_id":"9d400a3f-0fe4-42db-8206-794618102f72","resolution":{"observed_at":"2026-08-02T11:57:51.928730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24445/citation-record","integrity":"/paper/2505.24445/integrity","json":"/paper/2505.24445/citation-record.json","paper":"/paper/2505.24445"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-07T12:30:14.985484Z","title":"Mt-bench-101: A fine- grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.985484Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:70d5517de5bb4728c4b2f809f150803aacdd41eaa7bfec1fc3a9c4100d59643a","observation_id":"211c39db-1a9e-44e8-952e-e3a33be7cf9e","resolution":{"observed_at":"2026-08-07T12:30:14.985484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05426","last_updated":"2024-05-06T16:02:30Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:58Z","title":"SequenceMatch: Imitation Learning for Autoregressive Sequence Modelling with Backtracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05426","snapshot_observed_at":"2026-08-07T12:30:15.354687Z","title":"and Ermon, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.354687Z"},"links":{"cited_paper":"/paper/2306.05426","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:cdba18c36e6bea80f18987ef0a5e0bb978fc132d81dee349857a0fc299e9a101","observation_id":"70a87e9a-0d49-4527-b423-512a812a02e6","resolution":{"observed_at":"2026-08-07T12:30:15.354687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-07T12:30:15.456333Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.456333Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:bbf4b01d57f7cd825700cbf9ea194edbc67235c16dd4b79cce12156d95dd87a0","observation_id":"7363c4c8-40c6-482c-b8e0-7d7bc2524288","resolution":{"observed_at":"2026-08-07T12:30:15.456333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-07T12:30:15.620283Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.620283Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:8b870e516c14d7a1d751f24e84f2b7f7a28a68961028edaec6a35a25ad3ea992","observation_id":"08849323-40da-4714-a7fe-c4502c5a2c33","resolution":{"observed_at":"2026-08-07T12:30:15.620283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:30:15.758569Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.758569Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:060414dde616f39e107c1ace259af4bc33a08d05adca291d2d058b9dec34d8f7","observation_id":"519a09b1-99c1-4f8d-bf1e-1b428aa01b35","resolution":{"observed_at":"2026-08-07T12:30:15.758569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14692","last_updated":"2023-07-27T08:28:58Z","snapshot_observed_at":"2026-08-05T17:47:54.974979Z","submitted_at":"2023-07-27T08:28:58Z","title":"Backdoor Attacks for In-Context Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14692","snapshot_observed_at":"2026-08-07T12:30:15.821630Z","title":"Back- door attacks for in-context learning with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.821630Z"},"links":{"cited_paper":"/paper/2307.14692","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:790b04ea5c8fde59348a1490e71836251fe329e0358f3489aaadffdfbae84060","observation_id":"d78c2c74-df8f-49c9-87d0-4dd07e0a2639","resolution":{"observed_at":"2026-08-07T12:30:15.821630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T12:30:15.939144Z","title":"Autodan: Generat- ing stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.939144Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:cbde7acb441897973d0c9d6034c684cef40a0bdf1b5d6946c4102e7a204ce3de","observation_id":"56cec1a0-9d3c-46d4-b90a-bb3b4cf916c4","resolution":{"observed_at":"2026-08-07T12:30:15.939144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-08T15:03:18.474377Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-07T12:30:16.012101Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.012101Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:35951f65e2aa0806bd600fd50aa58621feb41fccb5603b182ce42257e74fea67","observation_id":"7f1d5073-9f8a-45ce-be38-8a0bd2e8880e","resolution":{"observed_at":"2026-08-07T12:30:16.012101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:16.069748Z","title":"Mpax: Mathematical pro- gramming in jax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.069748Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ebc2c5bce4fb8d71280039d4cfe44cc4af0e6b77f5bb779fdf7fd70d4063f7dc","observation_id":"41797f56-e347-427e-879c-d3aa95e037af","resolution":{"observed_at":"2026-08-07T12:30:16.069748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19933","last_updated":"2025-02-27T07:28:35Z","snapshot_observed_at":"2026-07-06T19:39:59.961070Z","submitted_at":"2024-10-25T19:08:23Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19933","snapshot_observed_at":"2026-08-07T12:30:16.143593Z","title":"Enhancing safety in reinforcement learning with human feedback via rectified policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.143593Z"},"links":{"cited_paper":"/paper/2410.19933","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:258c5776080cf45e2c3089ca5f6d7b5b71c9ee64f496cdb755a5e1cb7825d3ae","observation_id":"5df8c693-4082-40b4-82ae-d1d98aff73cb","resolution":{"observed_at":"2026-08-07T12:30:16.143593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-08-08T23:58:18.293467Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-07T12:30:16.217942Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming.arXiv preprint arXiv:2501.18837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.217942Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:01fcd3774893addc2eaa3a7430b212e8e5165af586e85a627abfa0a250792a28","observation_id":"2481352e-529d-4429-8213-38d98983fd1c","resolution":{"observed_at":"2026-08-07T12:30:16.217942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T12:30:16.287165Z","title":"C., Perez, E., Hadfield- Menell, D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.287165Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:ae055c0ac808e577855ee2f1c404a0c79782d8e70696de82fa6a05919e5c028b","observation_id":"b459100a-c042-471c-be37-2187899fe70f","resolution":{"observed_at":"2026-08-07T12:30:16.287165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T12:30:16.341645Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.341645Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:d29215e07d4916bd2479cf1934787c65ba1d17dd1b3ed59a4c84bbfdc8a54ea2","observation_id":"74b81ec1-c15b-4fb3-a0bb-fb078d10d9bd","resolution":{"observed_at":"2026-08-07T12:30:16.341645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02030","last_updated":"2024-05-23T13:49:25Z","snapshot_observed_at":"2026-08-02T22:15:22.617931Z","submitted_at":"2024-02-03T05:01:04Z","title":"Panacea: Pareto Alignment via Preference Adaptation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02030","snapshot_observed_at":"2026-08-07T12:30:16.406578Z","title":"Panacea: Pareto alignment via preference adaptation for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.406578Z"},"links":{"cited_paper":"/paper/2402.02030","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:0600b8dc9333bdf00e36c866581aa8cb8d9ecc7c9c54fce8172614c5bd8323fa","observation_id":"d0b25abb-0b16-4501-8622-7fd70047f051","resolution":{"observed_at":"2026-08-07T12:30:16.406578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.829272Z","title":"Beyond one-preference-fits-all alignment: Multi-objective direct preference optimization","venue":null,"work_id":"79f622ff-c5c2-414a-be1f-42edb0f2c6a9","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.462865Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:4a55ffc05c968adbf39093487cb2de811b6c308e1e2f30c89d27d1ee3d66daee","observation_id":"cc3e2173-fffc-4d37-aa3e-989ffb38cc47","resolution":{"observed_at":"2026-08-07T12:30:17.936203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.641277Z","title":null,"venue":null,"work_id":"85ec0b72-b4fe-4af5-91bf-68348f1b6008","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.506016Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:67d899d4bcda15bcbac00872d6ee9fa779450adfcbd21f383752c9873031f39c","observation_id":"c06c74f7-cc17-4d49-8621-04f06d5d164c","resolution":{"observed_at":"2026-08-07T12:30:17.725886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.448198Z","title":"{human question}\\n{model answer}","venue":null,"work_id":"86fc1653-332a-4338-bb3b-abd85aa41fd8","year":2023},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.558669Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:f4596f0d182b98277d1ec85391a932b389f000c6119c2b4e6f2b2762b3f93527","observation_id":"947a66c1-85a2-4efe-b390-8d096005b368","resolution":{"observed_at":"2026-08-07T12:30:17.579256Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:17.232257Z","title":"Results show mean ± standard deviation","venue":null,"work_id":"1ce097ed-d76b-47d2-901c-d1a354875909","year":2021},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.628557Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:6393b488eaf0d1c425b6883b51ccc3701320ed00fb2910f9182334ca6312fdca","observation_id":"e2f0e159-4e83-4861-9165-53506c0bd2b9","resolution":{"observed_at":"2026-08-07T12:30:17.301765Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T12:30:14.786704Z","title":"Jail- breaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.786704Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:9c281473fe31016e5d43459abed8730d279c4af546c35c84794ff59402e21c7a","observation_id":"12ed9f93-7ac7-444e-845a-2394f397f838","resolution":{"observed_at":"2026-08-07T12:30:14.786704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T12:30:15.888021Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.888021Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:299327cea3099bada3305dd1f3753b454fdf2a3ab747303970ca9fa68cb63f99","observation_id":"3fc8dcb9-694d-40f7-bfa6-435116fa0bca","resolution":{"observed_at":"2026-08-07T12:30:15.888021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12312","last_updated":"2022-11-22T15:03:48Z","snapshot_observed_at":"2026-07-06T14:21:45.463565Z","submitted_at":"2022-11-22T15:03:48Z","title":"Interpreting Neural Networks through the Polytope Lens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12312","snapshot_observed_at":"2026-08-07T12:30:15.138252Z","title":"R., Millidge, B., Alfour, G., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.138252Z"},"links":{"cited_paper":"/paper/2211.12312","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:e63bbda13a95bf2fb527eb7a91280dd8322b9c99cfaac82534f20e6b7145c6f8","observation_id":"5691e74e-0f86-4b94-8d91-7297b889fcc0","resolution":{"observed_at":"2026-08-07T12:30:15.138252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T12:30:15.698528Z","title":"Ai control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.698528Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:646ffd16679b09dbddade8524d13bb54e12ba0e7112114d2573e49207ebd8068","observation_id":"62406f3f-8d92-4d13-9b40-ac547bef0427","resolution":{"observed_at":"2026-08-07T12:30:15.698528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05094","last_updated":"2024-08-09T14:36:42Z","snapshot_observed_at":"2026-08-07T03:38:50.034263Z","submitted_at":"2024-08-09T14:36:42Z","title":"Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts","version":1},"cited_work":{"arxiv_id":"2408.05094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05094","snapshot_observed_at":"2026-08-07T12:30:16.973232Z","title":"Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts","venue":"cs.CL","work_id":"a78018a9-6c90-448c-b473-17ba78af4221","year":2024},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.545665Z"},"links":{"cited_paper":"/paper/2408.05094","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:72c8aa63e9ed31a3d3adf600cbce37f162b055808411619b505059774551ffbf","observation_id":"4c4f088e-3a56-4d72-9850-0fc309a42dff","resolution":{"observed_at":"2026-08-07T12:30:17.032993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-07T17:43:00.958834Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-07T12:30:15.271464Z","title":"Defending against unforeseen failure modes with latent adversarial training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.271464Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:15e434bdef788eb1aa466812761163e16c3c81ef833fb763f96e7ae76b4cf9a2","observation_id":"28a20280-8c32-43e8-b0aa-224937fb62cc","resolution":{"observed_at":"2026-08-07T12:30:15.271464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:18.022907Z","title":"and Bartlett, P","venue":null,"work_id":"58c05457-2e56-4907-9fcd-62a2d748fbca","year":1999},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.835783Z"},"links":{"citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:5e60a641f9acb3f2dcb04b95b390a9d1b6a9c9269efb715d4f23731d6dd1a09a","observation_id":"05e6391c-18c6-4105-a685-75cfa16f0747","resolution":{"observed_at":"2026-08-07T12:30:18.150799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T19:43:43.847346Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2505.24445."}