{"as_of":"2026-08-10T20:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:540b5bd57a15f61d59f7559ce7b35661b85e92f8331237b8de726b63bd1dc26b","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:18:40.969178Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:07.249475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:43:07.622958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"cited_work":{"arxiv_id":"2502.01208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01208","snapshot_observed_at":"2026-08-07T05:43:07.622958Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","venue":"cs.LG","work_id":"0ad26be9-3465-4b1c-8504-3dccd9876074","year":2025},"citing_paper":{"arxiv_id":"2506.13774","last_updated":"2025-08-08T20:29:52Z","snapshot_observed_at":"2026-08-08T03:32:46.630570Z","submitted_at":"2025-06-08T20:31:26Z","title":"Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:07.249475Z"},"links":{"cited_paper":"/paper/2502.01208","citing_paper":"/paper/2506.13774"},"observation_digest":"sha256:2211a02f02dec402dc34096a706d3275bb1f649dda53ab6fc312eb075200078a","observation_id":"f47fd653-d640-4acc-b755-e93a1f270232","resolution":{"observed_at":"2026-08-07T05:43:07.630186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01208/citation-record","integrity":"/paper/2502.01208/integrity","json":"/paper/2502.01208/citation-record.json","paper":"/paper/2502.01208"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.470256Z","title":"An empirical survey on long document summarization: Datasets, models, and metrics.ACM computing surveys, 55(8):1–35, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.470256Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:5e21f44f1669518e3609027559cf7148faf41d0f415f43998ef36b71d43d1ae2","observation_id":"8ac5fa90-7d16-4348-a5ad-6f20f83efd4c","resolution":{"observed_at":"2026-08-09T16:18:40.470256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.476598Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.476598Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:cc3ba331d0ed72f4cb5adfdaf7906e3570f12a55d5754f1990a28dcad37c2885","observation_id":"1181761a-d634-4615-af8e-de209e60ba4f","resolution":{"observed_at":"2026-08-09T16:18:40.476598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.481857Z","title":"Pal: Program-aided language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.481857Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d4ffa2768f5390c94da6cd662dbc9f898dfc02b4103b868b13dc5f56eaafddfa","observation_id":"b1e88c8a-2a73-44df-9c95-7a9713802ee6","resolution":{"observed_at":"2026-08-09T16:18:40.481857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-09T16:18:40.487014Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.487014Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:ae82e3f0dc2615eedd7eece6bc59f984129aca280d4a6ec986bccc26e16bff18","observation_id":"f6d39b8d-bfc0-4123-823f-368013e915a5","resolution":{"observed_at":"2026-08-09T16:18:40.487014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19741","last_updated":"2024-07-12T11:44:33Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T08:28:38Z","title":"ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19741","snapshot_observed_at":"2026-08-09T16:18:40.492246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.492246Z"},"links":{"cited_paper":"/paper/2406.19741","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:1bd3687a1620b0e9131c47efce8157de2d05c317843ef3699efc9f075aaab338","observation_id":"1e67b72c-ab4c-4c90-9378-ac0cbdc4abfc","resolution":{"observed_at":"2026-08-09T16:18:40.492246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11370-024-00550-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A sur- vey on integration of large language models with intelligent robots.Intelligent Service Robotics, 17(5):1091–1107, August 2024","venue":"Intelligent Service Robotics","work_id":"0e3b7782-1a2a-48c8-a7ce-4b88c7347d05","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.497065Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:ed0dc24fbddac5a1fe5b193bf6af3b749c007c1d7f24bbf7f48001c9c6687f20","observation_id":"af3910d5-6cb5-4ca6-8fb1-c8032dc86753","resolution":{"observed_at":"2026-08-09T16:18:41.128413Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-08T22:33:30.357597Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-09T16:18:40.502533Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models.arXiv preprint arXiv:2304.05335, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.502533Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:ecf15e6520a5cc383eab011915a337a54c32677ea184cf4ed496620981ed394e","observation_id":"2025b726-2696-4717-be04-c3c9820a338c","resolution":{"observed_at":"2026-08-09T16:18:40.502533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-09T16:18:40.507237Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.507237Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:db02de018e9b8e348d59300555c58abe32eb78cd74d86ed4616c733846890fb8","observation_id":"ef519bac-1552-4b43-ac33-199be15ae185","resolution":{"observed_at":"2026-08-09T16:18:40.507237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-09T16:18:40.512328Z","title":"Ethical and social risks of harm from language models.arXiv preprint arXiv:2112.04359, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.512328Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b76fcf585ed84369d8bf1fcaeac278eb631a7bd04d1a3fd6b95465404d421528","observation_id":"64a6923b-99a6-47c1-ab70-77ddc7620e35","resolution":{"observed_at":"2026-08-09T16:18:40.512328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-09T16:18:40.517461Z","title":"Real- toxicityprompts: Evaluating neural toxic degeneration in language models.arXiv preprint arXiv:2009.11462, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.517461Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:956a88c1db18987a8dc7d58c5d073a1fd4aa9e78cc8ad9b6bc5901e92ff436e1","observation_id":"db4b25dc-92a5-41ff-b2e2-dd61d1ec7116","resolution":{"observed_at":"2026-08-09T16:18:40.517461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.522572Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.522572Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:e21cce90963d38e375e2ea1c17230413b22e165fdddccd8afb9fcc14af0445f8","observation_id":"f199c6c5-b8ec-4f5b-b0e0-a29eb46ccddb","resolution":{"observed_at":"2026-08-09T16:18:40.522572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.527252Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.527252Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d0f999b05302d1f40012c4e6f87191092ba88a8531809225f563d4e051f1b307","observation_id":"648cc058-61a0-4053-8b17-978cb4b54180","resolution":{"observed_at":"2026-08-09T16:18:40.527252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-09T16:18:40.531827Z","title":"Webgpt: Browser-assisted question-answering with human feedback.arXiv preprint arXiv:2112.09332, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.531827Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:7c1618596fda4b7c6e25c4f32d923c167d68a9095153fafe276303b7683eb9e1","observation_id":"dba0b472-7b72-4142-8613-083d21d44aca","resolution":{"observed_at":"2026-08-09T16:18:40.531827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-09T12:39:32.277152Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-08-09T16:18:40.536823Z","title":"Controlled decoding from language models.arXiv preprint arXiv:2310.17022, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.536823Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:26c630998a49dab8eb9cbdf9efa2933fdedfecf1fc11facbd7bd4afc44c0e211","observation_id":"227a9f82-3d23-44eb-8d64-70512565a5d7","resolution":{"observed_at":"2026-08-09T16:18:40.536823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.542544Z","title":"Discrete-time markov control processes with discounted unbounded costs: optimality criteria.Kybernetika, 28(3):191–212, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.542544Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:518cae9715becc5637947fe3122c9936cfcb139b6655178895cb77ace8f2b7bc","observation_id":"294b9ea5-5545-462b-97b3-54e10ec76f02","resolution":{"observed_at":"2026-08-09T16:18:40.542544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.547563Z","title":"Sauté rl: Almost surely safe reinforcement learning using state augmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.547563Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b35d99d109cc2b75e8ff2262e07a772d73d2dd2d64469991877bc2d41392e072","observation_id":"ee21386e-f652-4cd8-9501-9486c02f365e","resolution":{"observed_at":"2026-08-09T16:18:40.547563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T16:18:40.552457Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.552457Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:769142d1adc1a39ab8212acd618ca18a6bb3a8e0de0c13f860050ffac9bc0954","observation_id":"b7c85b2a-13af-4795-abf5-a1817f9f6c71","resolution":{"observed_at":"2026-08-09T16:18:40.552457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T16:18:40.557404Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.557404Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:cbcf9f4e0f9d5b44b95e402bafb19e29141632e8f8e5c7eb7f400fdcff790c61","observation_id":"3fd0f1f1-d309-4023-bd13-2b80c4327f83","resolution":{"observed_at":"2026-08-09T16:18:40.557404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01544","last_updated":"2025-01-02T21:31:38Z","snapshot_observed_at":"2026-08-10T13:15:13.214606Z","submitted_at":"2025-01-02T21:31:38Z","title":"Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01544","snapshot_observed_at":"2026-08-09T16:18:40.562457Z","title":"Many of your dpos are secretly one: Attempting unification through mutual information, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.562457Z"},"links":{"cited_paper":"/paper/2501.01544","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d27c7154f59735199902a2e3462aad4408b027e95bfe4027f4c7cc0a8dfa48cd","observation_id":"dbf5f19f-ae5a-405f-8053-bb6ad02842ff","resolution":{"observed_at":"2026-08-09T16:18:40.562457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10958","last_updated":"2024-05-27T20:05:03Z","snapshot_observed_at":"2026-08-10T11:55:19.195310Z","submitted_at":"2024-02-12T22:47:57Z","title":"Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10958","snapshot_observed_at":"2026-08-09T16:18:40.567531Z","title":"Relative preference optimization: Enhancing llm alignment through contrasting responses across identical and diverse prompts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.567531Z"},"links":{"cited_paper":"/paper/2402.10958","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:f70c67b3fadf332a7b0d9a8ca1c2a0ded2bdb2461239841eca17edb3dd6c79f2","observation_id":"649dace3-01ac-4ac4-8cca-b3a0e6853cb3","resolution":{"observed_at":"2026-08-09T16:18:40.567531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-09T16:18:40.572720Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.572720Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:1369a0e071d055dc70b1ac8942c6cae88101e0f508e183ee09229155cf031f31","observation_id":"90d13abe-0606-46a8-be83-baf1426b7be6","resolution":{"observed_at":"2026-08-09T16:18:40.572720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-09T07:24:36.881438Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-09T16:18:40.577727Z","title":"A general theoretical paradigm to understand learning from human preferences.arXiv preprint arXiv:2310.12036, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.577727Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:5e73e28f4a817ecbf4861a9c5d7812eb5a8ae2b731ed541d8d0db55144962ae1","observation_id":"7699aa7b-11f8-4f6e-8770-38fe3745ab72","resolution":{"observed_at":"2026-08-09T16:18:40.577727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T16:18:40.583638Z","title":"Slic- hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.583638Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b41dab1a4fe38c44b6dce9322da68a9d54edabfd8316567a5eb13f4a81ffd316","observation_id":"a6eccc06-70ba-46d1-a3e0-5158e1fbea3c","resolution":{"observed_at":"2026-08-09T16:18:40.583638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-10T05:17:53.947932Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-09T16:18:40.588740Z","title":"Generalized preference optimization: A unified approach to offline alignment.arXiv preprint arXiv:2402.05749, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.588740Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:318431f0dd93401b4c59a734cabaee06bc753fb6abd1016a50965805c5e1de7f","observation_id":"2cd7047a-8241-4f99-aed5-d87a2d392949","resolution":{"observed_at":"2026-08-09T16:18:40.588740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.593541Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.593541Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:8a57a424f548efbc29172cde642fb7e92ca1651f8607ab42b0d473b7da5fb66e","observation_id":"6976cd11-331a-4878-8740-128ed3baadfe","resolution":{"observed_at":"2026-08-09T16:18:40.593541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-09T16:18:40.598165Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.598165Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:bc79d53b8725aaaa6484041da7cb67e2558c4343e5c434e8e21361ee389aabed","observation_id":"9213a5ed-efd0-4009-b833-fb1631a64bd1","resolution":{"observed_at":"2026-08-09T16:18:40.598165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T16:18:40.603344Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.603344Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:06376a352fe29079886243510059782b1ee03e815684c4425dfb1bb2878ab127","observation_id":"e5a525b3-1930-4ccc-8751-ff5f63ae4758","resolution":{"observed_at":"2026-08-09T16:18:40.603344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-09T16:18:40.608158Z","title":"Safe rlhf: Safe reinforcement learning from human feedback.arXiv preprint arXiv:2310.12773, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.608158Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:2c3ba7771ccfe8dd9943486ba626de1fbbed8765bef8a2012b627b145ba6ed7c","observation_id":"6d24c066-c825-45cd-ab93-ea24dfd0afef","resolution":{"observed_at":"2026-08-09T16:18:40.608158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15152","last_updated":"2024-05-24T02:12:51Z","snapshot_observed_at":"2026-08-08T03:42:56.666688Z","submitted_at":"2024-05-24T02:12:51Z","title":"Machine Unlearning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.15152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15152","snapshot_observed_at":"2026-08-09T16:18:42.410106Z","title":"Machine Unlearning in Large Language Models","venue":"cs.CL","work_id":"fab0c327-1059-4d16-83e1-f453e3a5cb06","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.612953Z"},"links":{"cited_paper":"/paper/2405.15152","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:583a47c0284eceb2073d955f95b26ed9a8bf0aab4194fd2801fe94958922c9d3","observation_id":"96e435dd-c57c-48ea-9d6a-557397562cc5","resolution":{"observed_at":"2026-08-09T16:18:42.415020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09572","last_updated":"2024-10-15T04:55:36Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T17:03:04Z","title":"Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09572","snapshot_observed_at":"2026-08-09T16:18:40.617617Z","title":"Eyes closed, safety on: Protecting multimodal llms via image-to-text transformation.arXiv preprint arXiv:2403.09572, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.617617Z"},"links":{"cited_paper":"/paper/2403.09572","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:49ede791928f261aed92ced78ab2c29701dc9d8a6cb08a55beea30f542fcd84b","observation_id":"d5328590-8792-4f8a-98d4-bf55f78f9471","resolution":{"observed_at":"2026-08-09T16:18:40.617617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14563","last_updated":"2024-06-20T17:59:58Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:59:58Z","title":"Model Merging and Safety Alignment: One Bad Model Spoils the Bunch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14563","snapshot_observed_at":"2026-08-09T16:18:40.622233Z","title":"Model merging and safety alignment: One bad model spoils the bunch.arXiv preprint arXiv:2406.14563, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.622233Z"},"links":{"cited_paper":"/paper/2406.14563","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:274f8eaa6156b824dd436cbb8de2e724a2040dc309697984a84f65843b0d8105","observation_id":"572d086f-55e2-4102-8495-32dee9c94a4e","resolution":{"observed_at":"2026-08-09T16:18:40.622233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.626509Z","title":"Trustagent: Towards safe and trustworthy llm-based agents through agent constitution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.626509Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0ae3f81080bf5b76f3ed0a3648c746c534f54b87d04fc8e287dbb4da37a30afc","observation_id":"b31caba9-2112-4e1f-85d9-8ba70e4cf7e2","resolution":{"observed_at":"2026-08-09T16:18:40.626509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08968","last_updated":"2025-03-03T22:10:04Z","snapshot_observed_at":"2026-08-08T14:19:28.584890Z","submitted_at":"2024-10-11T16:38:01Z","title":"Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08968","snapshot_observed_at":"2026-08-09T16:18:40.631160Z","title":"Controllable safety alignment: Inference-time adaptation to diverse safety requirements.arXiv preprint arXiv:2410.08968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.631160Z"},"links":{"cited_paper":"/paper/2410.08968","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0bca0f19b0635a3041b2c457304909639a96867a56152aa7af69ebbc629aafb5","observation_id":"396404a1-a9e6-456f-957b-347827e1b2d8","resolution":{"observed_at":"2026-08-09T16:18:40.631160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-10T03:24:28.404754Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-09T16:18:40.636116Z","title":"Cold-attack: Jailbreaking llms with stealthiness and controllability.arXiv preprint arXiv:2402.08679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.636116Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:7a2cd7be84a6f27604a7e41165b0f67c0b95feb308f685a6d5a2d7c56c88a1af","observation_id":"4bcea3a2-2472-4028-ba55-23a4c040a8a4","resolution":{"observed_at":"2026-08-09T16:18:40.636116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-09T16:18:40.641145Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding.arXiv preprint arXiv:2402.08983, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.641145Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:2fa8211b2547d4c0d09ce3f865f5925bf162962a82fc473c3e9bc6a8e8a8cb4f","observation_id":"bc805eee-7db5-4c63-9bc9-dcad2a38642b","resolution":{"observed_at":"2026-08-09T16:18:40.641145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-02T21:32:36.729604Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-09T16:18:40.645718Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications.arXiv preprint arXiv:2402.05162, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.645718Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0ff13bdc748cd3589856d2ea01f0803913f4932d425196b2860b444f515a1ee1","observation_id":"37ee5772-0a77-4982-9ca0-9adb1b4979c5","resolution":{"observed_at":"2026-08-09T16:18:40.645718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01765","last_updated":"2025-01-03T11:34:28Z","snapshot_observed_at":"2026-08-09T21:37:43.987900Z","submitted_at":"2025-01-03T11:34:28Z","title":"SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01765","snapshot_observed_at":"2026-08-09T16:18:40.650485Z","title":"Salora: Safety- alignment preserved low-rank adaptation.arXiv preprint arXiv:2501.01765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.650485Z"},"links":{"cited_paper":"/paper/2501.01765","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:08199dce455fae6e835b2da6aabc0c49d5921c66550d9f125f83e6794db22659","observation_id":"43d54e6f-706a-475d-833c-5df61b19afa8","resolution":{"observed_at":"2026-08-09T16:18:40.650485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T16:18:40.655310Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.655310Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:fea32899670cee4df17c86c57d7cfb36557d63fb5d67c11169ff510272b918fb","observation_id":"421ee288-8eca-40b0-bcba-50bee8ed51d5","resolution":{"observed_at":"2026-08-09T16:18:40.655310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20290","last_updated":"2024-10-31T18:27:13Z","snapshot_observed_at":"2026-08-03T23:26:49.562857Z","submitted_at":"2024-10-26T23:20:48Z","title":"Fast Best-of-N Decoding via Speculative Rejection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20290","snapshot_observed_at":"2026-08-09T16:18:40.660327Z","title":"Fast best-of-n decoding via speculative rejection.arXiv preprint arXiv:2410.20290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.660327Z"},"links":{"cited_paper":"/paper/2410.20290","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:6efac55bb70758407f2545e52f462970053306251d791df3c72fb826e088df64","observation_id":"1da9e745-d102-4f7f-a36f-f3ae579b8f93","resolution":{"observed_at":"2026-08-09T16:18:40.660327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.665059Z","title":"Fudge: Controlled text generation with future discriminators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.665059Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:87163d8bfcedb3476dbff2b01f0979185e86d021c252ae8bc3c2e4f455fc57c5","observation_id":"e5f58d55-9049-4992-b048-707d9eb6478e","resolution":{"observed_at":"2026-08-09T16:18:40.665059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.669670Z","title":"Cold decoding: Energy- based constrained text generation with langevin dynamics.Advances in Neural Information Processing Systems, 35:9538–9551, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.669670Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:64635270ebf55664646f17fb68252cfda3786ae4e541c8bba85659db9e477a07","observation_id":"10373a1d-8d46-4e0d-af28-550656ed2934","resolution":{"observed_at":"2026-08-09T16:18:40.669670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05954","last_updated":"2024-11-01T17:46:46Z","snapshot_observed_at":"2026-08-04T17:08:44.629096Z","submitted_at":"2024-06-10T01:21:31Z","title":"Aligning Large Language Models with Representation Editing: A Control Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05954","snapshot_observed_at":"2026-08-09T16:18:40.674151Z","title":"Aligning large language models with representation editing: A control perspective.arXiv preprint arXiv:2406.05954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.674151Z"},"links":{"cited_paper":"/paper/2406.05954","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:553cea0d1abc799404a31a410ca59de6e417d5f7140c411bc55be6be259bbc28","observation_id":"533b95a6-6aa5-4fff-a450-6c09a6dc7d10","resolution":{"observed_at":"2026-08-09T16:18:40.674151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-09T16:18:40.679002Z","title":"Args: Alignment as reward-guided search.arXiv preprint arXiv:2402.01694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.679002Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:bccbb0bd6ca8fc8420f6864efd0aec639da2bfeb5f4c71b59d6ddacc8e3ac993","observation_id":"124f1ebe-35b4-4a99-8e30-73cfad6e3a45","resolution":{"observed_at":"2026-08-09T16:18:40.679002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18853","last_updated":"2024-10-28T03:23:14Z","snapshot_observed_at":"2026-08-01T17:48:42.572440Z","submitted_at":"2024-06-27T02:46:30Z","title":"Decoding-Time Language Model Alignment with Multiple Objectives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18853","snapshot_observed_at":"2026-08-09T16:18:40.683972Z","title":"Decoding-time language model alignment with multiple objectives.arXiv preprint arXiv:2406.18853, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.683972Z"},"links":{"cited_paper":"/paper/2406.18853","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:ce3baafd474804c73f327fa18bccad7707f18e0628d3f484a7304450d30230b1","observation_id":"208bf629-eee1-486a-83d3-f438ff773a75","resolution":{"observed_at":"2026-08-09T16:18:40.683972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.688825Z","title":"Deal: Decoding-time alignment for large language models.arXiv preprint arXiv:2402.06147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.688825Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0c11bae6aa5ad29264bc0086183fbd5fe7a9d836c17a0650c7122368ae17b377","observation_id":"766529f0-d5ea-44f3-9022-4364b48cfb8e","resolution":{"observed_at":"2026-08-09T16:18:40.688825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-09T16:18:40.693492Z","title":"Value augmented sampling for language model alignment and personalization.arXiv preprint arXiv:2405.06639, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.693492Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:8443df0fc127e6f7a9852c25a8f1d277189987877e7433ada1616deb84a08a18","observation_id":"8714e22e-567f-4363-9f27-0c577114942b","resolution":{"observed_at":"2026-08-09T16:18:40.693492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11889","last_updated":"2024-06-17T02:48:21Z","snapshot_observed_at":"2026-08-10T02:18:32.578849Z","submitted_at":"2024-02-19T06:58:42Z","title":"ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11889","snapshot_observed_at":"2026-08-09T16:18:40.699323Z","title":"Rose doesn’t do that: Boosting the safety of instruction-tuned large language models with reverse prompt contrastive decoding.arXiv preprint arXiv:2402.11889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.699323Z"},"links":{"cited_paper":"/paper/2402.11889","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:ee4df6858c9f5167fbf1181c4fe53af187ec934f4553a07c52958620958445cf","observation_id":"123dee81-6968-497b-8966-f3b1c026d33a","resolution":{"observed_at":"2026-08-09T16:18:40.699323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.16743","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:42.051232Z","title":"Adversarial contrastive decoding: Boosting safety alignment of large language models via opposite prompt optimization.arXiv preprint arXiv:2406.16743, 2024","venue":null,"work_id":"d15d2321-cee5-4652-9885-7452bdbc9ffc","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.704343Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:a458323dbec1f07b9e062b5f5eb72cd5c166a04fc0afb86907271a5d89ec2776","observation_id":"5830fdfc-6502-443e-a20d-d3c788e9e189","resolution":{"observed_at":"2026-08-09T16:18:42.059810Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06947","last_updated":"2024-01-13T01:46:20Z","snapshot_observed_at":"2026-08-03T23:32:37.774749Z","submitted_at":"2024-01-13T01:46:20Z","title":"Parameter-Efficient Detoxification with Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06947","snapshot_observed_at":"2026-08-09T16:18:40.709137Z","title":"Parameter-efficient detoxification with contrastive decoding.arXiv preprint arXiv:2401.06947, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.709137Z"},"links":{"cited_paper":"/paper/2401.06947","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:a92995055afae7b766c2644fb6b459c3288a73187475ad80fa98e521c5ea8a23","observation_id":"e17d599a-d879-4a45-9d9f-34a81585f77f","resolution":{"observed_at":"2026-08-09T16:18:40.709137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06809","last_updated":"2025-06-18T02:50:22Z","snapshot_observed_at":"2026-07-06T19:30:21.486298Z","submitted_at":"2024-10-09T12:09:30Z","title":"Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06809","snapshot_observed_at":"2026-08-09T16:18:40.714261Z","title":"Root defence strategies: Ensuring safety of llm at the decoding level.arXiv preprint arXiv:2410.06809, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.714261Z"},"links":{"cited_paper":"/paper/2410.06809","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:346d3ee1d1cf276d56afb4a0f4cdc5b152ee3b0b9104198a3edf41b048a56263","observation_id":"4c174fe1-5db0-4db6-bd00-cded87ecad8d","resolution":{"observed_at":"2026-08-09T16:18:40.714261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-09T16:06:53.947436Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-09T16:18:40.719150Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.719150Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:12dc916ced14fede2e550ab1e3576adfd6e729434379b11030b3aaf767aa938b","observation_id":"92d87873-ae93-4ffb-9f2c-8da28b49f108","resolution":{"observed_at":"2026-08-09T16:18:40.719150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-09T16:18:40.723901Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.723901Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:31fd34a3d3add9a65d8856393d87d8344550d7571643eb99e1a65061ccf9c25b","observation_id":"9faece8a-cb64-4cee-8fae-f19b7dd27043","resolution":{"observed_at":"2026-08-09T16:18:40.723901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10668","last_updated":"2024-08-26T05:27:13Z","snapshot_observed_at":"2026-08-10T11:32:05.515365Z","submitted_at":"2024-08-20T09:11:21Z","title":"Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation","version":3},"cited_work":{"arxiv_id":"2408.10668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10668","snapshot_observed_at":"2026-08-09T16:18:41.908763Z","title":"Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation","venue":"cs.CR","work_id":"c1a3f66d-c3c4-4183-9cba-40b2427b8ad8","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.728371Z"},"links":{"cited_paper":"/paper/2408.10668","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b52e39cfc9d80d723753a812b307dfc6d3493f42a62a532622a73686e9d7754e","observation_id":"f656bf9e-92b7-42a5-bae9-d40de150813e","resolution":{"observed_at":"2026-08-09T16:18:41.914435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.732968Z","title":"Mixture of attentions for speculative decoding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.732968Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:894822fc251fea5ac3ec71c539eea0db1591244c6dc788c7e356d3f43da4e290","observation_id":"1f8db701-1072-47cc-8803-4c7c0730eb18","resolution":{"observed_at":"2026-08-09T16:18:40.732968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-09T16:18:40.737239Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.737239Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:979b3b8a13523394a2a9e6f4d655b9c06fc12ee06804980fac11d4ebc3f3c5f9","observation_id":"651c2a9e-9828-4a4a-bdb5-73a55ba1f21c","resolution":{"observed_at":"2026-08-09T16:18:40.737239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.741644Z","title":"Large language models for robotics: A survey.arXiv preprint arXiv:2311.07226, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.741644Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:7c52493191ed155eeec638f79c1d5ac36fcc7cdbc9132bbe1a5297a547355734","observation_id":"ed3494c6-c7ef-4308-aeb9-2c7b04a6a608","resolution":{"observed_at":"2026-08-09T16:18:40.741644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.746544Z","title":"Leandojo: Theorem proving with retrieval-augmented language models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.746544Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:1a8ddda5b94c66c78ba768cd682f6ca460d28b2cfcac1125a941c30299a47281","observation_id":"7145db43-1cca-4f4d-ab05-92a39914a809","resolution":{"observed_at":"2026-08-09T16:18:40.746544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.751431Z","title":"Solving olympiad geometry without human demonstrations.Nature, 625(7995):476–482, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.751431Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:e0b9acd92d620415dd68dcf9c989b9219e745ab8288518e9ac681badd61c500e","observation_id":"b1b9a395-8e6f-4b0b-a60b-482ac08faa59","resolution":{"observed_at":"2026-08-09T16:18:40.751431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07382","last_updated":"2024-07-29T20:57:44Z","snapshot_observed_at":"2026-07-06T17:58:35.401092Z","submitted_at":"2024-04-10T23:01:45Z","title":"Learn from Failure: Fine-Tuning LLMs with Trial-and-Error Data for Intuitionistic Propositional Logic Proving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07382","snapshot_observed_at":"2026-08-09T16:18:40.756147Z","title":"Learn from failure: Fine-tuning llms with trial-and-error data for intuitionistic propositional logic proving.arXiv preprint arXiv:2404.07382, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.756147Z"},"links":{"cited_paper":"/paper/2404.07382","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d350dd45cea3fa75c5fc32316f9010c64d205a6535cc7e12118a1112b2916f0b","observation_id":"da1743d3-e76f-4297-bd1c-4beeb9758733","resolution":{"observed_at":"2026-08-09T16:18:40.756147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11450","last_updated":"2024-05-31T17:25:38Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T04:16:24Z","title":"Learning to Learn Faster from Human Feedback with Language Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11450","snapshot_observed_at":"2026-08-09T16:18:40.761602Z","title":"Learning to learn faster from human feedback with language model predictive control.arXiv preprint arXiv:2402.11450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.761602Z"},"links":{"cited_paper":"/paper/2402.11450","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:023b9d286c5d55df7901612c884fc806fdf90e61f530cef12a0307476e3ae3e4","observation_id":"9e5ba516-0a06-4f77-9154-6f82a0b8c9c8","resolution":{"observed_at":"2026-08-09T16:18:40.761602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.766715Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.766715Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:343b40695b9339241a923218f44462479453d6f8bfeb86fa8b6ffd07c66b6f8c","observation_id":"5705fb0c-2d13-4b52-80af-c767cd16424e","resolution":{"observed_at":"2026-08-09T16:18:40.766715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-09T16:18:40.771963Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.arXiv preprint arXiv:2406.03816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.771963Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:e43534426d41aaf2469cc55a0133a13dc0f04a8c2fffb2501e54fd03e76284ca","observation_id":"42aaf597-5211-412e-b112-53e20c5aebc7","resolution":{"observed_at":"2026-08-09T16:18:40.771963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01478","last_updated":"2025-01-02T12:09:17Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T12:09:17Z","title":"Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01478","snapshot_observed_at":"2026-08-09T16:18:40.777676Z","title":"Enhancing reason- ing through process supervision with monte carlo tree search.arXiv preprint arXiv:2501.01478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.777676Z"},"links":{"cited_paper":"/paper/2501.01478","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:8a1063e32e0146565bac25c8cbace1cad13ef3570787973be5b504fd4a411544","observation_id":"ac704221-d03e-4dad-b832-cde745c3475e","resolution":{"observed_at":"2026-08-09T16:18:40.777676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.782889Z","title":"Simulation-guided beam search for neural combinatorial optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.782889Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:a0a2ca7f5bdd14f1cade525ddc4ad82f0c01f77bc57f75dfd3fa28d37cd57d0f","observation_id":"bef3432f-ac89-4a0e-9fd2-fcfa2702a5d4","resolution":{"observed_at":"2026-08-09T16:18:40.782889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.788403Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.788403Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:eae455a3563497a5d5eafc90aa33232564ab95e861733c159902c10a8b2f8042","observation_id":"e3d415a0-4764-41cb-812e-69dcc65e9d12","resolution":{"observed_at":"2026-08-09T16:18:40.788403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10069","last_updated":"2025-04-27T08:55:07Z","snapshot_observed_at":"2026-08-10T19:21:20.241421Z","submitted_at":"2025-01-17T09:42:48Z","title":"A Survey on LLM Test-Time Compute via Search: Tasks, LLM Profiling, Search Algorithms, and Relevant Frameworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10069","snapshot_observed_at":"2026-08-09T16:18:40.793196Z","title":"A survey on llm test-time compute via search: Tasks, llm profiling, search algorithms, and relevant frameworks.arXiv preprint arXiv:2501.10069, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.793196Z"},"links":{"cited_paper":"/paper/2501.10069","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:2b6c6ac3b59bea89d0355d8749a447d4d3c77e21243ac3d8dbcbb6a950a0cd50","observation_id":"de7ee1c1-9ed3-4adb-86e6-a016d3d0146e","resolution":{"observed_at":"2026-08-09T16:18:40.793196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.798466Z","title":"Alpaca: A strong, replicable instruction- following model.Stanford Center for Research on Foundation Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.798466Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:26a6466a2af8799e851311983a5403852b7f9e5e6aefd7d4dbc24589a544cf0c","observation_id":"e5619f61-9495-4266-a530-23b98cdca7b0","resolution":{"observed_at":"2026-08-09T16:18:40.798466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.803395Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.803395Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:885801fb3713a9bfbdccefc45270463ec59adf2866b0ca1b23e8ad214ed53351","observation_id":"b7de5c36-f360-4a9f-b87f-ef62f7b04c7d","resolution":{"observed_at":"2026-08-09T16:18:40.803395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T16:18:40.808370Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.808370Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0bb424e2770a52e9fdafd03dc6c7bf69d1380d11ec3d4b5b5c406e2d37db1a84","observation_id":"7d07096d-3017-4fed-b163-1c123b3a5bbc","resolution":{"observed_at":"2026-08-09T16:18:40.808370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-09T16:18:40.813673Z","title":"Pku-saferlhf: A safety alignment preference dataset for llama family models.arXiv preprint arXiv:2406.15513, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.813673Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:c32a6797c6959b9a1f433c30f95d8330e3f8672ca999cfdb5922ddeaad652d7a","observation_id":"e12b652f-af52-4be7-b387-036e5cfe24d3","resolution":{"observed_at":"2026-08-09T16:18:40.813673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10164","last_updated":"2024-09-16T10:54:04Z","snapshot_observed_at":"2026-07-06T19:15:56.947205Z","submitted_at":"2024-09-16T10:54:04Z","title":"Quantile Regression for Distributional Reward Models in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10164","snapshot_observed_at":"2026-08-09T16:18:40.819124Z","title":"Quantile regression for distributional reward models in rlhf.arXiv preprint arXiv:2409.10164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.819124Z"},"links":{"cited_paper":"/paper/2409.10164","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:c6a5c998b47c2ae1e9b3c024e40ba6da5f9adaa5b22f36b61a65652bd0518083","observation_id":"5d4c7c56-409a-4a5e-9726-ca7b20976493","resolution":{"observed_at":"2026-08-09T16:18:40.819124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.824171Z","title":"CRC Press, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.824171Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:a399363edc918175515887b852707ab58854c6a4fb1c83884451d9529fdf2d7a","observation_id":"0869e124-9f78-413a-82c8-6378656a10ec","resolution":{"observed_at":"2026-08-09T16:18:40.824171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.829059Z","title":"Safe exploration in finite markov decision processes with gaussian processes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.829059Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:63e63f6da212a70e203fb1cf4a01acd0b9e4b6183561c28dccdda037a4b1da05","observation_id":"5b182e98-1916-42fa-bce7-c4ad533480d6","resolution":{"observed_at":"2026-08-09T16:18:40.829059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.834159Z","title":"Learning-based model predictive control for safe exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.834159Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:7ad15d5114dd6b3779ba3bed6a1e51465ac7895b7cb1aa108b3536e8abe78555","observation_id":"1bf01d93-0d87-42ce-a967-2632b8e3c341","resolution":{"observed_at":"2026-08-09T16:18:40.834159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.839073Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.839073Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:83ddcaf684a137c44d7a434b1d4f54c36acc3c40299757bd8ba44118836bdd73","observation_id":"6c6c3dfd-6153-4bda-ab02-ec7d776a2e50","resolution":{"observed_at":"2026-08-09T16:18:40.839073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.844031Z","title":"Safe exploration and optimization of constrained mdps using gaussian processes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.844031Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d5b61bc7078bf8056f3cc2a2dc523ce847c9eb58d4be3983bab7b65b0dbda715","observation_id":"5634e76d-a329-41bf-bd30-0d3f27d24f45","resolution":{"observed_at":"2026-08-09T16:18:40.844031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.849005Z","title":"Conservative safety critics for exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.849005Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:78f133b00397814f5de83688f92230d18cde12687e95ee933a9704cc3d3241c2","observation_id":"c1d9e1c2-9de4-4dca-b490-7b4ede335b4e","resolution":{"observed_at":"2026-08-09T16:18:40.849005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.853910Z","title":"Lyapunov-based safe policy optimization for continuous control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.853910Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:a4fe6e4b7f77a3151ee970242a60a37e49b018a4011d45df3bcb8b81c2d2b3dc","observation_id":"0d2d19ca-97bd-4922-9920-8a2271f945fb","resolution":{"observed_at":"2026-08-09T16:18:40.853910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-09T16:18:40.859342Z","title":"Lyapunov-based safe policy optimization for continuous control.arXiv preprint arXiv:1901.10031, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.859342Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:4925770caf6a65dd6ab525fd5203d6ba21ed90aab81d777b71b1dbc31b2dad35","observation_id":"64b53dcf-dbfb-4ebb-85cc-673393c5aa59","resolution":{"observed_at":"2026-08-09T16:18:40.859342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.864852Z","title":"Safe model- based reinforcement learning with stability guarantees","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.864852Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b2f4ac5d8d16aba50bb06125811120dde43fae328058a7e4417d2cf5dee5ea0a","observation_id":"95d7b4cf-1ca3-4cdc-ab9a-8240afb01643","resolution":{"observed_at":"2026-08-09T16:18:40.864852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.869206Z","title":"Barrier-certified adaptive reinforcement learning with applications to brushbot navigation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.869206Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:f206a1af290a86b2acee09d191480b832f541152a57c9c810e01c594aa095b28","observation_id":"ac53c036-895a-4b39-9feb-c7b3807c3c44","resolution":{"observed_at":"2026-08-09T16:18:40.869206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.873885Z","title":"End-to-end safe reinforcement learning through barrier functions for safety-critical continuous control tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.873885Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:0e8c1c7715f4f910d7f295310624dfd576d28c146efea5874db5b0b89d21decd","observation_id":"7d4be5b3-756c-43d3-8f69-6bf505e44aab","resolution":{"observed_at":"2026-08-09T16:18:40.873885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.878073Z","title":"Reachability-based safe learning with gaussian processes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.878073Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:bf19506146818c101144009155e15535477b509ad0aed5481d154e9e09114514","observation_id":"4ae5cb98-1c8d-4ab4-b423-a7668f7417e0","resolution":{"observed_at":"2026-08-09T16:18:40.878073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.882265Z","title":"Safeguarding resource- constrained cyber-physical systems with adaptive control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.882265Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:027196386b8dc4f11a8129bb7aa1bc4f46b32db5a96f513822b0188e3541e546","observation_id":"ef3f6ca5-4277-4b1d-8799-272cf280e262","resolution":{"observed_at":"2026-08-09T16:18:40.882265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.886651Z","title":"Bridging model-based safety and model-free reinforcement learning through system identification and safety-critical control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.886651Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:d1599996764a86923fd31e4cd1eeef1ce20d1cad2e1104a08fb6707af26d6826","observation_id":"6696e5ab-2224-4843-b2df-141817be418d","resolution":{"observed_at":"2026-08-09T16:18:40.886651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.890979Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.890979Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:760af1c9bc1e8109fd96e916ebdb180b8d516373314d4f295ed63982fc1c5785","observation_id":"8ab2b39d-5b6a-4d8f-9c07-73f538ae03a1","resolution":{"observed_at":"2026-08-09T16:18:40.890979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.895451Z","title":"Responsive safety in reinforcement learning by monitoring risk and adapting policies","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.895451Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:bc055fe372254637a06d61f5ed800aadd4e716d10441c19ee458f4b27a034bf3","observation_id":"8ef6e941-b931-4824-9cb7-770e74557421","resolution":{"observed_at":"2026-08-09T16:18:40.895451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.899713Z","title":"Relative value learning for constrained reinforce- ment learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.899713Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:dd257c11fa76a539c06da14000cfd527dec64570aef09d456ccb5fcfa1b67ab4","observation_id":"50a8bd5b-4ba4-4050-bcad-7497e9c4a49a","resolution":{"observed_at":"2026-08-09T16:18:40.899713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.904474Z","title":"Natural policy gradient for safe reinforcement learning with c-mdps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.904474Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:67003bd045f6f6fe47a3fcc62f26a1aff96262430a779b3445d5916e5d82b30c","observation_id":"1aaaa581-e9b4-4bb2-a00b-f002d65c6940","resolution":{"observed_at":"2026-08-09T16:18:40.904474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20304","last_updated":"2024-05-30T17:50:04Z","snapshot_observed_at":"2026-08-04T05:00:56.526394Z","submitted_at":"2024-05-30T17:50:04Z","title":"Group Robust Preference Optimization in Reward-free RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20304","snapshot_observed_at":"2026-08-09T16:18:40.909170Z","title":"Group robust preference optimization in reward- free rlhf.arXiv preprint arXiv:2405.20304, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.909170Z"},"links":{"cited_paper":"/paper/2405.20304","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:c6d8fce18c3b0e2eb8f30d017f56a884582d6a81b981f98a35435cae65b5beb1","observation_id":"5f4be3f3-1c0b-4456-b84c-0429c3c7a294","resolution":{"observed_at":"2026-08-09T16:18:40.909170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01420","last_updated":"2024-08-02T17:55:50Z","snapshot_observed_at":"2026-08-10T05:32:13.282913Z","submitted_at":"2024-08-02T17:55:50Z","title":"Mission Impossible: A Statistical Perspective on Jailbreaking LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01420","snapshot_observed_at":"2026-08-09T16:18:40.914123Z","title":"Mission impossible: A statistical perspective on jailbreaking llms.arXiv preprint arXiv:2408.01420, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.914123Z"},"links":{"cited_paper":"/paper/2408.01420","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:fd23d971d8642a6e311be06f202f852931ea9b21f29fa7ba78d5201d2e929073","observation_id":"ced521c4-6a4b-4a5f-a0ec-90a99883d58a","resolution":{"observed_at":"2026-08-09T16:18:40.914123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.919238Z","title":"Improving llm safety alignment with dual-objective optimization.arXiv preprint arXiv:2503.03710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.919238Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:cff4b27e407bd3e502ceedee6c44000314913d59ea5614ade2925f6c2f8409d8","observation_id":"f4af410e-f2c1-4553-8007-fda5028b0cf7","resolution":{"observed_at":"2026-08-09T16:18:40.919238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11801","last_updated":"2024-10-28T17:30:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:48:13Z","title":"Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11801","snapshot_observed_at":"2026-08-09T16:18:40.934070Z","title":"Safety arithmetic: A framework for test-time safety alignment of language models by steering parameters and activations.arXiv preprint arXiv:2406.11801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.934070Z"},"links":{"cited_paper":"/paper/2406.11801","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:5afcce3073fb224715cbb6c9ba3e88025b613338841ada7d316b5d280e150f40","observation_id":"cba5d427-4d84-4a84-a1c6-7d81a20c60d7","resolution":{"observed_at":"2026-08-09T16:18:40.934070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.939000Z","title":"On prompt-driven safeguarding for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.939000Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:1646896f84e68132cf8717512716758ac62ed2c00f18ee8ecc6bd220bbf1085e","observation_id":"ca5bb15d-04cd-456c-8255-defec97a947e","resolution":{"observed_at":"2026-08-09T16:18:40.939000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17922","last_updated":"2025-02-09T03:34:47Z","snapshot_observed_at":"2026-08-08T18:31:40.634784Z","submitted_at":"2024-10-23T14:40:37Z","title":"Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.17922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.17922","snapshot_observed_at":"2026-08-09T16:18:41.469587Z","title":"Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models","venue":"cs.AI","work_id":"3932a818-8b96-4f70-88b9-084999318de1","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.944028Z"},"links":{"cited_paper":"/paper/2410.17922","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:cc74e4d76747cf8708eb6557dc4c1d9ca1450f09e3e4810203be944bed4b70c3","observation_id":"834e3454-ed9c-4937-b478-b541885fde2f","resolution":{"observed_at":"2026-08-09T16:18:41.475394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-10T19:41:48.737592Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-09T16:18:40.949223Z","title":"Safety alignment should be made more than just a few tokens deep.arXiv preprint arXiv:2406.05946, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.949223Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:22d8da9d27b3576c9ddf54ffeaf19c26464c1635af75c6a83bf34805a60d5a2c","observation_id":"9bf19622-0f6e-4d67-9f43-8ab2e04fed6c","resolution":{"observed_at":"2026-08-09T16:18:40.949223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-09T16:18:40.954512Z","title":"Shaping the safety bound- aries: Understanding and defending against jailbreaks in large language models.arXiv preprint arXiv:2412.17034, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.954512Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:47cd41959759c38b4c86d5b48606bef23007866681b51ead84b00095918bc77b","observation_id":"a7ec959a-c7c2-4bb0-bdc7-2514815d82f6","resolution":{"observed_at":"2026-08-09T16:18:40.954512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07672","last_updated":"2024-12-10T17:02:28Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T17:02:28Z","title":"FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07672","snapshot_observed_at":"2026-08-09T16:18:40.959416Z","title":"Flexllm: Exploring llm customization for mov- ing target defense on black-box llms against jailbreak attacks.arXiv preprint arXiv:2412.07672, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.959416Z"},"links":{"cited_paper":"/paper/2412.07672","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:881e173b26dc6c33ee41367309efc43139dbb3ca60524e4aa3705f12f7b6dca2","observation_id":"bdbb141f-9b63-42cf-95ec-a002ad5818ce","resolution":{"observed_at":"2026-08-09T16:18:40.959416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:18:40.964386Z","title":"Chain-of-detection enables robust and efficient jailbreak defense","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.964386Z"},"links":{"citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:19e2882874ddd7194a747f64ba317c2ee7f0dafc5166011303997b278c934548","observation_id":"e6d9fe43-9f48-4960-bd25-9b2c985a3985","resolution":{"observed_at":"2026-08-09T16:18:40.964386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08924","last_updated":"2024-08-22T17:21:34Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T14:51:32Z","title":"Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":"2408.08924","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08924","snapshot_observed_at":"2026-08-09T16:18:41.394681Z","title":"Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks","venue":"cs.CR","work_id":"555b8d5b-92bb-4757-b6f4-0b731251f3ed","year":2024},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.969178Z"},"links":{"cited_paper":"/paper/2408.08924","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:9cb85b725c840b8888e8aacb6dedcc489cee25387be3116d716245d028be7233","observation_id":"7f5930cc-e48e-4a7f-99cc-629663c6796f","resolution":{"observed_at":"2026-08-09T16:18:41.400163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 1 inbound Pith citation observation for arXiv:2502.01208."}