{"as_of":"2026-08-10T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6930d1d5c133fcd944dc2a362d6c38698889313d613b088edcb36fdb66047dab","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:09:41.587858Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06807/citation-record","integrity":"/paper/2509.06807/integrity","json":"/paper/2509.06807/citation-record.json","paper":"/paper/2509.06807"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.073888Z","title":"Mogu: A framework for enhancing safety of llms while preserving their usability,","venue":null,"work_id":"ac362c88-39dc-4aa2-8ef3-5fca3356ebe3","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.412785Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:d1e18671451223cb8829fdd10aec7b1d10049c86af58307332f1048fe10d0240","observation_id":"9dc5398e-f585-4da2-9d83-c20d7a04e93f","resolution":{"observed_at":"2026-08-04T23:09:42.077038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.418878Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.418878Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:87ace5b7aa6388a7d3d72c9b5ddeda60cf2fbd37f15413ee8bc8bd4e98d323fc","observation_id":"4bb66a28-3120-4825-b8da-f5254d3cd532","resolution":{"observed_at":"2026-08-04T23:09:41.418878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T23:09:41.421041Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.421041Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:83a3eb2f3766239dbc64c5e21442c446e322fd06917372c7ac419ec6778a4f45","observation_id":"a1558a58-a354-443b-b40a-f503ba477256","resolution":{"observed_at":"2026-08-04T23:09:41.421041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-04T23:09:41.423390Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.423390Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7b568fa9167ae982878ce8760e661c9410b633a1c371d98f837880bd34faf6ee","observation_id":"edc29ab5-a9a5-4367-a3c0-04ee523c00e2","resolution":{"observed_at":"2026-08-04T23:09:41.423390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-04T23:09:41.426641Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.426641Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:62287a55a3662327f0d09dec1035811d47c8ae79ed6c9f84ba6e5bb6f82356d3","observation_id":"7c0d83d0-d2b6-471f-a4a5-fae1eb0f28cd","resolution":{"observed_at":"2026-08-04T23:09:41.426641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04265","last_updated":"2024-11-07T14:23:51Z","snapshot_observed_at":"2026-07-06T16:03:54.971351Z","submitted_at":"2023-08-08T14:03:08Z","title":"FLIRT: Feedback Loop In-context Red Teaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04265","snapshot_observed_at":"2026-08-04T23:09:41.429359Z","title":"Flirt: Feedback loop in-context red teaming,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.429359Z"},"links":{"cited_paper":"/paper/2308.04265","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:94685fb66b2dd2988210df4dc0e552fc6492a30060f7030f85025fde5c96adef","observation_id":"dc764439-8a44-4e88-95b7-ec1d378ff20f","resolution":{"observed_at":"2026-08-04T23:09:41.429359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-09T16:06:53.947436Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-04T23:09:41.432374Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.432374Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:85e6e31bbd878b75cb046a2365ea8f037531a821bf0fc93357686948db2a75f2","observation_id":"403519d2-2a8b-4bc2-8ae3-e9693caa9657","resolution":{"observed_at":"2026-08-04T23:09:41.432374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13457","last_updated":"2024-05-17T05:00:24Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T01:26:39Z","title":"A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13457","snapshot_observed_at":"2026-08-04T23:09:41.435223Z","title":"Llm jailbreak at- tack versus defense techniques–a comprehensive study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.435223Z"},"links":{"cited_paper":"/paper/2402.13457","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:87df5f16227dc00063f2606709b47657b74079af3b33da7b654f2cf0b78ef979","observation_id":"ead34801-dcd9-434d-b7cf-10580f06e3e0","resolution":{"observed_at":"2026-08-04T23:09:41.435223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.060001Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":"e6d86131-90cf-40ba-80ca-e4d1191778da","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.437938Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1354431fadd5776c17e0923d8d757adbb18025d30783a0dd48b1103f4fab93bb","observation_id":"12cedbfb-1706-4921-8499-8150a0757aaa","resolution":{"observed_at":"2026-08-04T23:09:42.063715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.440287Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.440287Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1c60b2931c4716c6a8f5249ed7f7d1e57d0b87a60fbc32232865f887586ec625","observation_id":"02db291a-5a5d-4e42-af66-a501dd18c588","resolution":{"observed_at":"2026-08-04T23:09:41.440287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-04T23:09:41.442984Z","title":"Jail- break attacks and defenses against large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.442984Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:9e5d9c8358ebeea60ce82e8130712881ebed96f9727487c2d8f015d1566dd6e2","observation_id":"fb86b84a-ac4c-4939-9349-a3745d597338","resolution":{"observed_at":"2026-08-04T23:09:41.442984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.046246Z","title":"A comprehensive study of jailbreak attack versus defense for large language models,","venue":null,"work_id":"47900fd5-e429-4e4e-959f-4ed6c0bf6bad","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.445835Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4495bb60fe90e1f2730f932afb5fdfc7fb5d7a790c3a35e5ad0029e286929531","observation_id":"262bc832-9a17-474f-8b41-3324f2f1f943","resolution":{"observed_at":"2026-08-04T23:09:42.050203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T23:09:41.448210Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.448210Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:229d47bd466a962f98f6489175118912272c46e09e10ef123c9ae9a5e59048b6","observation_id":"8f4adb80-c946-4fdf-a9cc-2de908f44f53","resolution":{"observed_at":"2026-08-04T23:09:41.448210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-04T23:09:41.450991Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.450991Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e410f80fc0f5f874de477f5141880b324e6dac139409c8f7d9a02d3ee71f5570","observation_id":"ce4ffc35-5ad8-47fc-81f3-d207b73311b6","resolution":{"observed_at":"2026-08-04T23:09:41.450991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-07T21:21:24.962049Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-04T23:09:41.453737Z","title":"Survey of vulnerabilities in large language models revealed by adversarial attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.453737Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:33f648dfc5df3470ec73d0649df8575215e739563852613ef15cb4959ebf2124","observation_id":"6c917c07-f06e-4e09-9d7a-21b822e1d425","resolution":{"observed_at":"2026-08-04T23:09:41.453737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04127","last_updated":"2024-02-23T07:32:27Z","snapshot_observed_at":"2026-08-09T10:09:53.270264Z","submitted_at":"2023-12-07T08:29:58Z","title":"Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04127","snapshot_observed_at":"2026-08-04T23:09:41.456061Z","title":"Analyzing the inherent response tendency of llms: Real-world instructions-driven jailbreak,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.456061Z"},"links":{"cited_paper":"/paper/2312.04127","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:560e59b7fe7953b16bf5845ab2c8730ca2e2d9a83af9e640a814b0a6ac6baac7","observation_id":"af156b49-2e8e-48a1-b665-2b82b8b86dd3","resolution":{"observed_at":"2026-08-04T23:09:41.456061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09324","last_updated":"2024-11-06T04:43:57Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T17:01:40Z","title":"Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs","version":3},"cited_work":{"arxiv_id":"2406.09324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09324","snapshot_observed_at":"2026-08-04T23:09:41.892621Z","title":"Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs","venue":"cs.CR","work_id":"25fcaa0b-992e-47fc-b230-743a875da20f","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.458494Z"},"links":{"cited_paper":"/paper/2406.09324","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1fc67355f086140dd07185a55c4513a1da4a3173ad564f39495878c253cfe194","observation_id":"3d039875-38b8-4456-ac5f-702912bac0dd","resolution":{"observed_at":"2026-08-04T23:09:41.896274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-04T23:09:41.460875Z","title":"Harmful fine- tuning attacks and defenses for large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.460875Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6a0ff6739564b670920a92a5bd478c0f80b7d22e12adda6caf55d151a10f99c2","observation_id":"12afa9f2-8495-4ea5-a717-ffd7c39d6a48","resolution":{"observed_at":"2026-08-04T23:09:41.460875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04524","last_updated":"2025-02-17T02:32:33Z","snapshot_observed_at":"2026-08-09T21:22:38.867026Z","submitted_at":"2024-10-06T15:34:04Z","title":"Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04524","snapshot_observed_at":"2026-08-04T23:09:41.463474Z","title":"Towards secure tuning: Mitigating security risks arising from benign instruction fine-tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.463474Z"},"links":{"cited_paper":"/paper/2410.04524","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:b7b994d18a817d4014a38688e3b2c500327c1b6bf082c183b03981adc13ce0d2","observation_id":"0a575274-5666-4764-9913-0df741e67ef7","resolution":{"observed_at":"2026-08-04T23:09:41.463474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T23:09:41.465759Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.465759Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:61248fdda8cb8f2ec03312049e1dba51bdb6f94f92e50a417c5a5c1a37851776","observation_id":"98df20ed-9ab8-4277-9bf6-30125ef8485f","resolution":{"observed_at":"2026-08-04T23:09:41.465759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.037350Z","title":"A holistic approach to undesired content detection in the real world,","venue":null,"work_id":"29de3994-6fd9-474f-a83d-f3f213ebfa4f","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.468117Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:afd82b9edc3d985d284f8e7d7948cf37606dff9cfff310d57b43c80eb002e75e","observation_id":"f161f21a-9365-4361-ab7b-725b7b14fb53","resolution":{"observed_at":"2026-08-04T23:09:42.040961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-04T23:09:41.470662Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.470662Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4d22f8f495024ca95981c1777d0b605d8332af8c3b01f516bedaf797fd2b389f","observation_id":"881ed3e0-8875-48cf-a485-a295d796bf27","resolution":{"observed_at":"2026-08-04T23:09:41.470662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-04T23:09:41.473339Z","title":"Certifying llm safety against adversarial prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.473339Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:08d761004b58db8d9296c079d72b491e278e6f7696e3b16185f01f942bdc7e70","observation_id":"1eebe795-ea34-4255-a580-d7a0b4b0d66b","resolution":{"observed_at":"2026-08-04T23:09:41.473339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.475614Z","title":"Lightweight safety guardrails using fine-tuned bert embeddings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.475614Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e662aa5db417078fe9c89a252cf5fe02470efd125db1a4d92506bbc7079efa59","observation_id":"8b5417fd-5bef-4bc5-8652-0547f8590e12","resolution":{"observed_at":"2026-08-04T23:09:41.475614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-04T23:09:41.478401Z","title":"Safede- coding: Defending against jailbreak attacks via safety-aware decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.478401Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e4267d4ebe1ca991355a9c995133118efde6cd1b4070a110a371e703c3863adb","observation_id":"0986a88f-38f8-4ea1-9def-a33b45ba276e","resolution":{"observed_at":"2026-08-04T23:09:41.478401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17633","last_updated":"2024-01-31T07:26:47Z","snapshot_observed_at":"2026-08-05T14:33:09.669272Z","submitted_at":"2024-01-31T07:26:47Z","title":"Navigating the OverKill in Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.17633","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.17633","snapshot_observed_at":"2026-08-04T23:09:41.837038Z","title":"Navigating the OverKill in Large Language Models","venue":"cs.CL","work_id":"aa27e9a4-951d-4438-9c68-a47cb024218d","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.480864Z"},"links":{"cited_paper":"/paper/2401.17633","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:08b7299bd2ee8ff0ff772fab79301bc0a7ebbeaf5f45de18897ee0ee144e3220","observation_id":"e3c0882b-84ae-4945-a51d-c351a28d9757","resolution":{"observed_at":"2026-08-04T23:09:41.840571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-08-10T01:00:48.523678Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-04T23:09:41.483523Z","title":"Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.483523Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:556c1b2ec08c157e37e4448b0e61c7c73602130c63f006b8586f48cb5f0b3010","observation_id":"10a3c887-315a-40de-a43f-b04723e1dbe2","resolution":{"observed_at":"2026-08-04T23:09:41.483523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01586","last_updated":"2025-03-17T17:17:16Z","snapshot_observed_at":"2026-08-05T01:27:27.177475Z","submitted_at":"2024-09-03T03:59:22Z","title":"Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01586","snapshot_observed_at":"2026-08-04T23:09:41.485922Z","title":"Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.485922Z"},"links":{"cited_paper":"/paper/2409.01586","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e20d587a14a22a9c4361c2d2ad05503942e7a22277221c9c57faf27df73c5664","observation_id":"8cfb6400-5c9e-4148-bcae-beb5aafdf18e","resolution":{"observed_at":"2026-08-04T23:09:41.485922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-01T14:23:46.782297Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-04T23:09:41.488370Z","title":"Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.488370Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:cdf1477b98af60c46c96fd1c38183ad60f541fbd73aa38ef7650e0a10cf63f0b","observation_id":"3b83ca1f-1e85-426b-b604-e817fe22386e","resolution":{"observed_at":"2026-08-04T23:09:41.488370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-07-31T00:03:11.135660Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-04T23:09:41.491116Z","title":"Safe lora: the silver lining of reducing safety risks when fine-tuning large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.491116Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:df84eaeb703ce702ccc379604ed46407d3ff3874612bff131de6e8b3092bf5a7","observation_id":"ef3557ae-8039-45ce-8b44-83a2979f2965","resolution":{"observed_at":"2026-08-04T23:09:41.491116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-04T23:09:41.493535Z","title":"A survey on mixture of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.493535Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:0b2c784357b8071f1fc02b7d96d18fad04af77976207e6f68237a5a583eee0ac","observation_id":"d0abc586-af39-432a-8053-36a2ccc3571d","resolution":{"observed_at":"2026-08-04T23:09:41.493535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.495912Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.495912Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a2d5f7be759b090e9e4cec03e3a0c0e23f081186f4bada5e11d182b2a7a74c17","observation_id":"4632282d-a94f-4fc2-b241-76f34871da81","resolution":{"observed_at":"2026-08-04T23:09:41.495912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-04T23:09:41.498475Z","title":"Open- moe: An early effort on open mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.498475Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:77308af7e1e6f06d9de19612ca2c175b720692d9a49684559b24346612cebd1c","observation_id":"8371582d-84ec-4ec6-b30c-437d0b14014e","resolution":{"observed_at":"2026-08-04T23:09:41.498475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05644","last_updated":"2024-06-13T05:39:31Z","snapshot_observed_at":"2026-08-04T01:38:16.363370Z","submitted_at":"2024-06-09T05:04:37Z","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05644","snapshot_observed_at":"2026-08-04T23:09:41.500858Z","title":"How alignment and jailbreak work: Explain llm safety through intermediate hidden states,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.500858Z"},"links":{"cited_paper":"/paper/2406.05644","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:2f672fb442297215b5b0dd85556d1aaee2adb78457b274c52569b47fcfcf3a89","observation_id":"a6e098f9-c354-479b-b8f2-9964ef0d3085","resolution":{"observed_at":"2026-08-04T23:09:41.500858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-04T23:09:41.503307Z","title":"Red teaming language models with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.503307Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:72d7edf82e4cedfde6d2934eaa6d7a8c40c71be3f6776f325674416cec4bea46","observation_id":"d9becc34-a79c-413b-b080-229bd19f3777","resolution":{"observed_at":"2026-08-04T23:09:41.503307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-04T23:09:41.505782Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.505782Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:fe96b1184f770d8794df6b9dfd51b346aea01bf6236c8f50a3df71817803ced6","observation_id":"426a32ea-c602-491d-9fc6-da5b8952a489","resolution":{"observed_at":"2026-08-04T23:09:41.505782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:09:41.508015Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.508015Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:beab43367ab36931e80906eea4752584461221950af70cfe586cbdfd510f41c0","observation_id":"5f56caf1-de30-425d-a0ec-e7d7fabde360","resolution":{"observed_at":"2026-08-04T23:09:41.508015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-04T23:09:41.510729Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.510729Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f54f8025dfd22479228604b6e608a637b1d495c8a2643316f08b699646e7f862","observation_id":"9fe51abf-e933-4e20-802a-28412b67252e","resolution":{"observed_at":"2026-08-04T23:09:41.510729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-04T23:09:41.513177Z","title":"Trustworthy llms: a survey and guide- line for evaluating large language models’ alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.513177Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7e27dd9fef9d99b5872e069c8a53eb447c0883fb8555d83157f169f091800f20","observation_id":"64bd5f15-fa7e-4f0d-b2ed-e26b626adbd3","resolution":{"observed_at":"2026-08-04T23:09:41.513177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-10T03:24:28.404754Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-04T23:09:41.515431Z","title":"Cold-attack: Jail- breaking llms with stealthiness and controllability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.515431Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e7ca652680e393710f7aae53b5c8b9531e7457ae3a56117938d851ac487f97a0","observation_id":"c6ba4a17-9d7e-4a19-8b37-598ca4bf46c7","resolution":{"observed_at":"2026-08-04T23:09:41.515431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.517713Z","title":"Jailbroken: How does llm safety training fail?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.517713Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:658ecfe5c77ed34d9fb4a0e88205897e8101be7f26abff0236039f7cd7525518","observation_id":"fef8e249-e825-45c4-9063-a5adb4df700e","resolution":{"observed_at":"2026-08-04T23:09:41.517713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.019429Z","title":"Automatically auditing large language models via discrete optimization,","venue":null,"work_id":"34218c8a-ae61-4ed5-87c1-76d9d88547df","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.520081Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:dc02360c653320e52c60c84ac5244a6471da3e45b105c34ab73e0674cffedf2f","observation_id":"fe644a2a-601f-4f18-b136-82dca3400e09","resolution":{"observed_at":"2026-08-04T23:09:42.023516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15690","last_updated":"2024-02-24T02:27:55Z","snapshot_observed_at":"2026-08-04T20:02:09.278590Z","submitted_at":"2024-02-24T02:27:55Z","title":"Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15690","snapshot_observed_at":"2026-08-04T23:09:41.522170Z","title":"Foot in the door: Understanding large language model jailbreaking via cognitive psychology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.522170Z"},"links":{"cited_paper":"/paper/2402.15690","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:92bc8ed03a1456806edeb46832f9ce9598fdaca3941f683927f1f9ee3af39d9e","observation_id":"a6efadde-989c-4147-8d82-5b3e79debe8b","resolution":{"observed_at":"2026-08-04T23:09:41.522170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05733","last_updated":"2023-02-11T15:57:44Z","snapshot_observed_at":"2026-08-10T03:15:15.284134Z","submitted_at":"2023-02-11T15:57:44Z","title":"Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05733","snapshot_observed_at":"2026-08-04T23:09:41.524212Z","title":"Exploiting programmatic behavior of llms: Dual-use through standard security attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.524212Z"},"links":{"cited_paper":"/paper/2302.05733","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a120d8ade94eacb97a6917a53d39911cf194497c7fc6c508ad33615b49ed502f","observation_id":"efbff674-42ba-4754-b406-ece032bb95c6","resolution":{"observed_at":"2026-08-04T23:09:41.524212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-04T23:09:41.526476Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.526476Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:cae8a482f594eeb40ff405046d0e7d4a55c3daf0ec3d85d55258cdfe3fea057b","observation_id":"8277e1ce-0848-4875-b947-5de95d990291","resolution":{"observed_at":"2026-08-04T23:09:41.526476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-04T23:09:41.528615Z","title":"Jailbreaking black box large language models in twenty queries,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.528615Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:13afa228ac1b5ebf5a6f709e7112948dc991cdc70dbdb93708eed8b1a5b2f8f9","observation_id":"7fed6c88-2376-428a-bba4-3f70b0047335","resolution":{"observed_at":"2026-08-04T23:09:41.528615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:09:41.530996Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.530996Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7fa2037779446ec9534a063af21e71a775f66249e045685df7be1126c477d926","observation_id":"60840032-8432-4455-8d31-8136cb96982e","resolution":{"observed_at":"2026-08-04T23:09:41.530996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.533142Z","title":"A survey on large language model (llm) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.533142Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:d07ce9b0b86574c96fdb8a9637f55c56e4b7e0d2f6c32ba719db340fa02f95e5","observation_id":"0746e8d6-ca2d-490b-bf08-d3c599108cad","resolution":{"observed_at":"2026-08-04T23:09:41.533142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.535213Z","title":"Defending chatgpt against jailbreak attack via self-reminder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.535213Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:2f06e3a1f1f28f603c47faa9c293f93b6d7cde7e34688fb8a021dd52a58307ce","observation_id":"1a343dbb-5ea4-4ee0-8f64-0f9446a2b4ad","resolution":{"observed_at":"2026-08-04T23:09:41.535213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-04T23:09:41.537604Z","title":"Baseline defenses for adversarial attacks against aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.537604Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:62f15443261d3f39bd294c4e3193c38fddd9a83876354e3a35cc2a03d2f9850d","observation_id":"6b551ba0-8dcc-4009-9481-9a872dae0065","resolution":{"observed_at":"2026-08-04T23:09:41.537604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07308","last_updated":"2024-05-02T14:28:39Z","snapshot_observed_at":"2026-08-01T14:42:09.926151Z","submitted_at":"2023-08-14T17:54:10Z","title":"LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07308","snapshot_observed_at":"2026-08-04T23:09:41.540879Z","title":"Llm self defense: By self examination, llms know they are being tricked,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.540879Z"},"links":{"cited_paper":"/paper/2308.07308","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:d937b77c0b2be07220a885ab6aba40e5da6e3b0508fccf118050f50c5ebe19bd","observation_id":"41b7dcb4-1a29-42f4-825f-7e6bcf4fb978","resolution":{"observed_at":"2026-08-04T23:09:41.540879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T23:09:41.543359Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.543359Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:b20315501aeb9a999273668b204eac33b0b404ee0396655c0b6a7766bd4dab25","observation_id":"27d14d86-01b1-421c-a413-6a07a1aa0db2","resolution":{"observed_at":"2026-08-04T23:09:41.543359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-08-09T03:34:24.233039Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-04T23:09:41.545861Z","title":"Your mixture-of-experts llm is secretly an embed- ding model for free,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.545861Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4f39b5d4dc5f4387a35662ea4540efb67e14bdb0860b69c76cc7a411e4002bbc","observation_id":"16c5c855-997c-46f1-a7ea-85d38f328d70","resolution":{"observed_at":"2026-08-04T23:09:41.545861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18219","last_updated":"2025-06-21T07:56:18Z","snapshot_observed_at":"2026-08-02T07:28:14.092271Z","submitted_at":"2024-06-26T10:07:57Z","title":"A Closer Look into Mixture-of-Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18219","snapshot_observed_at":"2026-08-04T23:09:41.548125Z","title":"A closer look into mixture-of-experts in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.548125Z"},"links":{"cited_paper":"/paper/2406.18219","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:5e77cc3d36f992276ea2f85aa7f01bfd796b66679bf56baa0b457e0151a4bfc1","observation_id":"10d452d0-ad48-457a-9e2f-2a8516dd405b","resolution":{"observed_at":"2026-08-04T23:09:41.548125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07799","last_updated":"2019-08-08T06:58:31Z","snapshot_observed_at":"2026-07-06T07:54:02.817335Z","submitted_at":"2019-05-19T19:43:14Z","title":"Adaptive Attention Span in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07799","snapshot_observed_at":"2026-08-04T23:09:41.550995Z","title":"Adaptive attention span in transformers,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.550995Z"},"links":{"cited_paper":"/paper/1905.07799","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f888e7e3692791a1ecfebaac04d221db80990c9300c32d8172c0f94a67f17f0d","observation_id":"5381ff8e-c8a9-4738-95c8-afc06896dcd8","resolution":{"observed_at":"2026-08-04T23:09:41.550995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05364","last_updated":"2025-03-05T04:18:08Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T05:45:42Z","title":"Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models","version":2},"cited_work":{"arxiv_id":"2406.05364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05364","snapshot_observed_at":"2026-08-04T23:09:41.674899Z","title":"Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models","venue":"cs.CR","work_id":"d597bde5-6e2e-4913-a9cd-de266156c8b1","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.554098Z"},"links":{"cited_paper":"/paper/2406.05364","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e8790e641b3caa93e1f09b1ab211827d3b2190cfe35ccdbdc39e83a920883013","observation_id":"3e54ab47-115d-4f55-8f27-43baeb65ec61","resolution":{"observed_at":"2026-08-04T23:09:41.679537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.556460Z","title":"The hidden risks of large reasoning models: A safety assessment of r1,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.556460Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e8835c52789d1d3e0d59c29912570cac682177ae836c2bc972a6f59bda892a3e","observation_id":"236bfd5a-4043-4a69-9b94-c05979f94c3b","resolution":{"observed_at":"2026-08-04T23:09:41.556460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.001028Z","title":"Falcon-40B: an open large language model with state-of-the-art performance,","venue":null,"work_id":"81c6f1ba-b6f6-43e6-983c-892cbfb33dfb","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.558613Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:cfd078ff002341c01fbc4729ffe836d06e3d0b1ead17e37c8d778b5c884f9a6b","observation_id":"3817d6ae-1a90-4122-ad7d-1712b98f17b0","resolution":{"observed_at":"2026-08-04T23:09:42.004374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.992367Z","title":"Qwen2 technical report,","venue":null,"work_id":"b1655641-bf6e-4a98-919e-c93bd31b2522","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.560941Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4ffffe30bc96cc43ef997003198e1023e677f8044e48445f95f29b4871148371","observation_id":"1e150241-98f4-4055-aadf-150db08c3e80","resolution":{"observed_at":"2026-08-04T23:09:41.995121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.563287Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.563287Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:fa73515f786fc22a9271c3de00a04511b231c8c837b4d852f2f78b0434d7c0cc","observation_id":"72b6ea39-32e3-4be0-9da5-bd150d90686a","resolution":{"observed_at":"2026-08-04T23:09:41.563287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-04T23:09:41.565548Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.565548Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a137d94754ea68d38d64d0c85ccb26332de80a35b5c07778a5cd827a9fc7e3f0","observation_id":"f203041f-f3e2-43da-91ea-3b60b6da5816","resolution":{"observed_at":"2026-08-04T23:09:41.565548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T23:09:41.568088Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.568088Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ad303cab50930f2d8c0c33c34e9638a126d6d64ff7fdae83ac3ef96d6fa22bd7","observation_id":"ccb3ab6d-60ab-4875-8b4e-ea684f463a66","resolution":{"observed_at":"2026-08-04T23:09:41.568088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.979999Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning,","venue":null,"work_id":"29ba34bf-69af-4f00-96a1-708238556b4a","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.570710Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:5b08be2fa588062bb413e08c89ff09a4253b3d8802c669d550a46de809dd4166","observation_id":"f663f21d-6fa0-4780-abeb-cc0ad5f7768c","resolution":{"observed_at":"2026-08-04T23:09:41.982843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T23:09:41.573265Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.573265Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:403a9f356a6476debfa4342e6fce277eed49d312167d1e5b9277b571e3df0fd5","observation_id":"f4736afa-cf44-4f03-8fef-46af2cc792f0","resolution":{"observed_at":"2026-08-04T23:09:41.573265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-04T23:09:41.575944Z","title":"Safechain: Safety of language models with long chain- of-thought reasoning capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.575944Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f53438fdd4e19aa416fcd988580c14ebc752c617ff985a14e66807ce6955ad27","observation_id":"89dce95f-0d2c-4792-9e61-17f46f8792bb","resolution":{"observed_at":"2026-08-04T23:09:41.575944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:09:41.578345Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.578345Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:383a977f3f84b3f6d655c940caf9d260cbdb48869506c97189f9d7d3a5937668","observation_id":"66f4bc15-23dc-4d73-aba2-5d4f2540df54","resolution":{"observed_at":"2026-08-04T23:09:41.578345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-06T23:45:57.910675Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-04T23:09:41.580806Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.580806Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:115bb1fafc962875b3956e0de71f46aae165256d82b6e19f22a981b69a241c07","observation_id":"4af7982f-a890-4203-9d1f-94fefb2fb084","resolution":{"observed_at":"2026-08-04T23:09:41.580806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.583242Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.583242Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a4d8dc7fbbc81318d93df94239adb381ee6140cce1359f5cf396e39314454b45","observation_id":"fc050fd4-0ae3-4005-a987-602c34e7b2ed","resolution":{"observed_at":"2026-08-04T23:09:41.583242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02875","last_updated":"2025-03-04T18:56:03Z","snapshot_observed_at":"2026-08-09T03:23:29.075479Z","submitted_at":"2025-03-04T18:56:03Z","title":"The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02875","snapshot_observed_at":"2026-08-04T23:09:41.585521Z","title":"The first few tokens are all you need: An efficient and effective unsupervised prefix fine-tuning method for reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.585521Z"},"links":{"cited_paper":"/paper/2503.02875","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:c93ddc0027d763a69496137439e4e568408fea420a29a1cff06613217909666b","observation_id":"9694cb0d-1a26-4cb1-8a28-613fb8689937","resolution":{"observed_at":"2026-08-04T23:09:41.585521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T23:09:41.587858Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.587858Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6fce44eb78b1f8cc4e26f1253e3be50528c88c7b1e917b5b7a414c36c6825287","observation_id":"b591270b-0b7d-4011-845c-880f0d93f679","resolution":{"observed_at":"2026-08-04T23:09:41.587858Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2509.06807."}