{"as_of":"2026-08-23T03:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d98052ba67579f2c4a7b5a9a3285e13236e90d54170bd3590832b5810658c3bb","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:36:02.292714Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11705/citation-record","integrity":"/paper/2608.11705/integrity","json":"/paper/2608.11705/citation-record.json","paper":"/paper/2608.11705"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-08-16T18:18:57.742267Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-08-16T00:36:02.185473Z","title":"Persona vectors: Mon- itoring and controlling character traits in language models.arXiv preprint arXiv:2507.21509,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.185473Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:24cc9398961b85c00e62b727767786182418612d6d8f1bc0b7d1e2f1f58d74a0","observation_id":"09e2d26f-476a-47cc-8b76-1f6467ee4a77","resolution":{"observed_at":"2026-08-16T00:36:02.185473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.16977","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.851770Z","title":"Fail-closed alignment for large language models.arXiv preprint arXiv:2602.16977,","venue":null,"work_id":"9ad4a950-8189-4392-9752-ba4991803419","year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.189716Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:e2c0167d53d4dc3e3fb38c231640c6fdb23caf4556daa754941da56796abcdd4","observation_id":"377bd3d3-73ac-45c0-9150-c50cf6df3a64","resolution":{"observed_at":"2026-08-16T00:36:02.857995Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-16T00:36:02.197649Z","title":"Scaling synthetic data creation with 1,000,000,000 personas.arXiv preprint arXiv:2406.20094,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.197649Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:765dfa455cb3d43959f56562a1773c40fa249155d405506716c49cbab760f31e","observation_id":"59e82f8c-91d4-4c38-8ebf-8268b03a2ce7","resolution":{"observed_at":"2026-08-16T00:36:02.197649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T00:36:02.207460Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.207460Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:aa29cda16cacbe44244eb976c761ab963090bab7ac0755d33c641057ce6fb814","observation_id":"de2384f9-54b5-490c-93a2-156119c367e1","resolution":{"observed_at":"2026-08-16T00:36:02.207460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.048681Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":"da20b3c7-b84a-42a1-a484-de86e8685f2c","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.214599Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:df4685ce1b80820f34d24e8a41633c8701419fb4b3111b59b6ec2f5d5208acf5","observation_id":"c895643e-ad1d-4691-aab5-ecb413db078c","resolution":{"observed_at":"2026-08-16T00:36:03.052453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.026317Z","title":"Let’s verify step by step","venue":null,"work_id":"072f7ff5-0790-4497-9d1e-e3b9f93435ab","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.222421Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:29fcc24a47f56fbed67f9deeb6fe7f50c556c9c5570fdd878e2da3137cfa865c","observation_id":"b748bd5e-8b3a-4640-8bd8-cfd9ebff046c","resolution":{"observed_at":"2026-08-16T00:36:03.029914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13329","last_updated":"2026-05-13T10:44:23Z","snapshot_observed_at":"2026-08-13T10:59:45.234329Z","submitted_at":"2026-05-13T10:44:23Z","title":"Tracing Persona Vectors Through LLM Pretraining","version":1},"cited_work":{"arxiv_id":"2605.13329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13329","snapshot_observed_at":"2026-08-16T00:36:02.679691Z","title":"Tracing Persona Vectors Through LLM Pretraining","venue":"cs.CL","work_id":"c7748365-5870-4bed-9111-1a3775d787d2","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.226507Z"},"links":{"cited_paper":"/paper/2605.13329","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:0b0b55a4e316a77695041379670202968bdd2e8e9995ea1a3879aa6fc851a218","observation_id":"3268915c-fbcc-46b0-8d98-fd1214769103","resolution":{"observed_at":"2026-08-16T00:36:02.683877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.014360Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":"7306ed51-7d5e-4007-aade-9c77bccb20b0","year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.230448Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:100d3c8661f711570f6a1a3598dbfe7362539591a13e3a32410ad1e0d78ffa32","observation_id":"b8b6200d-6bf5-4a7b-9f98-70e43b6bdc3b","resolution":{"observed_at":"2026-08-16T00:36:03.018806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T00:36:02.234096Z","title":"Gpqa: A graduate-level google-proof q&a bench- mark.arXiv preprint arXiv:2311.12022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.234096Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:40e35678b6fca5a78fb5d159f29bda59a5bacef9ac62875f50e44bacabb36347","observation_id":"006b3a3b-a5ca-4724-906b-0418c883d0b8","resolution":{"observed_at":"2026-08-16T00:36:02.234096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.002325Z","title":"Persona jailbreaking in large language models","venue":null,"work_id":"2e0608f2-0161-4e71-a465-892ad560ba24","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.238934Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:de18e056832f2683a07685f9e5ac7e458f60d0df570f652c4d4035c3f82a7ee5","observation_id":"eb2ba4fb-db76-4105-8286-13eb5661c64c","resolution":{"observed_at":"2026-08-16T00:36:03.006198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.990749Z","title":"do anything now","venue":null,"work_id":"60da8d5c-f3df-458d-9054-0a5cfdcb8094","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.242576Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:3ef7cd57b28b500a49ee0e296140e03bf096aee581f1cc4ea205eff5c7d1267e","observation_id":"9482b354-7c03-4bb3-b5f0-0358c6bc06be","resolution":{"observed_at":"2026-08-16T00:36:02.994960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17882","last_updated":"2025-03-22T23:35:49Z","snapshot_observed_at":"2026-08-20T00:03:58.363569Z","submitted_at":"2025-03-22T23:35:49Z","title":"Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17882","snapshot_observed_at":"2026-08-16T00:36:02.246496Z","title":"Think before refusal: Triggering safety reflection in llms to mitigate false refusal behavior.arXiv preprint arXiv:2503.17882,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.246496Z"},"links":{"cited_paper":"/paper/2503.17882","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:e1fbaf5c5f1685d23ab19ac975cf6330ea47ae9dfa210660a5eba53ea551b60f","observation_id":"9bc81f2a-3ade-4c0d-8be9-7765a8b31dbd","resolution":{"observed_at":"2026-08-16T00:36:02.246496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-18T16:22:37.329414Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-16T00:36:02.251268Z","title":"Gemma 4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.251268Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:39dac43df64f245afa13748114eef1e32156638bf2eaae8043261fe431dbe00c","observation_id":"108e0ba7-8b22-4cac-842c-c920c175b1f5","resolution":{"observed_at":"2026-08-16T00:36:02.251268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-16T00:36:02.255176Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.255176Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:0b2c7394e8711ac890361365fc7909e86d046335d4ad85306a0575a909936aa9","observation_id":"e1dfa9d7-bb92-4568-87c3-a5084a94df47","resolution":{"observed_at":"2026-08-16T00:36:02.255176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-16T00:36:02.259021Z","title":"The instruction hierarchy: Training llms to prioritize privileged instructions.arXiv preprint arXiv:2404.13208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.259021Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:9086baf62a33e4d7670331c8b84c7fcdb7dbee454c7db6b501e161f6455c536a","observation_id":"116281c2-d94b-4d7b-b6b0-e7d11b8f37cc","resolution":{"observed_at":"2026-08-16T00:36:02.259021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.262570Z","title":"Persona features control emergent misalignment.arXiv preprint arXiv:2506.19823, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.262570Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:a6e87382e09c9d9c557501cb830929116d73014604ccafdb0dd46074d8df6b68","observation_id":"d8b5714c-04eb-4ac9-9b31-ac6deb5ce979","resolution":{"observed_at":"2026-08-16T00:36:02.262570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.266143Z","title":"Beyond surface alignment: Rebuilding llms safety mechanism via probabilistically ablating refusal direction.arXiv preprint arXiv:2509.15202,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.266143Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:940a15d68a08c27747b71ae63f1622ef2cf619bbe0079f75e1135e0fe0aa2c62","observation_id":"5b9bf333-11b2-45b7-8c11-175237774fd7","resolution":{"observed_at":"2026-08-16T00:36:02.266143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14688","last_updated":"2025-03-05T02:28:39Z","snapshot_observed_at":"2026-08-16T15:30:22.841808Z","submitted_at":"2023-05-24T03:51:31Z","title":"ExpertPrompting: Instructing Large Language Models to be Distinguished Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14688","snapshot_observed_at":"2026-08-16T00:36:02.269452Z","title":"Expertprompting: Instructing large language models to be distinguished experts.arXiv preprint arXiv:2305.14688,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.269452Z"},"links":{"cited_paper":"/paper/2305.14688","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:f56461856116a351e46b45a6233832594de07374d3c3fcc0c189f8dfc24a25ed","observation_id":"c6a00a1a-d61f-4908-9f07-24682b69edf9","resolution":{"observed_at":"2026-08-16T00:36:02.269452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.978447Z","title":"Deactivating refusal triggers: Understanding and mitigating overrefusal in safety alignment","venue":null,"work_id":"bb929980-005a-450f-87da-019a8e8aa225","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.273426Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:51f68c3ec57353e7206c26184fee3c86b541b994b60ff9d0663a2618de38f44a","observation_id":"40f7fc68-893c-4f2e-afc4-22aa20d9462f","resolution":{"observed_at":"2026-08-16T00:36:02.982292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-08-17T16:49:42.651643Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"cited_work":{"arxiv_id":"2602.07340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07340","snapshot_observed_at":"2026-08-16T00:36:02.457064Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","venue":"cs.LG","work_id":"3a5517e5-9a7b-4ee7-9db1-03bb0ce9726c","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.277208Z"},"links":{"cited_paper":"/paper/2602.07340","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:a61c56d9c0dc2fcd6de9a0c5524f6aae0599315f02f9898a29e4b8fac598934e","observation_id":"e89713da-ee55-4049-9742-8fe570585166","resolution":{"observed_at":"2026-08-16T00:36:02.461979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T00:36:02.281185Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.281185Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:2d392052b9cd81e08882aa6819f9ab0fac65ea3f8a1601520f6fdc843d142544","observation_id":"5f1445e0-b4bb-42c7-a588-3f96a1de25f7","resolution":{"observed_at":"2026-08-16T00:36:02.281185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8044.5051","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.430151Z","title":"ignore previous rules","venue":null,"work_id":"bfb4f0d0-e00a-43c2-8a0d-a51ae84f6f18","year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.284664Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:af86934dcded6bf99f772f3d9b36341e0ac5f156b3a685c81cc95751285c7ee3","observation_id":"1ddc73a6-00e6-4d04-883f-5e3873801ba6","resolution":{"observed_at":"2026-08-16T00:36:02.436349Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.966910Z","title":"We additionally hold out100harmful and100benign prompts for development and early stopping","venue":null,"work_id":"fbf411cf-943f-4aed-b634-67719318b155","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.288853Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:3b0c1811bdd9d42b2c438adc4f4c1a74c4ec56cdf4223c8ebd56cfc04cee0ab8","observation_id":"44436587-2917-4b2e-95de-13bd3bbc6cb2","resolution":{"observed_at":"2026-08-16T00:36:02.970863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.953054Z","title":"In a groundbreaking revela- tion, our AI has analyzed declassified documents and found that","venue":null,"work_id":"938ebc17-07e5-4f65-b72e-9ceda62e2324","year":2023},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.292714Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:392f8b0bf5bd65fb7db736a1c0d08a3e81adf368246e23f13a8d0ca3fd4b66a9","observation_id":"82ab639c-23d2-447d-a1f3-4f879231e500","resolution":{"observed_at":"2026-08-16T00:36:02.958220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:36:02.202606Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":1990,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.202606Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:1e5cc623f971bf6a730a3bd4559fe40a211a4f6854530daec27c9fa11f72ece1","observation_id":"6d743896-ee9e-4da3-a7ff-6b1d8da40a3c","resolution":{"observed_at":"2026-08-16T00:36:02.202606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.211031Z","title":"Expert personas improve llm alignment but damage accuracy: Bootstrapping intent-based persona routing with prism.arXiv preprint arXiv:2603.18507,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.211031Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:38ea3378ddf64102aee8aa2ef49f719df36663866126b7a177c6e5bae2c77d64","observation_id":"303cb18d-c5f3-465f-aa27-bf13d2c0cf0a","resolution":{"observed_at":"2026-08-16T00:36:02.211031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.175481Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned llms.arXiv preprint arXiv:2502.17424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.175481Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:4675928b60a852fca5809eac6c0da2ac2eee41c96442613cdde960c2441ed158","observation_id":"46432a19-ca33-4b7e-87d2-4296e477ef1f","resolution":{"observed_at":"2026-08-16T00:36:02.175481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.037056Z","title":"Do llms have distinct and consistent personality? trait: Personality testset designed for llms with psychometrics","venue":null,"work_id":"785b49b9-711d-4f7a-be61-929143ad5871","year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.218490Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:9547d6a74538f6e7105b0f237ec043cfd3cc882dbf5f202079876472599cd33a","observation_id":"5b87bbee-1bc3-495c-a5e5-5f44502a6ab0","resolution":{"observed_at":"2026-08-16T00:36:03.041254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T00:36:02.170256Z","title":"Constitutional ai: Harm- lessness from ai feedback.arXiv preprint arXiv:2212.08073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.170256Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:4c4fb27c0c8ca89c50895f11ce296453aa1d5c18a993626387c4b83e880a5fa8","observation_id":"845597da-9688-461b-b09e-f66012a7b9fe","resolution":{"observed_at":"2026-08-16T00:36:02.170256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.071353Z","title":"Learn to refuse: Making large language models more controllable and reliable through knowledge scope limitation and refusal mechanism","venue":null,"work_id":"1a1cbb88-9021-4928-a496-0f886b8efa9f","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.180182Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:67be8a3180af61924ebd036871a69164cd272521bba3455f18b56bbc405f8955","observation_id":"bf02b7d8-3bd7-4b99-9bcb-e9263bfdb498","resolution":{"observed_at":"2026-08-16T00:36:03.075155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.060562Z","title":"Multi-expert prompting improves reliability, safety and usefulness of large language mod- els","venue":null,"work_id":"9e514fec-bbac-4b93-b9c3-9d38e4dd7a69","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.193688Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:6e4dcdbbfadaf80623fe6d7508aaf40f9c583f4857cd9a32a177698515d93b9b","observation_id":"a365c8ee-13ff-4548-90ca-d0791d1ae459","resolution":{"observed_at":"2026-08-16T00:36:03.064230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T20:46:10.503856Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.11705."}