{"as_of":"2026-08-13T16:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef9a99b6b2af10ff50d52e72c6cb4b76c692ec8460e81ba1091a4921b2caaed0","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:06:48.229957Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12497/citation-record","integrity":"/paper/2412.12497/integrity","json":"/paper/2412.12497/citation-record.json","paper":"/paper/2412.12497"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.058083Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.058083Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:a82076229f35ebe7b4ec7fcbb35b979051db1845356d32c292c135bfd4640a49","observation_id":"40854e01-e74b-4965-b0d9-cbe40d469c66","resolution":{"observed_at":"2026-08-11T14:06:48.058083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.063975Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.063975Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:62761a37b693beb3b7971d36bab10e113f1ae51e85dd8b3171ea1f156f61e99a","observation_id":"f62d56ff-3c3c-462a-a48d-5c6e327e6c3f","resolution":{"observed_at":"2026-08-11T14:06:48.063975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-13T04:15:51.905995Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-11T14:06:48.069054Z","title":"D.; and Poria, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.069054Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:2b91c60b20892df26b7c237c7106c1a0e8c2e134cacdfee5c1921e1edef147dc","observation_id":"97e7f11b-9295-469f-b56e-e7c105f557f3","resolution":{"observed_at":"2026-08-11T14:06:48.069054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.075163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.075163Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:ab3aa02e45e8206a9fd9f72dea2347367f382da737bb0b393707b373324e559a","observation_id":"8fe5e615-492f-4fec-9fef-51ca9752eaf5","resolution":{"observed_at":"2026-08-11T14:06:48.075163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.791744Z","title":"F.; Leike, J.; Brown, T.; Martic, M.; Legg, S.; and Amodei, D","venue":null,"work_id":"809ea385-a7b2-4640-83f5-d73b4d9b7349","year":2017},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.079786Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:c3dc5f8bb31397967a3e6cc9d0993f099d587df9fbab470e09d69ebaaadd70e5","observation_id":"b08d789a-be3f-417c-8a36-623d179d9365","resolution":{"observed_at":"2026-08-11T14:06:48.796303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T14:06:48.084434Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.084434Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:dda7120cbe215d5037125304414e60e62b02789f2673eae1146d6fd0150982fd","observation_id":"d9decf9f-77b8-401e-97d0-1fa8f5e22ec8","resolution":{"observed_at":"2026-08-11T14:06:48.084434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.089407Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.089407Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:71f05e411897fe9296d97906d92a7184caa72c712f409e2907774e9d810ac9df","observation_id":"6bfafd4c-6f98-4d53-b514-05e918f83dad","resolution":{"observed_at":"2026-08-11T14:06:48.089407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11617","last_updated":"2024-06-17T15:02:45Z","snapshot_observed_at":"2026-08-12T23:41:00.562420Z","submitted_at":"2024-06-17T15:02:45Z","title":"DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11617","snapshot_observed_at":"2026-08-11T14:06:48.093168Z","title":"T.; Bhardwaj, R.; and Poria, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.093168Z"},"links":{"cited_paper":"/paper/2406.11617","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:c5f5a5edd5d73dfafe986cf4da74b672e5f1f6a30295fd8e33ef90cda4f25442","observation_id":"a64e96ea-2383-4421-981b-1f5701fa8642","resolution":{"observed_at":"2026-08-11T14:06:48.093168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T14:06:48.097418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.097418Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:e69c86bcab76b66255e5daefa0e0ac3442f95f1920048778363e05a04fb8ae26","observation_id":"dc1f3363-4a3d-41a8-bc03-4280d3fc4d82","resolution":{"observed_at":"2026-08-11T14:06:48.097418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.773367Z","title":null,"venue":null,"work_id":"52998a41-aae3-4937-9939-f5279e409e92","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.101760Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:4cd007c9d6b1417a5068b6710bfaa733241ad3c5e7fe73fa6f6d3587c85ea851","observation_id":"0239bebb-fd78-40f0-bc2f-39878c464e92","resolution":{"observed_at":"2026-08-11T14:06:48.776979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-13T04:59:53.332269Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-11T14:06:48.105864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.105864Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:c5cb2dd9365c20b319a3a4dd1e33d2c3c492711aa4fc120382dae544205a808f","observation_id":"03b1b44d-4afc-4701-97e0-e3ea5d04b89e","resolution":{"observed_at":"2026-08-11T14:06:48.105864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-08-12T23:57:29.577191Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-11T14:06:48.111897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.111897Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:cf543f88d34d91dbdfba64aa8fe77c9b665372905b298706595ad1d0f3716bce","observation_id":"60247d1a-0e15-4410-b08e-c23a53876c12","resolution":{"observed_at":"2026-08-11T14:06:48.111897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.761304Z","title":"J.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; Chen, W.; et al","venue":null,"work_id":"60754ed3-c5c5-4c3c-b37a-2933d0a1ce97","year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.116771Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:30aedb351a946ddc02abd0f0f8e104cf9a40de7c5ad188563fca85b2ecc9f4df","observation_id":"3be4e412-dd8a-4cac-a863-aa41b3c84101","resolution":{"observed_at":"2026-08-11T14:06:48.765676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09600","last_updated":"2025-09-05T04:54:29Z","snapshot_observed_at":"2026-08-12T23:01:49.086216Z","submitted_at":"2024-08-18T21:45:03Z","title":"Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09600","snapshot_observed_at":"2026-08-11T14:06:48.121324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.121324Z"},"links":{"cited_paper":"/paper/2408.09600","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d794b8ee1772828b3647d95e282b2b962c44e178f6e5e493f10177eaa5fd8b5f","observation_id":"1cf6fbb8-cf1c-47f2-a878-01a11a2c7bb9","resolution":{"observed_at":"2026-08-11T14:06:48.121324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.748147Z","title":"F.; and Liu, L","venue":null,"work_id":"955871f9-dc5a-43dd-9ce6-20bd3ec2f94b","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.125788Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:f36eaab1cc23d9dc6575956496d8f3e675358a359f1dda74713e062a00c0eb81","observation_id":"690d51f3-c27d-461a-8c21-3a61329e228b","resolution":{"observed_at":"2026-08-11T14:06:48.752758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18641","last_updated":"2024-10-29T05:46:55Z","snapshot_observed_at":"2026-08-12T23:55:40.111981Z","submitted_at":"2024-05-28T22:53:43Z","title":"Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18641","snapshot_observed_at":"2026-08-11T14:06:48.130126Z","title":"F.; and Liu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.130126Z"},"links":{"cited_paper":"/paper/2405.18641","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:7ff93f49f47225d7c2c28e19dfa5ef74cd9adf5e5b6e8748f48b1cd4a2eff2ee","observation_id":"dbf4849b-520d-4b25-9590-fac183c3c6eb","resolution":{"observed_at":"2026-08-11T14:06:48.130126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-08-13T04:28:45.046134Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-11T14:06:48.134674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.134674Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:e97c7dbabd4d1766be643f6ff8922cc35a79bce990ddc6600d511fa359af1d8d","observation_id":"6365235b-d91b-493e-a612-5f4efede6104","resolution":{"observed_at":"2026-08-11T14:06:48.134674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.140584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.140584Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:9f6b2019c6fd6173f2419402ddcce76cec96a10c6d0ae0f78419986ae88ab291","observation_id":"6bba3c2a-6f66-454b-a60c-6cccafaaa134","resolution":{"observed_at":"2026-08-11T14:06:48.140584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04392","last_updated":"2024-09-09T06:25:33Z","snapshot_observed_at":"2026-08-13T01:20:14.624395Z","submitted_at":"2024-04-05T20:31:45Z","title":"Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04392","snapshot_observed_at":"2026-08-11T14:06:48.144977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.144977Z"},"links":{"cited_paper":"/paper/2404.04392","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d95fce6f5ef7a07fe2e39e602a3c362df1a1c6ea403c8c6eae8a18de0a235f73","observation_id":"34ddb55e-4d52-4603-a3ab-5c1c2d3b468e","resolution":{"observed_at":"2026-08-11T14:06:48.144977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.728904Z","title":null,"venue":null,"work_id":"1e13a55c-b7ff-4b21-97b1-d45fcbb5419c","year":2018},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.150529Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:9a5e2ff9fce9bb48d6614ceb9d8a86fc66f293eddb6ec2cd24ea246e8447ca58","observation_id":"37dba6a7-9873-44ef-8f81-ea53b7fdb5a3","resolution":{"observed_at":"2026-08-11T14:06:48.733378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T14:06:48.154835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.154835Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:1246d026fb2fedd240067f31f404b18632660adde03be2255d5dd684cd2d0d6a","observation_id":"3ada8865-7075-4e2d-ac37-d98dea9d8925","resolution":{"observed_at":"2026-08-11T14:06:48.154835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.716072Z","title":null,"venue":null,"work_id":"86bc1d72-9f9a-48cd-9f90-22e04261fec5","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.159390Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:13382f9e714ffd1d867c1659e3c02d2239e6597fe84d15bac70baf809dfc07d2","observation_id":"11ee58a7-7eda-4938-b8ba-fe15bee946e9","resolution":{"observed_at":"2026-08-11T14:06:48.720242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.163494Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.163494Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:325e78aa3add2137b45ce5cb2f662f855c40fe8a6fcb56eab6769fad72f278aa","observation_id":"07953f59-80f5-44a2-ae5d-c74f2578d8fc","resolution":{"observed_at":"2026-08-11T14:06:48.163494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.693438Z","title":"M.; Weber, L.; Choshen, L.; Sun, Y.; Xu, G.; and Yurochkin, M","venue":null,"work_id":"ea168f76-5e54-4235-865a-5986e6a44c1e","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.168044Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:eb6dd9ec463d2091a5d15b8a6ea444e4c57485a85f2c20ea8fa68095aa5f0889","observation_id":"d8a70c95-2273-4ece-b0bd-5ff11ef1c5f0","resolution":{"observed_at":"2026-08-11T14:06:48.699002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-12T23:46:49.092229Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-11T14:06:48.172421Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.172421Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:2b71cdfbba49cb21c88641e01d01aae4ab3f6f398528a749d5d4c7940be197ee","observation_id":"23553a85-712b-41ce-81f0-b4d386c4eac7","resolution":{"observed_at":"2026-08-11T14:06:48.172421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13459","last_updated":"2025-05-29T14:42:38Z","snapshot_observed_at":"2026-08-13T04:14:06.231939Z","submitted_at":"2024-02-21T01:30:03Z","title":"Learning to Poison Large Language Models for Downstream Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13459","snapshot_observed_at":"2026-08-11T14:06:48.176729Z","title":"Z.; Roshani, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.176729Z"},"links":{"cited_paper":"/paper/2402.13459","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:e3c501c4a61e859394893323a91001f53bdeb15f8fa55858494d7e1d9d91a41a","observation_id":"bebc58f5-0fab-40a1-a6c5-74861db3b877","resolution":{"observed_at":"2026-08-11T14:06:48.176729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.180673Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.180673Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:b9d4a3fa803e847ffe29e260611dc59dea4a58da4b581e464654e0763395d846","observation_id":"e48056dc-b2cb-4cd1-aff1-81eae5d6b4b0","resolution":{"observed_at":"2026-08-11T14:06:48.180673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14981","last_updated":"2025-04-16T09:38:09Z","snapshot_observed_at":"2026-08-12T23:18:00.277636Z","submitted_at":"2024-07-20T21:13:56Z","title":"Open Problems in Technical AI Governance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14981","snapshot_observed_at":"2026-08-11T14:06:48.185516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.185516Z"},"links":{"cited_paper":"/paper/2407.14981","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:c4d930a5ac7bafb697c8c28811d7437adccbd4f25ae71547050f9cd7c6d0e548","observation_id":"91be9f52-0582-4a44-8897-72b6035d46a0","resolution":{"observed_at":"2026-08-11T14:06:48.185516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.659460Z","title":null,"venue":null,"work_id":"2b58817e-f427-4c46-a633-d8ce8b797baf","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.190088Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:207f5946fd1c571bac0e8c3442bce01eab8830fdf18081e5258dacb5bbd476b3","observation_id":"5884aaed-a0e4-4cae-a4f4-211157209f5e","resolution":{"observed_at":"2026-08-11T14:06:48.665244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.643295Z","title":null,"venue":null,"work_id":"a0990538-ab93-439a-b7d2-ddf032320ab0","year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.193565Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:938f2a6d125e9447b180fd435222c8c2d97762fea351bbaaa2e4dd89b36d9092","observation_id":"155607c6-7134-4392-92ef-3e3f3826709b","resolution":{"observed_at":"2026-08-11T14:06:48.648895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.197255Z","title":"D.; Ng, A","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.197255Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:fad76ac1636f590fee07e9b397060fd9e9fe1f40effcbff41c6c4f6639d937ef","observation_id":"73d38436-1141-4c7c-9139-04a1373b2d4e","resolution":{"observed_at":"2026-08-11T14:06:48.197255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.622703Z","title":null,"venue":null,"work_id":"af67be99-e74a-4eeb-bdb1-3f36e136766c","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.201967Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:8d1a7616c60a3449f8231684148487390c9f4fa331efe81edaf189e08a3e45a8","observation_id":"1ae85030-7255-4309-8c58-a4856bb3fc38","resolution":{"observed_at":"2026-08-11T14:06:48.627338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.610494Z","title":null,"venue":null,"work_id":"1e6acc58-6f19-4654-9f2f-9de57b07b638","year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.205663Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:222954dc42c0e3429c1ab3639415893f6e5289009705598777a2301b48f9b7a0","observation_id":"b0e13af2-798e-439e-bfad-f2e1609a6e33","resolution":{"observed_at":"2026-08-11T14:06:48.614745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.597532Z","title":null,"venue":null,"work_id":"69970236-23ae-4c80-a9f4-0605fe2fce70","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.209198Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:5ed382b0dbeb747a49abc5717d730247267d782695a99cb7efc4ef9e9975d0bb","observation_id":"cdbd60c0-94a6-4a42-a7d2-75353dabf277","resolution":{"observed_at":"2026-08-11T14:06:48.601700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-13T05:57:27.605916Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-11T14:06:48.213034Z","title":"Y.; Zhao, X.; and Lin, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.213034Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:32a395eb81858e4d924bcd60db1bca3b917318c0efc89af7fd1530ba944f3de9","observation_id":"5c404844-43ab-4d8a-8466-32a1ffca7b90","resolution":{"observed_at":"2026-08-11T14:06:48.213034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-08-12T23:35:46.419773Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-11T14:06:48.217261Z","title":"N.; Song, D.; Li, B.; and Jia, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.217261Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d7bb99b4f05ec92dde68ec0f600cad3e03bd82977d59e8d1a004761e87cd4e15","observation_id":"85bc9187-ca80-4bed-aeaa-c403d0630379","resolution":{"observed_at":"2026-08-11T14:06:48.217261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.221300Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.221300Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:6622ff8219d6512f7fa593bd9e52810be4e3856b2d5d8dd54b5cc4e2e7b0bdfb","observation_id":"8cc23ba2-e465-4ddf-a77b-9681f0fa6f87","resolution":{"observed_at":"2026-08-11T14:06:48.221300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16792","last_updated":"2025-05-30T04:58:07Z","snapshot_observed_at":"2026-08-13T00:22:04.515541Z","submitted_at":"2024-04-25T17:39:50Z","title":"Model Extrapolation Expedites Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16792","snapshot_observed_at":"2026-08-11T14:06:48.225243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.225243Z"},"links":{"cited_paper":"/paper/2404.16792","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:9b13ff9de9fca90f7ba865c302eb0faa40da4d80369b8fc1f319f125144f6136","observation_id":"cbd7fd4a-5d4f-467b-9214-c6580f013d38","resolution":{"observed_at":"2026-08-11T14:06:48.225243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.572755Z","title":null,"venue":null,"work_id":"89ed326f-9783-4b8d-a55b-f0a2c2842224","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.229957Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:6afe1bcd7ab14392eadf29886ca8296626cdae4488048b3343e524c5946627e0","observation_id":"ddb25a55-3154-46aa-a0c3-959550278c99","resolution":{"observed_at":"2026-08-11T14:06:48.577859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T10:09:32.049620Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2412.12497."}