{"as_of":"2026-08-13T16:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6aac3737a64aeb508854b98fc1bef51342e6f2399cffb1b0a00c109b0f2f22f7","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:24:26.477946Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:45:42.313410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05451","snapshot_observed_at":"2026-08-03T05:45:42.313410Z","title":"Lee, S., Cho, A., Kim, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02600","last_updated":"2026-06-05T12:49:59Z","snapshot_observed_at":"2026-08-10T18:12:18.667438Z","submitted_at":"2026-02-01T17:41:32Z","title":"Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models","version":3},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-03T05:45:42.313410Z"},"links":{"cited_paper":"/paper/2506.05451","citing_paper":"/paper/2602.02600"},"observation_digest":"sha256:066e9ba9f2014a864f230092d1b44fe3139fdbe05b1f8425bd45815d740d3219","observation_id":"c0ba13cc-7577-4cd3-9ca2-2dfa84908394","resolution":{"observed_at":"2026-08-03T05:45:42.313410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05451/citation-record","integrity":"/paper/2506.05451/integrity","json":"/paper/2506.05451/citation-record.json","paper":"/paper/2506.05451"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T10:24:26.305781Z","title":"Sanjeev Arora, Yuanzhi Li, Yingyu Liang, Tengyu Ma, and Andrej Risteski","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.305781Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:16b7e4791edc7c36afb757119d9de99feb79b6b5d70b866f380e10fdff71c6d6","observation_id":"dbf922d8-bb63-4726-ace1-fb395551418c","resolution":{"observed_at":"2026-08-07T10:24:26.305781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09289","last_updated":"2024-10-05T19:56:20Z","snapshot_observed_at":"2026-08-12T23:43:25.218808Z","submitted_at":"2024-06-13T16:26:47Z","title":"Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09289","snapshot_observed_at":"2026-08-07T10:24:26.309978Z","title":"InThe Thirteenth International Con- ference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.309978Z"},"links":{"cited_paper":"/paper/2406.09289","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b4cc369a3be3e275c4341fb99423d950a001f162d4b46e7f17e067cb610cfeac","observation_id":"062a7351-50e3-44b0-a0e1-ff7da1d591b2","resolution":{"observed_at":"2026-08-07T10:24:26.309978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-08-07T10:24:26.314508Z","title":"InThe Thirty-eighth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.314508Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b122bd4ee57c6d1e32bb96075bf78b46b65685117c476262f971b17a0b90b546","observation_id":"b58ac760-0795-4097-8005-5aaff2c6130e","resolution":{"observed_at":"2026-08-07T10:24:26.314508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.262723Z","title":"V ojtech Cahlik, Rodrigo Alves, and Pavel Kordik","venue":null,"work_id":"f040072a-cc1b-4ebb-b295-1c883ee30edb","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.318627Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:eef39e2ffb0ba443128dc18c55921e88747e6ad2dd7892c3d4fd4a368bcec517","observation_id":"a510d602-2812-4b6e-ad08-998edc02fac3","resolution":{"observed_at":"2026-08-07T10:24:27.266765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.11248","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.071824Z","title":"Nitay Calderon and Roi Reichart","venue":null,"work_id":"d013ce6d-bb20-4b8d-9f49-af00db94134c","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.323532Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:cd4d7901eda139481530d0ec88ad80303d364f94ab6fd054585cae1f193889a1","observation_id":"e97702f2-a65c-42fc-8bb2-dd2a8b388c03","resolution":{"observed_at":"2026-08-07T10:24:27.077942Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-12T22:08:11.011413Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T10:24:26.327706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.327706Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:5aaeafd162445b1c70740ac8ac6b973e9f1d922d536fb0a37c412a0fdede5e79","observation_id":"d8ea653f-a2ff-40a9-9f0f-2877412ba779","resolution":{"observed_at":"2026-08-07T10:24:26.327706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12180","last_updated":"2024-09-18T17:52:53Z","snapshot_observed_at":"2026-08-12T23:51:00.724453Z","submitted_at":"2024-09-18T17:52:53Z","title":"Finetuning Language Models to Emit Linguistic Expressions of Uncertainty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12180","snapshot_observed_at":"2026-08-07T10:24:26.332694Z","title":"Jianhui Chen, Xiaozhi Wang, Zijun Yao, Yushi Bai, Lei Hou, and Juanzi Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.332694Z"},"links":{"cited_paper":"/paper/2409.12180","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:4cec62af9ea4079f5e79737547e6e6ec139c3460e078bbfd4a36a6f7e6694fdf","observation_id":"c9e87b34-a8e6-4d4d-a985-b455905c92b1","resolution":{"observed_at":"2026-08-07T10:24:26.332694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.14271","last_updated":"2022-08-30T13:44:41Z","snapshot_observed_at":"2026-08-13T14:36:02.734748Z","submitted_at":"2022-08-30T13:44:41Z","title":"Faithful Reasoning Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.14271","snapshot_observed_at":"2026-08-07T10:24:26.340928Z","title":"In Proceedings of the 29th International Conference on Intelligent User Interfaces, IUI ’24, page 787–802, New York, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.340928Z"},"links":{"cited_paper":"/paper/2208.14271","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8b47bc01507eac4cc147a69992e925c1257c2800394ba55e888b295b8893844e","observation_id":"a08dd8f6-c46d-439f-8826-c1fd52b48c8c","resolution":{"observed_at":"2026-08-07T10:24:26.340928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.239998Z","title":"InThe Eleventh International Conference on Learning Rep- resentations","venue":null,"work_id":"7056a044-f78b-4513-b539-f11bfa59a384","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.345165Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:0beaa67ca8944bf044ca3170cd7923fab7384d2f3971758d04f7cccaee8b9d02","observation_id":"f977c197-fd2d-41d8-aa68-130cebbea1dc","resolution":{"observed_at":"2026-08-07T10:24:27.244661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03637","last_updated":"2023-07-07T14:51:30Z","snapshot_observed_at":"2026-08-13T11:00:12.023089Z","submitted_at":"2023-07-07T14:51:30Z","title":"Discovering Variable Binding Circuitry with Desiderata","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03637","snapshot_observed_at":"2026-08-07T10:24:26.349316Z","title":"InProceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 16124–16170, Toronto, Canada","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.349316Z"},"links":{"cited_paper":"/paper/2307.03637","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:723156d9ac145cfdaece5be61374db93afa7a792c990e37d4fbc0f44a3c222eb","observation_id":"07d74fd0-9172-4674-a7fe-6404471bb4ba","resolution":{"observed_at":"2026-08-07T10:24:26.349316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03296","last_updated":"2023-08-07T04:47:42Z","snapshot_observed_at":"2026-08-13T10:39:42.466802Z","submitted_at":"2023-08-07T04:47:42Z","title":"Studying Large Language Model Generalization with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03296","snapshot_observed_at":"2026-08-07T10:24:26.357474Z","title":"Han Guo, Nazneen Rajani, Peter Hase, Mohit Bansal, and Caiming Xiong","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.357474Z"},"links":{"cited_paper":"/paper/2308.03296","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:57ebbcb8467bdc9b1fa5da93918e34725e4346164b34d9f3b1c7b50825c5b05d","observation_id":"c72c0a66-3748-4fb3-b5e9-3db3bf864d17","resolution":{"observed_at":"2026-08-07T10:24:26.357474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.216685Z","title":"InProceedings of the 37th Interna- tional Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":"cccd64ed-f23d-4f50-905f-c3e8e3f8e690","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.366075Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8fc6e1791ecf3b79141c1fec52580dc031e14f43243c55cc192dd2b63a1c49ed","observation_id":"2711a5e4-750b-4a0e-abe1-ae7a0bf9a485","resolution":{"observed_at":"2026-08-07T10:24:27.220441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17806","last_updated":"2024-07-15T12:07:09Z","snapshot_observed_at":"2026-08-13T00:44:35.517034Z","submitted_at":"2024-03-26T15:44:58Z","title":"Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17806","snapshot_observed_at":"2026-08-07T10:24:26.370726Z","title":"Shibo Hao, Yi Gu, Haotian Luo, Tianyang Liu, Xiyan Shao, Xinyuan Wang, Shuhua Xie, Haodi Ma, Adithya Samavedhi, Qiyue Gao, Zhen Wang, and Zhiting Hu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.370726Z"},"links":{"cited_paper":"/paper/2403.17806","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:5a4ce08360721c00a6aa5ef2ea729918287a8d1fe09d5288d728fb03d9eb7b37","observation_id":"55a3048b-7a0b-43f1-926f-4d7fd1a3dd6c","resolution":{"observed_at":"2026-08-07T10:24:26.370726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.375257Z","title":"Zhengfu He, Xuyang Ge, Qiong Tang, Tianxiang Sun, Qinyuan Cheng, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.375257Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b6b441f30b6c07d8755cd54d3da0451965f6fe2289c4b7d463f8ab596223b20c","observation_id":"d010205d-0dd2-4b85-9ba4-9d27f86083e7","resolution":{"observed_at":"2026-08-07T10:24:26.375257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.380068Z","title":"Alon Jacovi and Yoav Goldberg","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.380068Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:491aea57cc5919c3dcf414a18eb19679e097855c6b84afa3976998e5959293e2","observation_id":"3488b3e3-dca5-4d5e-8340-3e9f76278872","resolution":{"observed_at":"2026-08-07T10:24:26.380068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16061","last_updated":"2024-03-04T13:37:48Z","snapshot_observed_at":"2026-08-13T04:10:39.844256Z","submitted_at":"2024-02-25T11:15:42Z","title":"How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16061","snapshot_observed_at":"2026-08-07T10:24:26.384700Z","title":"InICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.384700Z"},"links":{"cited_paper":"/paper/2402.16061","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:01342566118d939936aa9a110b08bcf5d4b883e7d3782f48307b7db46a496287","observation_id":"d86483a8-da5a-482b-b580-4a6b03accbec","resolution":{"observed_at":"2026-08-07T10:24:26.384700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.204763Z","title":"InProceedings of the 37th International Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":"6292e049-faa0-4719-83af-3626dcee6ff6","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.392317Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b4718673ae2cd17f143e9394234e98c1b03e9b6e005ad8dc46559f12f523aa6f","observation_id":"271a24eb-f94f-46b3-b5ae-aaff77699d9a","resolution":{"observed_at":"2026-08-07T10:24:27.209641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.192559Z","title":"InProceedings of the 61st Annual Meeting of the Association for Compu- tational Linguistics (Volume 3: System Demonstra- tions), pages 42–50, Toronto, Canada","venue":null,"work_id":"d3571bbe-740b-47bf-9677-83eb419aeff5","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.396707Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:e0c8cbf9475d447405b7cce7f885d9732e1a4eab972212df7f626a865bf8cafa","observation_id":"237d5644-9cb1-4701-bc63-1347536b7e4c","resolution":{"observed_at":"2026-08-07T10:24:27.196551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.180474Z","title":"InThe Twelfth International Conference on Learning Repre- sentations","venue":null,"work_id":"33e8e131-a693-44b2-99fe-b84e512754f1","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.400384Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:64bcfe2e4300f1fa466b6837b2ec2cb2f699816db261eb8e37370947b7d2b81c","observation_id":"d9c0bf9b-88c6-4aae-b144-8b6267082701","resolution":{"observed_at":"2026-08-07T10:24:27.184327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01875","last_updated":"2022-02-03T22:17:21Z","snapshot_observed_at":"2026-08-10T13:19:36.394786Z","submitted_at":"2022-02-03T22:17:21Z","title":"Rethinking Explainability as a Dialogue: A Practitioner's Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01875","snapshot_observed_at":"2026-08-07T10:24:26.403709Z","title":"InProceedings of the 61st An- nual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 11482– 11498, Toronto, Canada","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.403709Z"},"links":{"cited_paper":"/paper/2202.01875","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8926b1f589becbe89221d39fbe3ef42d6ac6dc8901c986f6ca6232b1daa62b46","observation_id":"6532def3-7402-47d1-89d6-aeee8c336770","resolution":{"observed_at":"2026-08-07T10:24:26.403709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08109","last_updated":"2025-02-12T04:17:02Z","snapshot_observed_at":"2026-08-10T22:10:54.864126Z","submitted_at":"2025-02-12T04:17:02Z","title":"HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses","version":1},"cited_work":{"arxiv_id":"2502.08109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08109","snapshot_observed_at":"2026-08-07T10:24:26.761572Z","title":"HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses","venue":"cs.CL","work_id":"7dbba649-b8fd-4350-867f-3ece896e72b5","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.408324Z"},"links":{"cited_paper":"/paper/2502.08109","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:71686fcd2d0c6456e96ebae5ce9102e17e24fb58f86ae22619f7b2f0e7973335","observation_id":"f0a5476d-6ef2-4063-9cb9-57abc06527db","resolution":{"observed_at":"2026-08-07T10:24:26.766381Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-11T23:41:02.350987Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T10:24:26.412268Z","title":"Https://hdsr.mitpress.mit.edu/pub/aelql9qy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.412268Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:39acc36922b9d662668898777135439206b03b8f9f23c4d21f84cf9b2ce0a929","observation_id":"9d704216-f085-43b4-ad3d-bf434267d1ac","resolution":{"observed_at":"2026-08-07T10:24:26.412268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19660","last_updated":"2024-04-03T14:29:03Z","snapshot_observed_at":"2026-08-13T05:37:28.180391Z","submitted_at":"2023-10-30T15:41:32Z","title":"Interpretable-by-Design Text Understanding with Iteratively Generated Concept Bottleneck","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19660","snapshot_observed_at":"2026-08-07T10:24:26.415954Z","title":"Niclas Luick","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.415954Z"},"links":{"cited_paper":"/paper/2310.19660","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:c5149108c5fce2bb7dcf721b67104b01b1271cd0f0ae8b860380d25d05496441","observation_id":"d9ef54eb-60ab-41e0-90dd-9dd62454179e","resolution":{"observed_at":"2026-08-07T10:24:26.415954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08366","last_updated":"2024-05-20T17:46:14Z","snapshot_observed_at":"2026-08-13T00:08:15.861509Z","submitted_at":"2024-05-14T07:07:13Z","title":"Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08366","snapshot_observed_at":"2026-08-07T10:24:26.419920Z","title":"Alireza Makhzani and Brendan Frey","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.419920Z"},"links":{"cited_paper":"/paper/2405.08366","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:8bbe49412e6f787d8348540fb06578c9ee5779b11a54ed456e74185d203e777f","observation_id":"b7f2c7cf-d0a3-41ba-bb9f-906cba85e495","resolution":{"observed_at":"2026-08-07T10:24:26.419920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09420","last_updated":"2025-04-13T03:36:06Z","snapshot_observed_at":"2026-08-10T13:19:37.675819Z","submitted_at":"2025-04-13T03:36:06Z","title":"SaRO: Enhancing LLM Safety through Reasoning-based Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09420","snapshot_observed_at":"2026-08-07T10:24:26.427788Z","title":"Maximilian Mozes, Tolga Bolukbasi, Ann Yuan, Frederick Liu, Nithum Thain, and Lucas Dixon","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.427788Z"},"links":{"cited_paper":"/paper/2504.09420","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:f2793e6b7338a4b86ad432bcf9fc5bb82aecbaa7a8290e8bbe403056e1a14cf1","observation_id":"de2e084d-6a75-4237-9fca-33dbbf571323","resolution":{"observed_at":"2026-08-07T10:24:26.427788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06598","last_updated":"2023-02-13T18:54:58Z","snapshot_observed_at":"2026-08-13T12:45:14.457103Z","submitted_at":"2023-02-13T18:54:58Z","title":"Gradient-Based Automated Iterative Recovery for Parameter-Efficient Tuning","version":1},"cited_work":{"arxiv_id":"2302.06598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06598","snapshot_observed_at":"2026-08-07T10:24:26.692232Z","title":"Gradient-Based Automated Iterative Recovery for Parameter-Efficient Tuning","venue":"cs.CL","work_id":"210accb7-dc02-4975-aadf-dc56bf3b67d5","year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.431523Z"},"links":{"cited_paper":"/paper/2302.06598","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:2ab97d69176e8fffea44033678c18b179514db5c343f167de3f945fa8eb9fd33","observation_id":"686d0779-98ad-4775-9f85-46cf60b7591e","resolution":{"observed_at":"2026-08-07T10:24:26.697247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-08-12T18:39:05.955599Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-07T10:24:26.435845Z","title":"InFindings of the Association for Com- putational Linguistics: NAACL 2025, pages 1604– 1635, Albuquerque, New Mexico","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.435845Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:e1982d7e46d22fe5c518ba02f1f4d4523bc894e9ca564820e33224384f63f3f0","observation_id":"cbeb1e1e-31e7-498f-af5f-ca4aa00efc3b","resolution":{"observed_at":"2026-08-07T10:24:26.435845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13080","last_updated":"2025-01-22T18:40:57Z","snapshot_observed_at":"2026-08-13T16:22:59.908589Z","submitted_at":"2025-01-22T18:40:57Z","title":"Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13080","snapshot_observed_at":"2026-08-07T10:24:26.440712Z","title":"Senthooran Rajamanoharan, Arthur Conmy, Lewis Smith, Tom Lieberum, Vikrant Varma, Janos Kramar, Rohin Shah, and Neel Nanda","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.440712Z"},"links":{"cited_paper":"/paper/2501.13080","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:fdbd2181991d6d41d5d18b34de37ffbbb837248734787c66b66106283c253f2e","observation_id":"08cddfeb-c7d8-4643-b109-c0b071d77632","resolution":{"observed_at":"2026-08-07T10:24:26.440712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18948","last_updated":"2025-08-29T06:03:42Z","snapshot_observed_at":"2026-08-13T02:34:25.235631Z","submitted_at":"2024-11-28T06:29:46Z","title":"RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18948","snapshot_observed_at":"2026-08-07T10:24:26.452708Z","title":"InProceedings of the 2022 Conference on Empirical Methods in Nat- ural Language Processing, pages 2078–2093, Abu Dhabi, United Arab Emirates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.452708Z"},"links":{"cited_paper":"/paper/2411.18948","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:03863580a31463281e3b4f4afba7076f27b13a615966400a71f914b1438f0e41","observation_id":"d2f08816-1d81-41f5-87dd-077d24031298","resolution":{"observed_at":"2026-08-07T10:24:26.452708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.155813Z","title":"InICLR 2025 Workshop on Building Trust in Language Models and Applications","venue":null,"work_id":"b900b05b-62c9-4400-9f5c-2ab6fd07e013","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.460867Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b30deb9d9142abeefe83069f749bb2c8b4c3715c25bc9cb509425a9f4f244e9a","observation_id":"25099a16-f626-442c-8027-75aa87f62c6f","resolution":{"observed_at":"2026-08-07T10:24:27.160267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-07T10:24:26.465201Z","title":"InProceedings of the 37th Interna- tional Conference on Neural Information Processing Systems, NIPS ’23, Red Hook, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.465201Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:b1db365dece7356e58a9f3b04fc165ae3eb52c0b068bca919a25366b88e0b73c","observation_id":"18f8d42c-9149-455b-a29f-653f71b8df80","resolution":{"observed_at":"2026-08-07T10:24:26.465201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.144659Z","title":null,"venue":null,"work_id":"686cc649-57e2-4e49-82e0-04a2fb58de32","year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.469980Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:726b949e691d5e39ff62c7477bc51f71228deda088ec04183d3f4b66573da168","observation_id":"b7093f4e-d86c-4039-9e92-9ea347a812a3","resolution":{"observed_at":"2026-08-07T10:24:27.148900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06269","last_updated":"2026-07-03T19:21:25Z","snapshot_observed_at":"2026-08-07T17:20:02.435445Z","submitted_at":"2025-03-08T16:29:45Z","title":"Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06269","snapshot_observed_at":"2026-08-07T10:24:26.474285Z","title":"InFindings of the Associa- tion for Computational Linguistics: EMNLP 2023, pages 2550–2575, Singapore","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.474285Z"},"links":{"cited_paper":"/paper/2503.06269","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:447e2fa0f986e9c8c550e21b1a81f39a0dc41aed26a250629488dad624682320","observation_id":"6077e1dc-c411-4eb3-8de1-7e23de6a6069","resolution":{"observed_at":"2026-08-07T10:24:26.474285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20099","last_updated":"2025-06-04T02:59:37Z","snapshot_observed_at":"2026-08-12T23:54:07.818641Z","submitted_at":"2024-05-30T14:40:35Z","title":"Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20099","snapshot_observed_at":"2026-08-07T10:24:26.477946Z","title":"InInternational Conference on Machine Learning, pages 24150–24176","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.477946Z"},"links":{"cited_paper":"/paper/2405.20099","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:28b2f592753d905b1f39dcd86eb9afdff0e38454d889a9eb43340c1e3ba5308b","observation_id":"d632adf3-891d-4c43-9da3-7e8ddee5ac65","resolution":{"observed_at":"2026-08-07T10:24:26.477946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.03418","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:26.653471Z","title":"why should i trust you?","venue":null,"work_id":"0bc031db-4246-4a85-a56a-4a87e44882e7","year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":483,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.444527Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:e928c11af92f9a67537f45b3735edda49f6e08220fb7f9025e36855aec408e92","observation_id":"fb2c1e6d-62a1-48f1-99ca-61df1f20c819","resolution":{"observed_at":"2026-08-07T10:24:26.660635Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08651","last_updated":"2025-08-11T16:13:08Z","snapshot_observed_at":"2026-08-12T23:02:41.552770Z","submitted_at":"2024-08-16T10:34:50Z","title":"Chain of Thought Still Thinks Fast: APriCoT Helps with Thinking Slow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08651","snapshot_observed_at":"2026-08-07T10:24:26.423582Z","title":"InProceedings of the 2013 conference of the north american chapter of the as- sociation for computational linguistics: Human lan- guage technologies, pages 746–751","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.423582Z"},"links":{"cited_paper":"/paper/2408.08651","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:3e83f156750feebc5a3782f024900dd25312d0b2b020d3c2e93647710da8aebb","observation_id":"99d8ab01-3987-47fe-a284-cd5793d76918","resolution":{"observed_at":"2026-08-07T10:24:26.423582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-07T10:24:26.456815Z","title":"Justin Theodorus, V Swaytha, Shivani Gautam, Adam Ward, Mahir Shah, Cole Blondin, and Kevin Zhu","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.456815Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:4247726bfa6a2d7b05988c74211b43fe6c3efb30e41713ce101d864fa1e3a331","observation_id":"55ba416a-3575-4f8b-982a-9f11b3f56127","resolution":{"observed_at":"2026-08-07T10:24:26.456815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.228315Z","title":"In Proceedings of the 58th Annual Meeting of the Asso- ciation for Computational Linguistics, pages 5553– 5563, Online","venue":null,"work_id":"9a54a8ea-7365-4441-b339-3a10a648b546","year":null},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.362341Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:a1e46e1b44c412a51a0bc9577729ffa12bc2274ba97b759b90c4554fd8c31256","observation_id":"d9acd6c1-29b8-4742-8f4c-bda55b6e9ef2","resolution":{"observed_at":"2026-08-07T10:24:27.232109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-11T04:01:38.200514Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-07T10:24:26.353163Z","title":"Logan Engstrom, Axel Feldmann, and Aleksander M ˛ adry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.353163Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:7ba9eb6f550412da4980603359d1dd6c46dc7320817dd555f4af1be376de053f","observation_id":"2848e556-47e8-4bc3-8182-b773c9fa1e82","resolution":{"observed_at":"2026-08-07T10:24:26.353163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00745","last_updated":"2024-03-01T18:43:51Z","snapshot_observed_at":"2026-08-13T04:05:21.084919Z","submitted_at":"2024-03-01T18:43:51Z","title":"AtP*: An efficient and scalable method for localizing LLM behaviour to components","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00745","snapshot_observed_at":"2026-08-07T10:24:26.388763Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.388763Z"},"links":{"cited_paper":"/paper/2403.00745","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:c2d0237b5c022dade7ded75b4663054589952a358a9f5288c350c73fe6f9f7c6","observation_id":"1215c80c-f397-4304-89cd-3a2e21d794a6","resolution":{"observed_at":"2026-08-07T10:24:26.388763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.251523Z","title":"InAdvances in Neural Infor- mation Processing Systems, volume 36, pages 16318– 16352","venue":null,"work_id":"1f15ef97-920c-44a1-b2c2-afbb5cbf84d9","year":1980},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.336515Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:0300054fa11f1393073143d8699cb12880de0e1247db8710fd2211466bf48ec6","observation_id":"2f1c746e-ede6-4330-bb77-3f4bf6832ede","resolution":{"observed_at":"2026-08-07T10:24:27.255379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00799","last_updated":"2025-03-06T17:43:10Z","snapshot_observed_at":"2026-08-12T23:52:08.560747Z","submitted_at":"2024-06-02T16:53:21Z","title":"Get my drift? Catching LLM Task Drift with Activation Deltas","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00799","snapshot_observed_at":"2026-08-07T10:24:26.300328Z","title":"Samira Abnar and Willem Zuidema","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.300328Z"},"links":{"cited_paper":"/paper/2406.00799","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:7eeb114930d421cf6a1eb1d41825b2346fe816d630df03b8ae4d3a5ecd13b264","observation_id":"ebd8f26f-5dc9-4d52-9ac6-bef8b3335c81","resolution":{"observed_at":"2026-08-07T10:24:26.300328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03032","last_updated":"2025-03-04T22:19:52Z","snapshot_observed_at":"2026-08-10T02:19:35.147614Z","submitted_at":"2025-03-04T22:19:52Z","title":"SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs","version":1},"cited_work":{"arxiv_id":"2503.03032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03032","snapshot_observed_at":"2026-08-07T10:24:27.132498Z","title":"SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs","venue":"cs.CL","work_id":"66c5a900-aba1-4c58-948e-77658a043f14","year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.294848Z"},"links":{"cited_paper":"/paper/2503.03032","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:bb3db5cdbf55293c69b6c470e4e3164b306f0b040d596658a6380ee684143bc9","observation_id":"560521ff-a5b7-43da-a648-05155e0ef7b0","resolution":{"observed_at":"2026-08-07T10:24:27.136657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.167517Z","title":"Aaquib Syed, Can Rager, and Arthur Conmy","venue":null,"work_id":"b7c432ca-d332-4819-81c7-a328af4ac010","year":2024},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":3328,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.448608Z"},"links":{"citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:475d303dca5975f1a103f00beaf9f79eab4dcd7925e0459b47bb10ee4727c32a","observation_id":"9e69ad70-b6de-42ab-8d6e-6831fa30682f","resolution":{"observed_at":"2026-08-07T10:24:27.172301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T11:07:48.259327Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.05451."}