{"as_of":"2026-08-19T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c290f790b67b9c3c7016056867616f4e757e36d066d2232b53bbf4ccea89917","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:06:56.135403Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:01:59.215909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:02:04.281602Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"cited_work":{"arxiv_id":"2502.05242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05242","snapshot_observed_at":"2026-08-05T23:02:04.281602Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","venue":"cs.CL","work_id":"c2e31a45-6fb4-4b67-a308-a96d7775593d","year":2025},"citing_paper":{"arxiv_id":"2508.06017","last_updated":"2025-08-08T05:04:47Z","snapshot_observed_at":"2026-08-18T13:06:11.606402Z","submitted_at":"2025-08-08T05:04:47Z","title":"Position: Intelligent Coding Systems Should Write Programs with Justifications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:01:59.215909Z"},"links":{"cited_paper":"/paper/2502.05242","citing_paper":"/paper/2508.06017"},"observation_digest":"sha256:67d3fe10e9164b54310026e19a4c2f71cb852b557a57e3b40547fb12d8cc9ed1","observation_id":"0bdfb9f2-0a78-4996-bd33-6a36b60098b2","resolution":{"observed_at":"2026-08-05T23:02:04.284765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05242/citation-record","integrity":"/paper/2502.05242/integrity","json":"/paper/2502.05242/citation-record.json","paper":"/paper/2502.05242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.07755","last_updated":"2023-09-14T14:41:46Z","snapshot_observed_at":"2026-08-16T15:00:42.034284Z","submitted_at":"2023-09-14T14:41:46Z","title":"Generative AI Text Classification using Ensemble LLM Approaches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07755","snapshot_observed_at":"2026-08-08T21:06:55.774507Z","title":"Generative ai text classification using ensemble llm approaches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.774507Z"},"links":{"cited_paper":"/paper/2309.07755","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:167ceabb5aa726c485cb296bd80267e0bcd8a4f1eb1602d61a6091fb85f36ad1","observation_id":"f3e8f967-b44d-4ec1-bfce-2738e74c1b1f","resolution":{"observed_at":"2026-08-08T21:06:55.774507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T21:06:55.779567Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.779567Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:685d59284061d3fd8d02613948d935ba6c72ad4433f05a8de1656b1fa6d7e40b","observation_id":"e63ebdc5-3aad-4860-8b8c-4fcc8b8591fb","resolution":{"observed_at":"2026-08-08T21:06:55.779567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-08T21:06:55.783768Z","title":"The internal state of an llm knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.783768Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ad6235470b85cbe1fef75286aa1f27603bbcce67bf92c970db5e0a7225aed4a9","observation_id":"a0e013a8-1d8a-4685-8774-759eba133331","resolution":{"observed_at":"2026-08-08T21:06:55.783768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.788132Z","title":"Transparency and explainability of ai systems: ethical guidelines in practice","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.788132Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:82fe17e3ddd071a37251c7f5bac6a68979af0195f08dc22e6f7842fe08a2205a","observation_id":"457ddc55-500e-4a0c-be87-d9b5acc5e94d","resolution":{"observed_at":"2026-08-08T21:06:55.788132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.792115Z","title":"Spectrally-normalized margin bounds for neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.792115Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:74428e7ab07751efd2e3a26aaec124bf86e00726d37d8a874887d6d3d34fdf9f","observation_id":"b937a963-1c1c-4573-bf94-74451f211016","resolution":{"observed_at":"2026-08-08T21:06:55.792115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.796051Z","title":"Language models can explain neurons in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.796051Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f6bae2ae16c86396ef14d0a9736d90026c257cdba07cd179065fbe3b989d1723","observation_id":"dd51a220-ef09-4d7a-aed8-ca8c6dcd3fca","resolution":{"observed_at":"2026-08-08T21:06:55.796051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07900","last_updated":"2025-03-25T22:02:36Z","snapshot_observed_at":"2026-08-17T09:52:26.798224Z","submitted_at":"2024-04-11T16:39:00Z","title":"High-Dimension Human Value Representation in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07900","snapshot_observed_at":"2026-08-08T21:06:55.800491Z","title":"High-dimension human value representation in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.800491Z"},"links":{"cited_paper":"/paper/2404.07900","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5cbf930a57939f86e8366600d8e7ad24e7aa444bd7bca97edec24cdbb1226673","observation_id":"eff633a2-2ed4-4a3e-9fb4-c940d9671e89","resolution":{"observed_at":"2026-08-08T21:06:55.800491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.804422Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.804422Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0cc8ed022bdb0478c0413c7b16e4cdc1e1861f252bcc71937c9176c584d51917","observation_id":"8f4e9428-e1ba-410b-b894-69a5806bac97","resolution":{"observed_at":"2026-08-08T21:06:55.804422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.808319Z","title":"Redunet: A white-box deep network from the principle of maximizing rate reduction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.808319Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ad33fe6c34f9c3d05b6bc8d240829c0cb17586135f0413b5e6424d2bc7864a9a","observation_id":"b4f9efca-d4c3-4300-863c-4cf5ea4377c2","resolution":{"observed_at":"2026-08-08T21:06:55.808319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10949","last_updated":"2024-03-26T01:15:09Z","snapshot_observed_at":"2026-08-18T01:31:18.915186Z","submitted_at":"2024-03-16T15:30:34Z","title":"SelfIE: Self-Interpretation of Large Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10949","snapshot_observed_at":"2026-08-08T21:06:55.812069Z","title":"Selfie: Self-interpretation of large language model embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.812069Z"},"links":{"cited_paper":"/paper/2403.10949","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e70a827252e16c5eb207ca0955d320406f197faa8c67f3209c0bc1914bb87879","observation_id":"ae97825f-34b0-4041-aa53-5e11bac06f2d","resolution":{"observed_at":"2026-08-08T21:06:55.812069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.815963Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.815963Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:22c06449194468a6c785faa58e8248d79dc24904e23f72890e79ada813c42a8f","observation_id":"65862f5e-6e05-4c89-8962-8c35adb1434c","resolution":{"observed_at":"2026-08-08T21:06:55.815963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-08T21:06:55.819737Z","title":"Reasoning models don’t always say what they think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.819737Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:aa97df7360ebbebb6e850caaa8ba0a9ae6cb1a7da573a2546244fdd210ad33a9","observation_id":"b0d84af8-53d5-4908-8fbe-29a7d337e092","resolution":{"observed_at":"2026-08-08T21:06:55.819737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08723","last_updated":"2023-11-15T06:33:52Z","snapshot_observed_at":"2026-08-17T13:28:03.748960Z","submitted_at":"2023-11-15T06:33:52Z","title":"Token Prediction as Implicit Classification to Identify LLM-Generated Text","version":1},"cited_work":{"arxiv_id":"2311.08723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08723","snapshot_observed_at":"2026-08-08T21:06:56.902649Z","title":"Token Prediction as Implicit Classification to Identify LLM-Generated Text","venue":"cs.CL","work_id":"beb31aac-dece-43ce-a301-477e2a16d68e","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.823842Z"},"links":{"cited_paper":"/paper/2311.08723","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f27fdd5d73ac9d045529c88cbebda50d7cabe59d561ebe487ac097d1f2dc3c8f","observation_id":"b3eb7f9c-41eb-4d33-8e1b-1c3bb0803fbc","resolution":{"observed_at":"2026-08-08T21:06:56.907064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.827723Z","title":"Measuring generalization with optimal transport","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.827723Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:87c8cae0cc99c71e7ca95a6cbd01f2da98e4764206c5a91e270b01ca99b4ca6f","observation_id":"5939e0aa-5dd2-4819-87c4-6cee38a1f6ef","resolution":{"observed_at":"2026-08-08T21:06:55.827723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T21:06:55.831386Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.831386Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ed1f0f095a5c96d8ca58b205ab606ed1d6c04a9ec0d30d04356743124ea96b5a","observation_id":"501c34ff-aac9-4645-b297-50d7bd509842","resolution":{"observed_at":"2026-08-08T21:06:55.831386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.835382Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.835382Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:412d6bcd909870f4d86401abec2486fc31bb2f975625334096b3508f045a59a2","observation_id":"6f210b8b-a74b-4846-8cc4-0969bdab1572","resolution":{"observed_at":"2026-08-08T21:06:55.835382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-16T12:56:12.864592Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-08T21:06:55.839319Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.839319Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:dc62b51790f92bb370397274ea883811cdab58c28e48e5e3780e39f926c3809b","observation_id":"a558fa4f-2a39-4149-80df-bd468a5a5042","resolution":{"observed_at":"2026-08-08T21:06:55.839319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-08T21:06:55.843649Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.843649Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:111f6b1bb0faf6dbf460d6d297777e621451a16b7583621c7babe4803da60ee2","observation_id":"a712fe56-9fc0-4031-9daf-03316b48d32b","resolution":{"observed_at":"2026-08-08T21:06:55.843649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T21:06:55.848017Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.848017Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:2ed6951dc7d0795c922746a572dbe7d6108ffeaaeabcfe20801a48df43bad7fd","observation_id":"5e02df84-da1c-4178-a019-39ed782397c8","resolution":{"observed_at":"2026-08-08T21:06:55.848017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-08T21:06:55.852430Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.852430Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:cb841799f52324711eabb71b13d6f61b6c99a6cd3e1da9c2fed1260c34f96515","observation_id":"80e24131-ca75-4d12-947c-9c2e86df1e54","resolution":{"observed_at":"2026-08-08T21:06:55.852430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06102","last_updated":"2024-06-06T22:59:58Z","snapshot_observed_at":"2026-08-18T21:51:35.084922Z","submitted_at":"2024-01-11T18:33:48Z","title":"Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06102","snapshot_observed_at":"2026-08-08T21:06:55.856894Z","title":"Patchscope: A unifying framework for inspecting hidden representations of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.856894Z"},"links":{"cited_paper":"/paper/2401.06102","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:2f5fef6893feae524e58d52ca6bf996e6d7533533b3a42c15d09493dd8010e24","observation_id":"0b6e1392-4cdc-4298-9c06-0f4bd94eaef8","resolution":{"observed_at":"2026-08-08T21:06:55.856894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-08-13T11:12:58.507759Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T21:06:55.861230Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.861230Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f18c155ffcff065343b52aab7fac70a5e40d92f72418fb4f76c483b2f61239fc","observation_id":"0187d06a-8394-441e-9bb2-d9e927e54d26","resolution":{"observed_at":"2026-08-08T21:06:55.861230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.865542Z","title":"Dimensionality reduction by learning an invariant mapping","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.865542Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3c66fb3ef473b1d921bfa995fe6a083d22ec25750a377120cff860d3929be775","observation_id":"b469aef6-7e91-495f-ad40-23df6a2e9795","resolution":{"observed_at":"2026-08-08T21:06:55.865542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.869642Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.869642Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5294b1cbbd132adbf502f7995bbf492c344459ad534b101d628c11bfbcb24eba","observation_id":"b0fa4ebb-603c-496e-b878-aafe3fdfd14b","resolution":{"observed_at":"2026-08-08T21:06:55.869642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.873475Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.873475Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:d5ac23ddf9bc9965a04088b901097d4c46c43f2489a00f47faca7fcf1cb531b4","observation_id":"e4bcd3c8-ce88-43ee-8aff-f1ca7ead4c4c","resolution":{"observed_at":"2026-08-08T21:06:55.873475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T21:06:55.877048Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.877048Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e09acc6361e52df5fdd1109bc4b996bdcccfd6f4f4eef871aae0ef8d276f744b","observation_id":"688d65ed-4bff-4110-a7af-35d28a44760d","resolution":{"observed_at":"2026-08-08T21:06:55.877048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.880776Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.880776Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8f3dad6f77b6232fc14d90fa51deebdc465ec9250068638e13a14a8f3c5bab54","observation_id":"b175704b-317e-4612-ad96-c1a7e576cdfc","resolution":{"observed_at":"2026-08-08T21:06:55.880776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T21:06:55.884405Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.884405Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:11d14d9aa76d9ccf123e72c388c2623372d04209758f23f0fc4b67b91edf2601","observation_id":"f7ac45f8-93e2-4db4-8b6e-513633c2f52a","resolution":{"observed_at":"2026-08-08T21:06:55.884405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.888220Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.888220Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:516d2e005baaf5cc1a342bc893bf3feadb4ea9e7ec113a83589b2998e4c1f9c6","observation_id":"f2ff69cd-e2d8-495a-bf29-c5ad0093834c","resolution":{"observed_at":"2026-08-08T21:06:55.888220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11207","last_updated":"2023-10-17T12:34:32Z","snapshot_observed_at":"2026-08-19T18:36:54.047127Z","submitted_at":"2023-10-17T12:34:32Z","title":"Can Large Language Models Explain Themselves? A Study of LLM-Generated Self-Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11207","snapshot_observed_at":"2026-08-08T21:06:55.891758Z","title":"Can large language models explain themselves? a study of llm-generated self-explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.891758Z"},"links":{"cited_paper":"/paper/2310.11207","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:61e0c563eba46407414e2913093275f6eb82c6745063596152e85408bd7ffbe9","observation_id":"173d7867-b738-4c0a-9787-e087706fc231","resolution":{"observed_at":"2026-08-08T21:06:55.891758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-08-16T14:22:17.262996Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-08T21:06:55.895736Z","title":"Vaccine: Perturbation-aware alignment for large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.895736Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:01a4712c5e8b79cbfc9441f39735c6fc40e9937d11066cad5a397f979d6704aa","observation_id":"10957a03-58f7-494b-875c-b555402d289d","resolution":{"observed_at":"2026-08-08T21:06:55.895736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.328584Z","title":"Anthropic: Responsible scaling policy","venue":null,"work_id":"d42dbce4-b280-4118-839a-b245c63b6661","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.899620Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:1ffc6c15fdae4865970db65320d60668855b071eedd5e49b330f3962affb8e3d","observation_id":"c35dd0db-4a15-410d-8ace-4a2453be7f10","resolution":{"observed_at":"2026-08-08T21:06:57.332762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-08T21:06:55.903599Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.903599Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:701de5ac85a4f5d46141d1a7edd567da573c2804a790f1e18d59bbb3e031218b","observation_id":"5e83a56d-4123-4e6b-b529-66b410741f27","resolution":{"observed_at":"2026-08-08T21:06:55.903599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.314505Z","title":"Klanderman, and William J Rucklidge","venue":null,"work_id":"f56b3d7e-3e31-4cae-8057-44eb62949792","year":1993},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.907611Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:fb82bdb0938acc05387d241cb251be1a15bfb8e27401e77ba03673f2ee37151f","observation_id":"83447c0a-c73c-4565-8128-9ab08938f379","resolution":{"observed_at":"2026-08-08T21:06:57.318683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-08T21:06:55.911523Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.911523Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8c5427038d63d5a80cdb2782ab6a2dc923d4953a60815a921fb0859d490277d9","observation_id":"a4e41a44-f263-41ee-84a9-6447e16b6d3b","resolution":{"observed_at":"2026-08-08T21:06:55.911523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.915594Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.915594Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:c99ed62d8a488b267e43ee5ead952322f13f90bf1279a6ef30ff64024826429c","observation_id":"70aa9370-bc40-4292-9e1d-49f62f31b051","resolution":{"observed_at":"2026-08-08T21:06:55.915594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T21:06:55.919286Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.919286Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:18cd8c1fb5818004ded301cae254fce6b76e571be31384aeeaa089741445be73","observation_id":"adcf540f-b082-4a3e-8918-95a7bd6c7d59","resolution":{"observed_at":"2026-08-08T21:06:55.919286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07976","last_updated":"2020-12-14T22:21:37Z","snapshot_observed_at":"2026-08-16T18:58:32.487911Z","submitted_at":"2020-12-14T22:21:37Z","title":"NeurIPS 2020 Competition: Predicting Generalization in Deep Learning","version":1},"cited_work":{"arxiv_id":"2012.07976","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.07976","snapshot_observed_at":"2026-08-08T21:06:56.678827Z","title":"NeurIPS 2020 Competition: Predicting Generalization in Deep Learning","venue":"cs.LG","work_id":"a3e22d97-1f21-49d6-8b75-367e89527854","year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.923429Z"},"links":{"cited_paper":"/paper/2012.07976","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:af9399063a518c8e85901e6638259e200d97cbb8c4ced6744a3533f59d497b79","observation_id":"d035885d-8c60-4038-ad07-fdf4cbde629f","resolution":{"observed_at":"2026-08-08T21:06:56.683476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.290890Z","title":"Explainable artifi- cial intelligence for mental health through transparency and interpretability for understandability","venue":null,"work_id":"9aa0ecde-43d6-423c-8675-16a42ac96554","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.927512Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0bb6d93780a3830a1e76aab2477b030de6e758aff0203bea6cd90ff6adbe2b3b","observation_id":"13866d13-644a-4719-b597-dc36bef6e648","resolution":{"observed_at":"2026-08-08T21:06:57.295179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16043","last_updated":"2024-05-25T03:48:12Z","snapshot_observed_at":"2026-08-16T13:49:33.752963Z","submitted_at":"2024-05-25T03:48:12Z","title":"Theoretical Analysis of Weak-to-Strong Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16043","snapshot_observed_at":"2026-08-08T21:06:55.931312Z","title":"Theoretical analysis of weak-to- strong generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.931312Z"},"links":{"cited_paper":"/paper/2405.16043","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:37218a95f8050a684b282b34576ce679bbc5aebdafac4d15a4b8321f889b3f88","observation_id":"ae57fff5-306c-420d-9be1-75a143f4fa31","resolution":{"observed_at":"2026-08-08T21:06:55.931312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17888","last_updated":"2024-10-27T20:09:59Z","snapshot_observed_at":"2026-08-16T13:48:45.544842Z","submitted_at":"2024-05-28T07:11:05Z","title":"Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17888","snapshot_observed_at":"2026-08-08T21:06:55.935526Z","title":"Getting more juice out of the sft data: Reward learning from human demonstration improves sft for llm alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.935526Z"},"links":{"cited_paper":"/paper/2405.17888","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5476c59fc808701aaddbddbfbf8528ccded9c60feac69744d3c505c87dc25ba3","observation_id":"e56eae66-2a65-4723-84a4-b2a9ea64b870","resolution":{"observed_at":"2026-08-08T21:06:55.935526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.277493Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":"2afb8aea-a291-4aa7-9960-ad9f79d2d948","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.939591Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:b100a533c5f1ce6a588460811a4cb527f6fbdbf863d39be0e3a469a13a809a0e","observation_id":"4ff0e8ae-7aed-43ef-b4ef-f79cf43fff2e","resolution":{"observed_at":"2026-08-08T21:06:57.281700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-16T14:20:31.299446Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-08T21:06:55.943327Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.943327Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:50820f7062d9aea4b2f299547cf803de60203a75eb3adc8271ada11086639590","observation_id":"3b5c0a1c-1092-451e-abaf-5fcbafeda044","resolution":{"observed_at":"2026-08-08T21:06:55.943327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-08-15T06:18:34.739211Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-08-08T21:06:55.947697Z","title":"The wmdp benchmark: Measuring and reducing malicious use with unlearning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.947697Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:bdf5c83784e0a6a5bb46aca4b937f2d79d40fe2fdb645064d7fdeaa278e5b2a6","observation_id":"91f68183-74c7-4e22-bd63-d35465225cf9","resolution":{"observed_at":"2026-08-08T21:06:55.947697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06824","last_updated":"2025-02-21T05:17:52Z","snapshot_observed_at":"2026-08-16T18:59:00.421775Z","submitted_at":"2024-01-12T00:50:04Z","title":"Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06824","snapshot_observed_at":"2026-08-08T21:06:55.952238Z","title":"Open the pandora’s box of llms: Jailbreak- ing llms through representation engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.952238Z"},"links":{"cited_paper":"/paper/2401.06824","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0cc009c6dd30f6fc8f585b9f5732775a3b793a2924d2091c5c78a75b0f322dfa","observation_id":"20f0ad26-1ff9-4a3a-8c07-5e261d86327f","resolution":{"observed_at":"2026-08-08T21:06:55.952238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.956497Z","title":"Large language models in finance: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.956497Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:cd3b25e7af32e30fbdcc9a0867b0b56551ace026180f662138497ca2d458c1eb","observation_id":"8ce0c3e3-8ff9-4f56-949e-5081cf4e12d3","resolution":{"observed_at":"2026-08-08T21:06:55.956497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-15T15:50:24.074149Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-08T21:06:55.960754Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.960754Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:977f97cc9f2ee9b047d074c6355339346160ee104754ded09be55e662c8b066f","observation_id":"fa921c34-69a1-4f13-bb2a-16033b96982f","resolution":{"observed_at":"2026-08-08T21:06:55.960754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.254345Z","title":"Latent guard: a safety framework for text-to-image generation","venue":null,"work_id":"ee448399-94ae-4e23-8a6b-3c73f1b575e0","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.965090Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:d3a77d6ce7445894e7cdb2a49b6d1913ad77dabd8aca2ee92ba5248d2c43f90b","observation_id":"2fe70bf5-43ea-4c1f-9120-0d1084c5f9b8","resolution":{"observed_at":"2026-08-08T21:06:57.258531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06202","last_updated":"2025-03-08T13:08:46Z","snapshot_observed_at":"2026-08-16T12:51:56.801056Z","submitted_at":"2025-03-08T13:08:46Z","title":"Breaking Free from MMI: A New Frontier in Rationalization by Probing Input Utilization","version":1},"cited_work":{"arxiv_id":"2503.06202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06202","snapshot_observed_at":"2026-08-08T21:06:56.572557Z","title":"Breaking Free from MMI: A New Frontier in Rationalization by Probing Input Utilization","venue":"cs.AI","work_id":"f5f622bf-f4f1-405d-abfb-45cda3c37773","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.969484Z"},"links":{"cited_paper":"/paper/2503.06202","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:4b90763838aa0b79f980f9665896768ad1ee791d264dae1098e501eecfb35e7e","observation_id":"8a83b41f-745d-483b-9005-e7157117c742","resolution":{"observed_at":"2026-08-08T21:06:56.576746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06003","last_updated":"2024-10-22T03:30:35Z","snapshot_observed_at":"2026-08-16T13:11:30.961769Z","submitted_at":"2024-10-08T13:04:02Z","title":"Is the MMI Criterion Necessary for Interpretability? Degenerating Non-causal Features to Plain Noise for Self-Rationalization","version":4},"cited_work":{"arxiv_id":"2410.06003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06003","snapshot_observed_at":"2026-08-08T21:06:56.552852Z","title":"Is the MMI Criterion Necessary for Interpretability? Degenerating Non-causal Features to Plain Noise for Self-Rationalization","venue":"cs.LG","work_id":"8c734364-8800-4f78-b384-b612729475ad","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.973742Z"},"links":{"cited_paper":"/paper/2410.06003","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:67a270dde2207d646d09cbfcf696ce6a166d2e31387b2822dcf68af7ba9dcb39","observation_id":"036de2d0-4613-491c-bb9f-b3cc5f5c938a","resolution":{"observed_at":"2026-08-08T21:06:56.558474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04492","last_updated":"2023-07-23T08:54:43Z","snapshot_observed_at":"2026-08-16T15:34:53.241968Z","submitted_at":"2023-05-08T06:36:46Z","title":"MGR: Multi-generator Based Rationalization","version":8},"cited_work":{"arxiv_id":"2305.04492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.04492","snapshot_observed_at":"2026-08-08T21:06:56.532526Z","title":"MGR: Multi-generator Based Rationalization","venue":"cs.LG","work_id":"de043fc2-0087-4477-a9b7-66f9422bdf02","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.977711Z"},"links":{"cited_paper":"/paper/2305.04492","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:922f655ce4a00f83be3992ed94830d8ee059a3c099123c5e8b0297d5edc353ce","observation_id":"a900ae02-3466-4912-8423-ea555e038e6d","resolution":{"observed_at":"2026-08-08T21:06:56.537652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.240980Z","title":"D-separation for causal self-explanation","venue":null,"work_id":"c082ebd8-8deb-487c-ba43-951721469280","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.981604Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:160f4c75df8308cff6d61bcd7cd7b94d5d87a4b9ef0997cce1afdfb4770de330","observation_id":"4e06cb80-918d-4863-8234-b1daffbddaf5","resolution":{"observed_at":"2026-08-08T21:06:57.245452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.985225Z","title":"Efficient detection of toxic prompts in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.985225Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:4b6f4759af55e928dcd44113059064dd4d74145af741729f57804768f82e753f","observation_id":"df5fed00-963e-4362-b243-b73676f467f7","resolution":{"observed_at":"2026-08-08T21:06:55.985225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.217773Z","title":"Are self-explanations from large language models faithful? In Findings of the Association for Computational Linguistics ACL 2024, pages 295–337, 2024","venue":null,"work_id":"782a25c0-3185-4ef8-aea7-260a36e0cf8b","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.988861Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:267433dd3e14f204f160b006bcc4ca4f633b422e072b413fbdaf98321ac440fa","observation_id":"16164951-f8c2-42c2-95a9-11c2a14fd8e2","resolution":{"observed_at":"2026-08-08T21:06:57.222356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.202331Z","title":"Introducing llama 3.1: Our most capable models to date","venue":null,"work_id":"e2ee1f8b-c215-4bfd-a794-db98b7eefaa5","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.992591Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3945ff0644da16fab422bc60c2d8a7b58b9b8263c30fb3eac594aabb5a55a2c8","observation_id":"446c31d7-65c7-4a8a-b4c3-89caa757e468","resolution":{"observed_at":"2026-08-08T21:06:57.207161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.996095Z","title":"Large language models in healthcare and medical domain: A review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.996095Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:02f130f3fbdf2917a7745fee9368ba03c90dcc18dc24cbd1906b1ce0759c7586","observation_id":"1d218019-ad92-4d0e-9b10-81277d858604","resolution":{"observed_at":"2026-08-08T21:06:55.996095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.177797Z","title":"interpreting gpt: the logit lens, 2020","venue":null,"work_id":"c9f9617a-9ce7-46a5-a159-23d4e1cc3eb8","year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.999980Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:7f01d0e2726ea7f0fba4af6134ca65d65609538800d411cd03c18de4aca21bd4","observation_id":"20430a8d-5418-4d9d-9714-48fe056b05aa","resolution":{"observed_at":"2026-08-08T21:06:57.182480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-08T21:06:56.003552Z","title":"Show your work: Scratchpads for intermediate computation with language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.003552Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:50f27bd395c3642c6f5af74df54d8415490c56a5d31aa6c49d2747d39db0519c","observation_id":"225d2322-a4f4-4637-8b8b-803d0835fc56","resolution":{"observed_at":"2026-08-08T21:06:56.003552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-08T21:06:56.007455Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.007455Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:11b4945ef4403f6a0520fa08c110cb0842fa85f43f35a4efba9369bc08e610bf","observation_id":"2653e440-a101-4d97-a749-9c18c20fe79a","resolution":{"observed_at":"2026-08-08T21:06:56.007455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02707","last_updated":"2025-05-18T11:18:56Z","snapshot_observed_at":"2026-08-16T13:12:52.496223Z","submitted_at":"2024-10-03T17:31:31Z","title":"LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02707","snapshot_observed_at":"2026-08-08T21:06:56.011274Z","title":"Llms know more than they show: On the intrinsic representation of llm hallucinations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.011274Z"},"links":{"cited_paper":"/paper/2410.02707","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:1a0c51ec8107ab5f2b115fa3cce6307bf1d7d74e56a695bf7383c75d7a67d396","observation_id":"77650200-95ad-4254-ae66-b393f8e2d986","resolution":{"observed_at":"2026-08-08T21:06:56.011274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.015292Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.015292Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:1d420664e9dcaa5cca92b2371fdf5620f64a8cd4327365743a028d3d921284f6","observation_id":"26f79b94-4509-4a6c-9844-3692db5eff03","resolution":{"observed_at":"2026-08-08T21:06:56.015292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16672","last_updated":"2025-06-03T09:50:57Z","snapshot_observed_at":"2026-08-16T13:07:08.610316Z","submitted_at":"2024-10-22T04:08:27Z","title":"The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16672","snapshot_observed_at":"2026-08-08T21:06:56.019041Z","title":"Dean: Deactivating the coupled neurons to mitigate fairness-privacy conflicts in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.019041Z"},"links":{"cited_paper":"/paper/2410.16672","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:10378b08e38501eb1ac76383f9088216a7b44c145759c26818457169569ff41a","observation_id":"9df7f434-40a5-467f-824c-394f877165eb","resolution":{"observed_at":"2026-08-08T21:06:56.019041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.022839Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.022839Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:54d432813dab8ed6478d3157f3a4c60408ce969f8e6b1cc5235799fe2028ae5c","observation_id":"747cf1a8-5e93-4708-8a45-16bfebbf9b3c","resolution":{"observed_at":"2026-08-08T21:06:56.022839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14577","last_updated":"2024-10-30T22:58:40Z","snapshot_observed_at":"2026-08-18T14:01:21.193555Z","submitted_at":"2024-05-23T13:51:55Z","title":"Representation Noising: A Defence Mechanism Against Harmful Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14577","snapshot_observed_at":"2026-08-08T21:06:56.026593Z","title":"Representation noising effectively prevents harmful fine-tuning on llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.026593Z"},"links":{"cited_paper":"/paper/2405.14577","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e06d14a907f337d52d3ce92485c61399ab304fb899163ba11535aa6a69ebf705","observation_id":"8c0bdbcb-74c2-45ee-80d8-7e72561f0d4f","resolution":{"observed_at":"2026-08-08T21:06:56.026593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-14T04:19:38.572552Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-08T21:06:56.030792Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.030792Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:341e7786cfb88d9959fa85967a68614a8fdecbbcdf4f675dfa143252d63487fd","observation_id":"f1aa9788-3f59-43b1-9fcc-dc77ff0d4fc9","resolution":{"observed_at":"2026-08-08T21:06:56.030792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.034858Z","title":"The effective rank: A measure of effective dimensionality","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.034858Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:153a2452e874ffefce79fd3f51200bfdbee8732700eb2e2854036528ad018b3f","observation_id":"c0568c9d-14e2-486f-b012-9c06393075b6","resolution":{"observed_at":"2026-08-08T21:06:56.034858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-08T21:06:56.038650Z","title":"Socialiqa: Com- monsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.038650Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:243673244f59cabaae9d410375c30edb643d7a89f8a68f1dd67cb9c068c865b5","observation_id":"60750dfb-be55-4241-815e-7f1a073573f9","resolution":{"observed_at":"2026-08-08T21:06:56.038650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.042629Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.042629Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:75c1875090b80abc36186cc1c787ca75d45529f0dff8881b4aee899923064be4","observation_id":"b947ce92-bb8f-4fc5-bbe7-cbb7fd9dc66f","resolution":{"observed_at":"2026-08-08T21:06:56.042629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.125800Z","title":"Lmfingerprints: Visual explanations of language model embedding spaces through layerwise contextualization scores","venue":null,"work_id":"ce6fd575-92f8-42ef-a4cf-f7cdee8ec8de","year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.046235Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:6fbd6499d7ffcf9feb3b4382573a11c2efce64257f09e36397ad69db4118f1ad","observation_id":"17821f04-8ab1-4875-9197-6ea97b00a04f","resolution":{"observed_at":"2026-08-08T21:06:57.130582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.112276Z","title":"k-variance: A clustered notion of variance","venue":null,"work_id":"81f24d6b-372d-4b05-92cf-64667b872454","year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.050394Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:dca4a16426005f9615843fe1a4641e3cc39596c5054f73223ae2a44904af9b3d","observation_id":"e2c8f106-6e1b-4c54-961a-ecbcd71885f5","resolution":{"observed_at":"2026-08-08T21:06:57.116105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-08T21:06:56.054470Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.054470Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:571d86cfd80422a23f96fd36a461354216413b00f7d9d49218f9405f98ba5003","observation_id":"1de0eab6-ba41-4b39-ab5e-adb1a6deb80d","resolution":{"observed_at":"2026-08-08T21:06:56.054470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.059007Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.059007Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:00469cf83b7cf3b424930879ddf7e458a407eed74c4efc4a39860de6aa9faee3","observation_id":"3e19d31c-1e90-4440-ad87-d31159744ba7","resolution":{"observed_at":"2026-08-08T21:06:56.059007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.063915Z","title":"Language models don’t always say what they think: unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.063915Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:16e3c3e0075328110a9a74c2dbd96975c3d2e58a24e2e407fe2e553d99a2cc8c","observation_id":"93d11c2a-7849-4444-b3f6-cb06558089a2","resolution":{"observed_at":"2026-08-08T21:06:56.063915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.068139Z","title":"Optimal transport: old and new, volume 338","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.068139Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:19863544472d507373fd323d84036d6c86f1a95173b6a8f9c4f694278252cc9f","observation_id":"cd3ee770-4322-4bd8-9d30-f2c3e99d076c","resolution":{"observed_at":"2026-08-08T21:06:56.068139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.072383Z","title":"The wasserstein distances","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.072383Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:93938ff6966d7ff16a023b421faab24fa802c338cb0b1e24b4b63bca2159d38e","observation_id":"7e5f683d-ee24-4e37-bb56-4e66c8530de7","resolution":{"observed_at":"2026-08-08T21:06:56.072383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-08T21:06:56.076683Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.076683Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8e4447d4358fe2ce44b209c547a0a1ff422119c5b676e7620f6abd6027611207","observation_id":"f8d9cf8e-f1cc-4754-95ea-77d0287e45b6","resolution":{"observed_at":"2026-08-08T21:06:56.076683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.081306Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.081306Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5d5f97eba48c089e86707ec4ce63bb456a437ec60aa6aedba81cdec9fb4188c1","observation_id":"c30e8831-9260-4a73-817d-aa3178454530","resolution":{"observed_at":"2026-08-08T21:06:56.081306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.053907Z","title":"Diff-erank: A novel rank-based metric for evaluating large language models","venue":null,"work_id":"695f7db4-c481-433a-a088-a082b7f20e98","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.085269Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5b7d47f538ca311517c5e0461ee9d92075235acf0a21b540ace7086cb1e98748","observation_id":"d1bae7d8-6fc3-4d92-8aa1-a01fabec5b31","resolution":{"observed_at":"2026-08-08T21:06:57.057955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-08-16T14:03:33.898248Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-08T21:06:56.089277Z","title":"Reft: Representation finetuning for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.089277Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:bb2eb6705dfde0e382f86e1ec359ae2f7f56b319de55020d2dc58f715fe3fe37","observation_id":"98241810-e6fc-4da6-b8c2-fdd71696400b","resolution":{"observed_at":"2026-08-08T21:06:56.089277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13712","last_updated":"2024-09-07T02:07:22Z","snapshot_observed_at":"2026-08-16T13:20:36.491604Z","submitted_at":"2024-09-07T02:07:22Z","title":"Good Idea or Not, Representation of LLM Could Tell","version":1},"cited_work":{"arxiv_id":"2409.13712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13712","snapshot_observed_at":"2026-08-08T21:06:56.366710Z","title":"Good Idea or Not, Representation of LLM Could Tell","venue":"cs.CL","work_id":"bbaac2a7-b71b-4cec-8417-834c7e07b59a","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.093042Z"},"links":{"cited_paper":"/paper/2409.13712","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:a877e883579d22dd313ba1b664afce3f1c89c561ae1e544aba8200ba3c139b49","observation_id":"7c478ef5-0b34-4c83-a5d5-0e163c9ce198","resolution":{"observed_at":"2026-08-08T21:06:56.371735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T21:06:56.096969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.096969Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:20b8e21b4797e7d1bc61a658347e9a1eb03745ecd60d56c4872df4ac420b5440","observation_id":"f4abf341-265d-49b5-9dd6-72f6a8734d07","resolution":{"observed_at":"2026-08-08T21:06:56.096969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.100706Z","title":"A fingerprint for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.100706Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3b0b0deb06957da01c3742e6e792de796202e0cd67b6b0c6d0df8f130532229e","observation_id":"40f6b988-4f04-4cc0-a4eb-880f270b3154","resolution":{"observed_at":"2026-08-08T21:06:56.100706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01563","last_updated":"2024-10-31T02:04:53Z","snapshot_observed_at":"2026-08-18T03:09:08.720162Z","submitted_at":"2024-06-03T17:45:41Z","title":"LoFiT: Localized Fine-tuning on LLM Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01563","snapshot_observed_at":"2026-08-08T21:06:56.104290Z","title":"Lofit: Localized fine-tuning on llm representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.104290Z"},"links":{"cited_paper":"/paper/2406.01563","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f0d9a1fd6f7769435d7b1c87471a5d35f4db211eca4b856a2b5c84f6ca75e46a","observation_id":"091dd076-9a66-4127-95df-8f08f6cecf83","resolution":{"observed_at":"2026-08-08T21:06:56.104290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.108043Z","title":"Barlow twins: Self- supervised learning via redundancy reduction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.108043Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:810947df410315b56869efd0b1f4133b54855e855d0b430fe35f30897c9b4120","observation_id":"dab498e3-2f81-4167-bdea-0c80fc1fe5dc","resolution":{"observed_at":"2026-08-08T21:06:56.108043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04281","last_updated":"2024-09-27T23:15:50Z","snapshot_observed_at":"2026-08-16T14:04:06.294634Z","submitted_at":"2024-04-03T03:17:28Z","title":"Similar Data Points Identification with LLM: A Human-in-the-loop Strategy Using Summarization and Hidden State Insights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04281","snapshot_observed_at":"2026-08-08T21:06:56.111620Z","title":"Similar data points identification with llm: A human-in-the-loop strategy using summarization and hidden state insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.111620Z"},"links":{"cited_paper":"/paper/2404.04281","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:c2bbb7e7121495f9d882bd9549cdbfa98ae97ccead7397ff2b6f559316f38af3","observation_id":"d647cc87-41ae-40f1-8821-278ab1fcf4b6","resolution":{"observed_at":"2026-08-08T21:06:56.111620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17169","last_updated":"2025-06-04T15:32:37Z","snapshot_observed_at":"2026-08-16T13:17:40.747743Z","submitted_at":"2024-09-17T22:40:54Z","title":"REAL: Response Embedding-based Alignment for LLMs","version":4},"cited_work":{"arxiv_id":"2409.17169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17169","snapshot_observed_at":"2026-08-08T21:06:56.200979Z","title":"REAL: Response Embedding-based Alignment for LLMs","venue":"cs.CL","work_id":"88a305a8-8768-4f4c-b954-9da6ec71dcdf","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.115603Z"},"links":{"cited_paper":"/paper/2409.17169","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8279a1c8d99813ed6088b98529eadaa737a7a32da8aae408d7bd5de79e20cddf","observation_id":"dcbaeea0-a2a4-4a7a-b6d0-5364c23af323","resolution":{"observed_at":"2026-08-08T21:06:56.207427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14273","last_updated":"2024-10-18T08:27:02Z","snapshot_observed_at":"2026-08-19T01:34:23.821278Z","submitted_at":"2024-10-18T08:27:02Z","title":"REEF: Representation Encoding Fingerprints for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14273","snapshot_observed_at":"2026-08-08T21:06:56.119689Z","title":"Reef: Representation encoding fingerprints for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.119689Z"},"links":{"cited_paper":"/paper/2410.14273","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:fbc3387b902bb9302bb1a25072124e245e84a8c0e4927905688d55c1706240b5","observation_id":"62028e91-3ff0-4b67-8729-f27302ce3255","resolution":{"observed_at":"2026-08-08T21:06:56.119689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-08T21:06:56.123451Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.123451Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8ebeb25d9312aefe52099d51f68821c27f28a07b0c0691e7dff230cdd5e29d7f","observation_id":"a5d8497d-01d9-4a05-9ebb-a9209b335a59","resolution":{"observed_at":"2026-08-08T21:06:56.123451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.031880Z","title":"Improving alignment and robustness with circuit breakers","venue":null,"work_id":"860333d5-e406-4edb-aad9-d5f119da6583","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.127637Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f77665b3fb5202b2298b00fbb4311d5cdb740a2dd43765dfa83e3cf4475c9207","observation_id":"d4a13672-7dec-4bf3-a6fa-701fb7cf5a0d","resolution":{"observed_at":"2026-08-08T21:06:57.035985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.018983Z","title":"[ 62] disentangles LLMs’ awareness of fairness and privacy by deactivating the entangled neurons in representations","venue":null,"work_id":"13cdacb8-28bf-42f0-b479-34d603a597d3","year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.131162Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:79e6f84dc59d1fc355f231a7bfee43fa80c4e7e0000ec3482b7979290fa33735","observation_id":"5e295cd8-8b93-4bf9-866d-ec29bbb9cc8e","resolution":{"observed_at":"2026-08-08T21:06:57.023153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.006060Z","title":"safe\" or","venue":null,"work_id":"5c39fa57-4044-49e2-85aa-4979ee2f0e69","year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.135403Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:1661a97594772f1c05d0e1eb3a9ee66107d1c9fd781658c1349f25af4ada7714","observation_id":"f4ef902d-32e2-4788-bb28-1158b52b904a","resolution":{"observed_at":"2026-08-08T21:06:57.010023Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T15:11:30.438627Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":7,"verified_fuzzy":14},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 1 inbound Pith citation observation for arXiv:2502.05242."}