{"as_of":"2026-08-17T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:facb8973f9654cf872ff2022e61d720c81cdc2a82b10715f76c1c4c417171ff3","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:31:39.220992Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21468/citation-record","integrity":"/paper/2506.21468/integrity","json":"/paper/2506.21468/citation-record.json","paper":"/paper/2506.21468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.866551Z","title":"How can we be so dense? the benefits of using highly sparse representations, 2019","venue":null,"work_id":"fe0b9763-a0e7-45b6-9c9e-aa6cd742a24c","year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:19.862785Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:e76c902425e8958fb688a2e2f2466e60669072d0bf1961bf7d21887a17710463","observation_id":"789d64b4-69c1-41fb-80dd-51772945f630","resolution":{"observed_at":"2026-08-06T22:31:44.922624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:34.787577Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.787577Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:6dff27988d298006b0a35d3f628a7fae2beec7114a9192108ebb69c711f37d18","observation_id":"252a90f8-e166-4ccf-8aa8-0427bd7175dd","resolution":{"observed_at":"2026-08-06T22:31:34.787577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:31:34.894657Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:34.894657Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:e490881a5bc290b3e437bc803eea3fc8e96a047bf5356b9a058c1a18d01529ea","observation_id":"674b7941-d134-4ec2-b182-617c4b245cb5","resolution":{"observed_at":"2026-08-06T22:31:34.894657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.739432Z","title":"[Full Post] Progress Update #1 from the GDM Mech Interp Team","venue":null,"work_id":"f629a0ba-34c1-4cf9-ac72-61b71eafff20","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.076386Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:918c5dfc11dbc9e59dc26735ad42aa1b57cad68c1dc0d6f941e125636847cb38","observation_id":"7a6bcd59-399b-4e81-a450-405ea058ef91","resolution":{"observed_at":"2026-08-06T22:31:44.790819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.158355Z","title":"Sparse autoencoders find highly interpretable features in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.158355Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:2514fcaf88bd30f65960157b72d3638ee535c345d0f45ef75abccfaecf240a4e","observation_id":"ba9b874e-ce44-4514-9642-ba67d7764f98","resolution":{"observed_at":"2026-08-06T22:31:35.158355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.630217Z","title":"Rigging the lottery: Making all tickets winners","venue":null,"work_id":"28a75298-7eb8-4b60-804a-a6d95764bc42","year":2020},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.321207Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f6475ac1247b87ee6527d393e88d0134bad748d879d2e033c7b6d83b1d804125","observation_id":"f0204e56-9a10-4e7c-947b-1d805f936fb0","resolution":{"observed_at":"2026-08-06T22:31:44.685373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.512794Z","title":"Sparsity in transformers: A systematic literature review","venue":null,"work_id":"c0c20002-0924-42c4-a546-d2362fa3fee4","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.434488Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:7e2d2e44fae987b3e76d68c7d31856abffcc257ea2c0e0b8eb31ec57ff5b57db","observation_id":"30ea9f6d-00f7-4f49-964f-0f3dc6a16879","resolution":{"observed_at":"2026-08-06T22:31:44.560982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:35.530869Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.530869Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:a52489ae4ffd32436f1b80b6e889c66fe97b9d2a7008b0ece0c4ec9c774d024a","observation_id":"72d4a652-94cd-4b34-a2aa-d89f288ff9b0","resolution":{"observed_at":"2026-08-06T22:31:35.530869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.409582Z","title":"Scaling and evaluating sparse autoencoders, 2024","venue":null,"work_id":"adf0da22-03fa-466c-bcb7-e96fdcfedc1b","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.680217Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:759fbc1634dc0247d230e70c66fd3afcc14344cb5cad59f7b4dffa898f6bc49a","observation_id":"6f137638-06ec-406b-9ce0-061a3bf57b53","resolution":{"observed_at":"2026-08-06T22:31:44.452327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.323249Z","title":"The language model evaluation harness, 2024","venue":null,"work_id":"de92f63f-e001-4e6e-9270-912a21074f07","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.732571Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0d8bb3fe12e1431e1c3ddc8739499db6a97268ae96ecc66deff8bbb531ca94c4","observation_id":"f4e0c28a-7209-4240-955b-333c6e0ea7da","resolution":{"observed_at":"2026-08-06T22:31:44.370392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.205708Z","title":"Causal Abstractions of Neural Networks","venue":null,"work_id":"68242395-4ef5-4d72-849b-019a56891779","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.794053Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:63548c6b69c89291f812c2f713bb9d7781f1b08b7d9ab2f6488c8cab239f20df","observation_id":"ee4dd635-db57-410b-9324-1787e68f3a5c","resolution":{"observed_at":"2026-08-06T22:31:44.255996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:44.098224Z","title":"The State of Sparse Training in Deep Reinforcement Learning","venue":null,"work_id":"1d33476d-3caf-48c7-8d03-255166755321","year":2022},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:35.872432Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:2b780acdbf74fe408af7aecfe43a56b2b302ed1f8a4185697aa2e52f00f7cfce","observation_id":"04f5fb92-8a51-49c8-b8d4-d99b82567568","resolution":{"observed_at":"2026-08-06T22:31:44.158063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.993708Z","title":"Memory-efficient transformers via top-k attention, 2021","venue":null,"work_id":"4f22e5dc-f213-4c99-9747-b8ef6c66dfb7","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.032941Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:06d6cd1e6085d91a36d4cff9848d4fddd7a30047e29c3e7469b8a9e449c8d108","observation_id":"aa35ef23-a1e2-4365-8576-b6daf9a5c923","resolution":{"observed_at":"2026-08-06T22:31:44.047952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.884597Z","title":"Llama scope: Extracting millions of features from llama-3.1-8b with sparse autoencoders, 2024","venue":null,"work_id":"856de5fe-cae0-4e36-9593-79f2cb9408ac","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.096247Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:e630096c85f97a838984ac8a86db66090b15f3d261f175640d28ab2c84f4e982","observation_id":"3f7984cd-049b-4bda-86f3-9384fd31b028","resolution":{"observed_at":"2026-08-06T22:31:43.933604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.772022Z","title":"Hindupur, Ekdeep Singh Lubana, Thomas Fel, and Demba Ba","venue":null,"work_id":"0ad427de-5570-4cd7-a1e8-3f6f43f01442","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.144498Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:37af2ab595eea74bb63a554ceb952af062369d27e21d8cda2d98e7cb294dc861","observation_id":"cdb4a400-794b-422a-b9db-23e9e5554868","resolution":{"observed_at":"2026-08-06T22:31:43.826679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13896","last_updated":"2021-12-27T20:41:01Z","snapshot_observed_at":"2026-08-16T17:31:44.329656Z","submitted_at":"2021-12-27T20:41:01Z","title":"Two Sparsities Are Better Than One: Unlocking the Performance Benefits of Sparse-Sparse Networks","version":1},"cited_work":{"arxiv_id":"2112.13896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.13896","snapshot_observed_at":"2026-08-06T22:31:39.485775Z","title":"Two Sparsities Are Better Than One: Unlocking the Performance Benefits of Sparse-Sparse Networks","venue":"cs.LG","work_id":"cc058575-b76c-47ed-bcee-b6ed824cc133","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.250242Z"},"links":{"cited_paper":"/paper/2112.13896","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f0cb457a08fa89fe2d90e3ab3e663e85109af9e6f22feca5fa59957c6488a969","observation_id":"93a23817-5ae8-4063-9a61-cc7a57c7407d","resolution":{"observed_at":"2026-08-06T22:31:39.565510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.676880Z","title":"How llms learn: Tracing internal representations with sparse autoencoders, 2025","venue":null,"work_id":"45df477e-1c36-4544-a638-8f8090bb35f9","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.341495Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:96837ea1683789cfa461cbac740e5ab993ff0e2a4f998cea0614cc2e58e1e057","observation_id":"431d5c70-f9cd-434d-b265-d0c8d173ceb6","resolution":{"observed_at":"2026-08-06T22:31:43.727068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.567275Z","title":"Sparse is enough in scaling transformers, 2021","venue":null,"work_id":"188e5fb5-43ca-4737-9f27-22a5e1ed679a","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.403525Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:51b1736940076a0d9a7d29d38ee475fbad7d58c13a7184b335512e09271d3191","observation_id":"d3c0bed0-dcef-4bad-a2a3-7229280fc0ad","resolution":{"observed_at":"2026-08-06T22:31:43.615792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03517","last_updated":"2021-06-07T11:13:05Z","snapshot_observed_at":"2026-08-16T18:19:08.060598Z","submitted_at":"2021-06-07T11:13:05Z","title":"Top-KAST: Top-K Always Sparse Training","version":1},"cited_work":{"arxiv_id":"2106.03517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03517","snapshot_observed_at":"2026-08-06T22:31:39.343701Z","title":"Top-KAST: Top-K Always Sparse Training","venue":"cs.LG","work_id":"89d23a65-a561-4ffc-912d-a8e368c9d2d4","year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.509531Z"},"links":{"cited_paper":"/paper/2106.03517","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:e709b567ee3cae60381341093e843a786eba041e06f7c46a438f696404c129e0","observation_id":"d7578cb5-abb8-45ff-b7d9-85726b9abc70","resolution":{"observed_at":"2026-08-06T22:31:39.411734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.419584Z","title":"Saebench: A comprehensive benchmark for sparse autoen- coders in language model interpretability, 2025","venue":null,"work_id":"b9182837-59fd-453b-b776-cfabce630223","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.629380Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:12fe71a4f30aae291636c9a09859fb40c9afea0038f71d3eeaad231213a25b6a","observation_id":"4f91072b-f53e-4f6f-b9bf-d3d8d7b64d13","resolution":{"observed_at":"2026-08-06T22:31:43.505754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.238322Z","title":"Concept steerers: Leveraging k-sparse autoencoders for controllable generations, 2025","venue":null,"work_id":"4beccd7d-375b-4c94-93d6-2396bf206a6e","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.737124Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:4cf44ed625c9590ab7d59d61c14928ebea1d0dbd7f579dc04f29478366847b12","observation_id":"1d8d7c24-9783-465d-9c80-be28083f430a","resolution":{"observed_at":"2026-08-06T22:31:43.327447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:43.088532Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","venue":null,"work_id":"385d25f3-47f3-45ef-a725-9ed0d4602149","year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.842439Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:beae2b957d365c9e5e46251e6ddef93b65fde0a3853c8fa99934d6c90d1db312","observation_id":"88cbb3b3-8ac3-4ba0-8158-3b1251dba858","resolution":{"observed_at":"2026-08-06T22:31:43.166195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.931527Z","title":"Soft Threshold Weight Reparameterization for Learnable Sparsity","venue":null,"work_id":"33e1e462-ba05-4b84-987e-9656e788cb7d","year":2020},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.925606Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:6394f841778aeabdd3c352052b230434e36a7daca80c7a78b9ebc5188174eacf","observation_id":"3edfc9c7-94f6-4281-a590-880224887ad8","resolution":{"observed_at":"2026-08-06T22:31:43.002177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.724521Z","title":"Sparse autoencoders do not find canonical units of analysis, 2025","venue":null,"work_id":"8bed8ee2-d614-438b-85cf-370d0d145ae0","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.983433Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:522186440ae58e049b38e7113c74cd622853751ae2fa422de16e57bc9bedb84a","observation_id":"a05d54fd-ae7b-4413-b870-4cecc3413d54","resolution":{"observed_at":"2026-08-06T22:31:42.807089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.056013Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.056013Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:5ca9951d9c97d8504cf7c154237d640746f0f150cc12e38057eef4d0b5eb6ab1","observation_id":"5f4fba51-bb4a-4ebd-9a82-f17b303fec40","resolution":{"observed_at":"2026-08-06T22:31:37.056013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.178870Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.178870Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:5fa90d617040b2bf980e5824639a4d0a38eb9aa0d47cadd7714d3cfb66d88c52","observation_id":"0e04cee2-46f0-46d1-ade5-282892edb508","resolution":{"observed_at":"2026-08-06T22:31:37.178870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.536416Z","title":"Learning sparse neural networks through l_0 regularization","venue":null,"work_id":"1dbe86c1-7ef7-4596-8050-47cd70c0332c","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.243550Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f44c4a226cc532d7eea3ff6e728efa6d108543054f714021c0f838c48240debb","observation_id":"dfa20b76-4411-44f4-807f-6be32170786e","resolution":{"observed_at":"2026-08-06T22:31:42.623753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.336793Z","title":"Fineweb-edu: the finest collection of educational content, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.336793Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:685f1ee6fcbf0e616299bc397488a77c34c98f7be90cf437c005fe2c72daeb1e","observation_id":"8a792f02-b2c6-45e8-b471-bb1f4f042e41","resolution":{"observed_at":"2026-08-06T22:31:37.336793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.326452Z","title":"Winner-take-all autoencoders","venue":null,"work_id":"96fc224a-0b32-47cb-afe3-acebd8413345","year":2015},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.409944Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:0750323f9d5da1a9e0630440142ec4993ba40c5831f6e429b340ebd4243c6ddb","observation_id":"c81c18f1-a5e1-419b-878a-9a4b2a29115b","resolution":{"observed_at":"2026-08-06T22:31:42.399846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:42.166222Z","title":"Pointer Sentinel Mixture Models","venue":null,"work_id":"67b7214a-a9b0-484c-a76b-72ebb90081b0","year":2017},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.516145Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:1b306ec9afb135e94392f13fdb79a44db45db69fe203c63fa006444d8bd580de","observation_id":"cf1a13db-df4e-4f85-8d87-3a1f51a45d56","resolution":{"observed_at":"2026-08-06T22:31:42.252639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.979927Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"abd5ce17-e55a-45b8-9d30-da756840dae3","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.572894Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:aab457b55ad60c89595102e7ab085c64b1688c5b557da0ea5d7b6c9db5ec6704","observation_id":"6cc3d4c0-c29f-45dc-b26e-406dba71cc93","resolution":{"observed_at":"2026-08-06T22:31:42.067358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.789934Z","title":"Nguyen, Madeleine Gibescu, Antonio Liotta, and et al","venue":null,"work_id":"6b7a54bb-7d2f-431b-9e07-b20284fc8404","year":2018},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.620117Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:3fb79947e58e4c94170894ae7bac44abb0147cacce2941944babc9352d9125e8","observation_id":"69e9c625-3b6b-45ee-883a-cc68e008da50","resolution":{"observed_at":"2026-08-06T22:31:41.886349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.581765Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"c883d9ad-63ef-4c05-bd18-e817e7734a1b","year":2016},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.666381Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:e9540c0e5489bff71953416db470d2f15fecf70b4b543baa65772fb1e04c6835","observation_id":"2a719d09-833e-4914-8ee3-0b74cd9203b5","resolution":{"observed_at":"2026-08-06T22:31:41.688817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.373164Z","title":"Sparse autoencoders trained on the same data learn different features, 2025","venue":null,"work_id":"97f57fdb-7e35-414d-994e-26e5601e1669","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.703915Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:bb0f18662f2416b1b94dc6f163a96dadf1e8b60068168f2f9139fbf1b02bfac2","observation_id":"6dd0f983-9ab7-4e9c-8faf-5f2e127b6e35","resolution":{"observed_at":"2026-08-06T22:31:41.469546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:41.152547Z","title":"Automatically interpreting millions of features in large language models, 2024","venue":null,"work_id":"e2ee9980-091c-45a9-82fd-3e93fb5ee493","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.798385Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:13968f06de00e54129961117820af76a022c95fe38b417ec88bad499fb8c7924","observation_id":"0754bfa7-a587-49c0-ab97-1f49c4ce81b1","resolution":{"observed_at":"2026-08-06T22:31:41.268686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.937084Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":null,"work_id":"74cca70f-1528-46c1-9539-0cdf45f62607","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.854065Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:83cb0fa87e078178025ecd4efb167f9a77f47a5bcefbfbb138b55ce1ca13e396","observation_id":"a1125760-f628-4ca2-9ebb-4d6f608633bf","resolution":{"observed_at":"2026-08-06T22:31:41.035447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:37.972247Z","title":"Improving dictionary learning with gated sparse autoencoders, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:37.972247Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:1ee20068f678b4a7ecf79be25f5d040e607be7f30a8581ba878d106652a0676d","observation_id":"d02c0341-8289-4f6a-9e93-7c948279a759","resolution":{"observed_at":"2026-08-06T22:31:37.972247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.142907Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.142907Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:d1e14729d1b24d1f72de1d0c214b41e31afda7b4c5cdb6878a655b5579d5e778","observation_id":"acedd645-2f42-434a-8ef1-aebff0af90bb","resolution":{"observed_at":"2026-08-06T22:31:38.142907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.764914Z","title":"Taking features out of superposition with sparse autoencoders","venue":null,"work_id":"8a4f341d-8901-4c86-a588-a56bc97f30e4","year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.258973Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:f555bbfb8d42d076ea0b7a2d6cd81e65c7d6e81023bec7b5cc238b311601cdea","observation_id":"8f6dab73-abb4-4500-b8d5-f326759064a8","resolution":{"observed_at":"2026-08-06T22:31:40.851527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:38.370614Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.370614Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:4955d94984413e886f01a7f7a273bf22ff1c0a215cdffc3ba47d0bfd1e8c924d","observation_id":"ed8b5f35-897e-4c8d-9f38-e00bfacbbac6","resolution":{"observed_at":"2026-08-06T22:31:38.370614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.562786Z","title":"A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models, 2025","venue":null,"work_id":"a410872f-7025-4ec9-b81e-2a05dfd87e06","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.509917Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:ef12a23094473f200def2197cb8c398cc095146fec8cc6bb764c4cc77c3d1b6c","observation_id":"1ddad81e-ea7a-41e9-b420-c9e5d64197bd","resolution":{"observed_at":"2026-08-06T22:31:40.670077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17230","last_updated":"2023-10-26T08:28:48Z","snapshot_observed_at":"2026-08-16T14:48:42.299196Z","submitted_at":"2023-10-26T08:28:48Z","title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17230","snapshot_observed_at":"2026-08-06T22:31:38.680344Z","title":"Codebook features: Sparse and discrete interpretability for neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.680344Z"},"links":{"cited_paper":"/paper/2310.17230","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:60820ee57f05b9e255a63ddbdc9f5bc54e1f8b2674adc79e7ead084601547d46","observation_id":"9c0496bf-71fc-42ea-a76c-b215fc6f7781","resolution":{"observed_at":"2026-08-06T22:31:38.680344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.376833Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":"055c0b89-de7a-448b-98ac-51f752f8ebeb","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.794923Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:1df8cb658550ec3d53158a9d2d975d71384cea2faab880720c5bb6da2a71f7e7","observation_id":"e1b8015f-8dca-48ee-a6d5-94e0197c7317","resolution":{"observed_at":"2026-08-06T22:31:40.462326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:31:38.890079Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.890079Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:13233dccd251b6ce6c69358d3ca4c67c78a84676e8cb7986bbe65d806e03130b","observation_id":"4e902680-9768-47c0-aae7-a1a9b5f98c7c","resolution":{"observed_at":"2026-08-06T22:31:38.890079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.189887Z","title":"Meta Lingua: A minimal PyTorch LLM training library, 2024","venue":null,"work_id":"a2313bea-bf6a-4395-937b-71849c415705","year":2024},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:38.998159Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:c977a4ddc0fedde70998df7e440158864c46ef2324a49f25e7c3306bd7688dee","observation_id":"3ea79e63-1c97-4e4a-ad6c-80dc996c16ab","resolution":{"observed_at":"2026-08-06T22:31:40.282755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:40.005399Z","title":"Tracking the feature dynamics in llm training: A mechanistic study, 2025","venue":null,"work_id":"e052c69f-a287-45f8-a02d-3d2b2ddc8a7f","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.060459Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:cc726d69087292c51b78717ba26730ffb56f2e3915edea03cabea96d58af08eb","observation_id":"373449a0-f1a3-45e0-b63a-24c6155ab499","resolution":{"observed_at":"2026-08-06T22:31:40.093824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.807955Z","title":"STEP: Staged parameter-efficient pre-training for large language models","venue":null,"work_id":"17b54228-febe-46d7-bb5c-44fa719728af","year":2025},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.121952Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:1de56478932b4dbbca176830d892974e295c5a2e52d114dbf3030a70d085d951","observation_id":"b26d6674-e1c9-49fd-a3d2-63892221c21a","resolution":{"observed_at":"2026-08-06T22:31:39.921354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:31:39.655389Z","title":"HellaSwag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages 4791–4800, 2019","venue":null,"work_id":"fe0fbbfd-e9f3-423a-8454-e0aa56bbcfa1","year":2019},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.176817Z"},"links":{"citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:b9411dfd63c20753ef65190aaa6f21dc53ff99db3f405021bc63bdb0366363a0","observation_id":"4a13895a-5f6b-42e3-a2c2-6056c77dd21a","resolution":{"observed_at":"2026-08-06T22:31:39.727732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T22:31:39.220992Z","title":"PyTorch FSDP: Experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.220992Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.21468"},"observation_digest":"sha256:5780a7524a301b6b1e115d7311f7b60d56434877706b5bf03f492a7b9bf2ba7d","observation_id":"757b2521-884d-4004-a072-b40518b8c712","resolution":{"observed_at":"2026-08-06T22:31:39.220992Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21468","last_updated":"2025-06-26T16:56:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T19:42:40.351635Z","submitted_at":"2025-06-26T16:56:43Z","title":"TopK Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.21468."}