{"as_of":"2026-08-09T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:516e59ec80f853953d50856484fab33c1512aa7a5dd8c93c2b3ebb242c7f7422","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:34:08.054013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T14:33:31.328935Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-08-07T22:34:08.054013Z","title":"Selective attention improves transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.12170","last_updated":"2025-05-28T12:57:47Z","snapshot_observed_at":"2026-08-07T23:11:12.819339Z","submitted_at":"2025-02-13T10:26:27Z","title":"MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T22:34:08.054013Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2502.12170"},"observation_digest":"sha256:8f2f598ebb44179df951be6abf7d9d02f61917b18ba561deeb6d3afb10c4ade7","observation_id":"4580450f-51c6-4231-87ed-b6b090347ca0","resolution":{"observed_at":"2026-08-07T22:34:08.054013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":"2410.02703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-06-29T14:33:31.328935Z","title":"arXiv:2410.02703 , year =","venue":null,"work_id":"00fa537d-f149-4c82-a898-9ea0c0c48e00","year":2025},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-08-09T04:39:32.729075Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:5f63ebea839f0efce6e2047b537cf0b2d3c8fef1024fd214536c3779ba48e10e","observation_id":"ed200003-100b-40e0-9c1b-890f70af1cbe","resolution":{"observed_at":"2026-05-09T06:15:37.655983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":"2410.02703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-06-29T14:33:31.328935Z","title":"arXiv:2410.02703 , year =","venue":null,"work_id":"00fa537d-f149-4c82-a898-9ea0c0c48e00","year":2025},"citing_paper":{"arxiv_id":"2605.20798","last_updated":"2026-05-20T06:43:34Z","snapshot_observed_at":"2026-08-02T17:01:43.729235Z","submitted_at":"2026-05-20T06:43:34Z","title":"Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-21T06:15:47.451870Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2605.20798"},"observation_digest":"sha256:d0dfce400c28cd3b2b5b4f6ad8daaee8b59fcd6c146592e40f5dbf879b06fa80","observation_id":"ccd74e93-5200-4999-927e-203e6a584196","resolution":{"observed_at":"2026-05-21T06:19:42.048320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":"2410.02703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-06-29T14:33:31.328935Z","title":"arXiv:2410.02703 , year =","venue":null,"work_id":"00fa537d-f149-4c82-a898-9ea0c0c48e00","year":2025},"citing_paper":{"arxiv_id":"2605.30429","last_updated":"2026-05-28T18:00:13Z","snapshot_observed_at":"2026-08-06T07:50:42.154413Z","submitted_at":"2026-05-28T18:00:13Z","title":"Attention-based optimizer for symmetry finding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T06:35:55.732968Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2605.30429"},"observation_digest":"sha256:833fc0a55fada2c25ea066b7703420065282efd0c5b39ef0579d6ea7e316e84b","observation_id":"55e852be-ff82-45ff-87e9-4546c425d184","resolution":{"observed_at":"2026-06-29T14:33:31.330444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-08-01T18:06:54.522323Z","title":"arXiv preprint arXiv:2410.02703 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17419","last_updated":"2026-07-19T21:46:09Z","snapshot_observed_at":"2026-08-05T15:40:44.010247Z","submitted_at":"2026-07-19T21:46:09Z","title":"Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T18:06:54.522323Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2607.17419"},"observation_digest":"sha256:b4e78268e1d8488c61f87cff444b7d83f11af342e482febe60056fccc15e8b4c","observation_id":"9d0894d7-d7f6-4bd8-9b9b-d9c088546a0d","resolution":{"observed_at":"2026-08-01T18:06:54.522323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02703","snapshot_observed_at":"2026-08-01T02:37:54.185863Z","title":"Selective attention improves transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-08T07:59:40.180280Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.185863Z"},"links":{"cited_paper":"/paper/2410.02703","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:c9ba5e5537f4cfc10d37dad3853557bf4540da71e396c4cf05a4c8747b2a98ec","observation_id":"430744ad-7d24-4fa1-8623-4b32c6560d22","resolution":{"observed_at":"2026-08-01T02:37:54.185863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02703/citation-record","integrity":"/paper/2410.02703/integrity","json":"/paper/2410.02703/citation-record.json","paper":"/paper/2410.02703"},"outbound":[],"paper":{"arxiv_id":"2410.02703","last_updated":"2025-04-24T02:44:54Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T11:47:02.508198Z","submitted_at":"2024-10-03T17:27:30Z","title":"Selective Attention Improves Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.02703."}