{"as_of":"2026-08-03T16:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df2e8f34e3c6d544bd08990c364b52316175f00cebba43353d5340dd254c2d7d","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:01:40.766843Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:35:22.750886Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05971","snapshot_observed_at":"2026-08-02T07:35:22.750886Z","title":"Training Transformers for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20538","last_updated":"2026-07-10T17:18:25Z","snapshot_observed_at":"2026-08-02T07:35:17.998151Z","submitted_at":"2026-07-10T17:18:25Z","title":"Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:35:22.750886Z"},"links":{"cited_paper":"/paper/2605.05971","citing_paper":"/paper/2607.20538"},"observation_digest":"sha256:1feca56646c76c054f5ad665ae7ae6e14abbd624573e399ed588eb868803d29c","observation_id":"7d34a2e8-94d2-4583-a0d8-ad9398ba8fba","resolution":{"observed_at":"2026-08-02T07:35:22.750886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05971","snapshot_observed_at":"2026-07-31T12:56:44.516747Z","title":"Aaron Grattafiori et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28263","last_updated":"2026-07-30T14:19:11Z","snapshot_observed_at":"2026-08-03T00:08:05.555204Z","submitted_at":"2026-07-30T14:19:11Z","title":"Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T12:56:44.516747Z"},"links":{"cited_paper":"/paper/2605.05971","citing_paper":"/paper/2607.28263"},"observation_digest":"sha256:62deaabba74a13c8c08d64909aff1ae1f33703e7d22be80f3f9817a3ee43bef2","observation_id":"910c87a8-5fa8-45c2-84b1-25cfb63079ee","resolution":{"observed_at":"2026-07-31T12:56:44.516747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.05971/citation-record","integrity":"/paper/2605.05971/integrity","json":"/paper/2605.05971/citation-record.json","paper":"/paper/2605.05971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.13722","last_updated":"2023-01-08T02:04:41Z","snapshot_observed_at":"2026-07-06T13:14:29.961613Z","submitted_at":"2022-05-27T02:32:26Z","title":"Can Foundation Models Help Us Achieve Perfect Secrecy?","version":2},"cited_work":{"arxiv_id":"2205.13722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.13722","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can foundation models help us achieve perfect secrecy?","venue":null,"work_id":"238e0436-ac53-42ea-b133-ae3351988583","year":2022},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2205.13722","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:31082f051b1b6fbe8867280aea077289cfb4a515cad3c6446677760eaa9cea67","observation_id":"1cbf67cf-30da-48db-9871-2b97be1dc410","resolution":{"observed_at":"2026-05-13T06:02:21.987477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:50:35.839225Z","title":"Longbench v2: Towards deeper understanding and reason- ing on realistic long-context multitasks","venue":null,"work_id":"483df3d1-b12f-4e8b-b870-b5817d5c621c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:7fefeb22089eab1282ab78136c6efa724f4a9dc5d8e048671dd5a36bc0fe3a58","observation_id":"aef4b139-e3c5-4177-9b93-3923e41c6c8d","resolution":{"observed_at":"2026-05-13T06:02:24.294421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-11T03:27:46.681766Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6bdb36a98d6f98b637806757d044f6b20ac36226fc8350532a5d0514cc950b6b","observation_id":"b4d5c7da-b73d-4ec3-a51a-c821f65cb593","resolution":{"observed_at":"2026-05-13T06:02:21.990094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:24.877495Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d1a9f293-b596-42e3-b48c-112b9f9a06df","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:951f4c7083f3a7efd47d1905686e736d3ed56b1d1102488a58fcb33f425d97b0","observation_id":"3493bf0e-5511-4291-a28e-3e97eaa32b7a","resolution":{"observed_at":"2026-05-13T06:02:21.793734Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"30f4b8bd-64e2-495f-a9fe-7fe29b29268a","year":2022},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5e46717c5f9e0413881fabc129ab733a706e75f3479b2f9853b56f2d43e779ce","observation_id":"7be11d93-61c2-4889-b04b-0795f160ba40","resolution":{"observed_at":"2026-05-13T06:02:24.289944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyramidKV: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":"08e56bd8-cbce-4c58-aa8d-59d476dce670","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a28ef459cfb0bb00cdeba412a1699833a840ef7d551a64f1a346520859aec210","observation_id":"9936c8c6-164c-45d0-93f7-f81526078cb2","resolution":{"observed_at":"2026-05-13T06:02:24.287922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15902","doi":"10.48550/arxiv.2602.15902","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Doc-to-lora: Learning to instantly internalize contexts","venue":null,"work_id":"68246c40-3863-455d-82ed-03dea2aad784","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:728522a34f507636f80504395f6de745d64bbcd46050cb4b56d691dc6630726b","observation_id":"66d1b34d-c5f2-42f7-8b5e-bc7920e8e19c","resolution":{"observed_at":"2026-05-13T06:02:21.959138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":"2503.09567","doi":"10.48550/arxiv.2503.09567","metadata_source":"pith","pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-07-10T18:57:31.639044Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":"cs.AI","work_id":"0b361fed-cf2a-4b90-b61a-de88de4b8840","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:ec32860e93caf691c3ee19447fca790181882b914e303649ec37ce0bce11bea8","observation_id":"a658111a-bcc5-49ea-9152-d1f6504481de","resolution":{"observed_at":"2026-05-13T06:02:21.981495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05877","last_updated":"2024-11-08T00:42:47Z","snapshot_observed_at":"2026-07-06T19:47:38.708013Z","submitted_at":"2024-11-08T00:42:47Z","title":"Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass","version":1},"cited_work":{"arxiv_id":"2411.05877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.05877","snapshot_observed_at":"2026-06-29T21:43:59.523418Z","title":"Generative adapter: Contextualizing language models in parameters with a single forward pass","venue":null,"work_id":"77c99007-545a-437f-af6d-54d1852f4f16","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2411.05877","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5b2cbe9f078115ec8553407e92fe93f3bc685e53676601842b9a5b0a2fa9ba74","observation_id":"1eba9c7d-de47-40c9-8bcf-90e758f08cbd","resolution":{"observed_at":"2026-05-13T06:02:21.953195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting language models to compress contexts","venue":null,"work_id":"d40dd826-89eb-49f2-b3e1-c2ac00577674","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3597baf4f8ca6c8f4888c0319615950f5311a54d8c9084e3478ecd4a9f1a8b29","observation_id":"3c77b851-8b43-40e8-9fbd-2e4dda0c619b","resolution":{"observed_at":"2026-05-13T06:02:24.285790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-07-11T01:47:47.727352Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:defcb5e678d170f2389b38f749007ef4a846983be01dc6e1fc1e7e95f833d381","observation_id":"d9c843de-99c1-4fab-9c12-28c8a18157f2","resolution":{"observed_at":"2026-05-13T06:02:21.943990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:8c95503b2ffa9106354376e6e1bc65ac8126b56211a6cbd6e8bb985f09111e01","observation_id":"4db62a8c-2dd1-455a-a48d-c04e2aa53630","resolution":{"observed_at":"2026-05-13T06:02:21.967996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n18-2097","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:43.144167Z","title":"InProceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers)","venue":null,"work_id":"3f953153-3adc-4d0a-991e-da2233c3fdef","year":2097},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:33c6de8475a33dede1109faf9e37da2e3ffc3241fbb76c849bd29f107408e8e1","observation_id":"f93f265d-ef37-4145-ac87-3a3901e4034c","resolution":{"observed_at":"2026-05-13T06:02:21.797274Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:29:08.271003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:29:08.271003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:53:58.730509Z","title":"Approximation by superpositions of a sigmoidal function.Mathematics of control, signals and systems, 2(4):303–314","venue":null,"work_id":"131a9bf6-1720-4d86-ad85-ce6df6567aba","year":1989},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f405766df069743a64b06694c7e89a41aecfa8fa830d6638e708fa6d87ef9144","observation_id":"f84f24d0-bfe3-49f4-9a63-c1def112e4f3","resolution":{"observed_at":"2026-05-13T06:02:24.278883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14382","last_updated":"2021-10-27T12:31:43Z","snapshot_observed_at":"2026-07-06T12:02:36.241266Z","submitted_at":"2021-10-27T12:31:43Z","title":"The centered convex body whose marginals have the heaviest tails","version":1},"cited_work":{"arxiv_id":"2110.14382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.14382","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The centered convex body whose marginals have the heaviest tails","venue":null,"work_id":"e82b00e0-bca9-4552-9215-23a8ed881368","year":2021},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2110.14382","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:c7e91561d629b3ea3e5f66bb16756259c0b78bd020c3aee764c1be86b56695a1","observation_id":"dae1ed25-d9e0-412f-9bfd-c30c20856816","resolution":{"observed_at":"2026-05-13T06:02:21.946969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","venue":null,"work_id":"3c4fe23f-3b1a-488e-99ee-302a75dab4af","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:931c29323114b4c0d40bb358b50571ed279052dd3ee2b829a2702cd992c0bfe0","observation_id":"9e953d73-6031-42fc-9a30-726e1da7f055","resolution":{"observed_at":"2026-05-13T06:02:24.283639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1fb3cb24bcaaf378ce1e482a070fa43fd37936850540954ddb0bf8eebc8b1a9c","observation_id":"b5a6d708-345a-4c78-bccf-c14a19e9d834","resolution":{"observed_at":"2026-05-13T06:02:21.997183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6b8690f20a92163859bc396c41142700708ff214d4f4c2468b2f9fde65256f3b","observation_id":"fa307a39-d96e-414a-895a-048eb46a3527","resolution":{"observed_at":"2026-05-13T06:02:21.984721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lighte- val: A lightweight framework for llm evaluation","venue":null,"work_id":"2be77100-2b9b-4936-ade3-ef8430017fa2","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:06f2bf6040020004e20ffa6bdbfd9bf2a8a49672fec48ced4cf74e734befc451","observation_id":"af3ae607-84bb-4fd7-bb85-7ca3fc615b42","resolution":{"observed_at":"2026-05-13T06:02:24.281046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delta-net: Real-time network verification using atoms","venue":null,"work_id":"a7cea1f8-8367-4322-bf8a-0a67dbcf255a","year":2017},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:4c8b25d73380d682bfcaf3cab1f046b9de4edcac14a049eb022307ea3eb8aed7","observation_id":"90d9039f-cf5f-484a-8221-1c221834db3b","resolution":{"observed_at":"2026-05-13T06:02:24.296958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:03.230004Z","title":"Approximation capabilities of multilayer feedforward networks.Neural networks, 4(2):251–257","venue":null,"work_id":"7b11e809-4640-4c32-962b-4a7e7ad57f9e","year":1991},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:12201dde1aef2f10acad8bafdebb643b152fc98afb22640f14057ad7f6d5bcf0","observation_id":"7eec02fd-e121-411b-a8aa-89dbac8dd5cb","resolution":{"observed_at":"2026-05-13T06:02:24.274052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-07-11T03:47:48.585529Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:7cd2929e7ece203cb4fda41ffd60871105ec8b5fb02da16bce062fff72fce351","observation_id":"68a00469-4c6f-486a-9f23-033449813713","resolution":{"observed_at":"2026-05-13T06:02:21.965287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":"2311.11944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-07-04T20:40:08.190653Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","venue":"cs.CL","work_id":"b60d115e-50dd-42f6-9178-5d29b05e1e89","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1322725b213adc72d277e608d2d8bfb1a8520e1152c851e0693a5590a80d5e12","observation_id":"9a326a7c-54ae-4f48-bf4c-838d0e8a0510","resolution":{"observed_at":"2026-05-16T05:01:13.018607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLMLingua: Com- pressing prompts for accelerated inference of large language models","venue":null,"work_id":"737fea9f-041b-4c95-a5e2-36b9eb5db579","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:06ed1705fe9dc72f1ae34f8b3a55b3969d1459d6400211708a8d498697dede40","observation_id":"452ddc86-650e-4627-9d2e-738e064716b8","resolution":{"observed_at":"2026-05-13T06:02:24.271575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongLLMLingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":null,"work_id":"6dd7f39e-3394-45c3-9a4a-7ecbc1a6e765","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:45fc540472a9585d3d89d95f4c7eaff8401093cdcf0084634dfab7d444e01c9d","observation_id":"147a14f9-4813-44e6-8fc8-36fa5f80ccbd","resolution":{"observed_at":"2026-05-13T06:02:24.276579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal experimental designs.The Annals of Mathemat- ical Statistics, 37(4):783–815","venue":null,"work_id":"0e98e9a6-661d-4856-98d4-8b7a3e7eccab","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:22c5a290c6f933d5fc002fe511c1886c95692d2abe1464cda661ebd432f01e80","observation_id":"7b6c23f3-f5ff-4d25-a284-f34b0ee6cc09","resolution":{"observed_at":"2026-05-13T06:02:24.269453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tchebycheff systems: With applications in analysis and statistics.(No Title)","venue":null,"work_id":"5fe9cf05-4db3-4abe-8ccf-0482fbd63bf0","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:0733147d33b0c2e23c90b5af632839929cdaec125ace4ca2d7c79ad7d6244e45","observation_id":"7677d385-0243-47cc-85d4-c0dc0da6fdd1","resolution":{"observed_at":"2026-05-13T06:02:24.264839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chebyshevian spline functions.Siam Journal on Numerical Analysis, 3(3):514–543","venue":null,"work_id":"e49f2902-a4f4-4389-b980-23ace845412c","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:60136b2361179c14dd76349c4a298a4eb73df4f378ac90cb1a2e24d357d08811","observation_id":"14256ac9-4194-45c5-81a1-37e532fa0702","resolution":{"observed_at":"2026-05-13T06:02:24.267004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/itsc55140.2022.9922275","metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:35:02.874741Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"2022 IEEE 25th International Conference on Intelligent Transportation Systems (ITSC)","work_id":"538e32a7-33de-461c-9bcc-7d531a31fb65","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5ab6a4b0033beb5e3b4a52b88f9ac952cce139f5289ca2609cb52fec893e6fb1","observation_id":"dc366d46-17fc-4c89-9a35-3a056296534a","resolution":{"observed_at":"2026-05-13T06:02:24.260987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23416","doi":"10.48550/arxiv.2505.23416","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kvzip: Query-agnostic kv cache compression with context reconstruction","venue":null,"work_id":"5f731372-7406-4bf9-9ea7-10b18aad3813","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:550d5c341f46ceb118d0a373046463ce7df4760d26deebb4cc6e36965289b143","observation_id":"265f9aee-8bae-4477-8744-baafd32ad3aa","resolution":{"observed_at":"2026-05-13T06:02:21.971227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lexico: Extreme KV cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"afacd0d7-943a-41ba-84cd-5eff5a7d534d","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:fc7c33b23fd29624fdbe3644b5225440ad4c7f7a7719e2fa720d8e3bfb9d8fdd","observation_id":"0c3ab234-0bc3-47c1-a830-35e95aba6680","resolution":{"observed_at":"2026-05-13T06:02:24.254451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","venue":null,"work_id":"72db7074-caf5-495c-98f2-d3b4aa497c9e","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:fa556b94286982e6576010823132dbf479a19a4b0b823d8f834b87a03ce0036b","observation_id":"d9c0c9a0-9b89-4abd-a86b-dc07dc7fb28c","resolution":{"observed_at":"2026-05-13T06:02:24.256522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":"1155db43-334c-4c01-9ed2-5a7f36dad6ab","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6d90d1ecc480201084d16f3595369a06342d78b9293d15855e43ff0cdc13642b","observation_id":"b36181d0-9a4f-491d-9dbb-4544c41064c2","resolution":{"observed_at":"2026-05-13T06:02:24.258780Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapKV: Llm knows what you are looking for before generation","venue":null,"work_id":"278db99e-52fd-4d28-a132-2f993d827801","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5abe318d582ebc59d671d1a3812b5043bb37391bea971adb3bcef3c4ae1d5f34","observation_id":"0d344f97-1b95-470f-8156-b066ee485948","resolution":{"observed_at":"2026-05-13T06:02:24.262982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17424","last_updated":"2025-02-05T14:06:21Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:32Z","title":"LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence","version":2},"cited_work":{"arxiv_id":"2405.17424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17424","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Larm: Large auto-regressive model for long-horizon embodied intelligence","venue":null,"work_id":"f6aca9a0-2ac1-469c-bba4-fa0c53c16c7b","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2405.17424","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:2e37f2c2636fd87ed3835916c148eb2645d018cfae6374078258f0345e177c9b","observation_id":"ced269bf-c1b2-4443-959a-8fa0189b7ab3","resolution":{"observed_at":"2026-05-13T06:02:21.993912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06358","last_updated":"2026-07-04T16:06:38Z","snapshot_observed_at":"2026-08-03T04:03:38.816516Z","submitted_at":"2026-02-06T03:40:31Z","title":"SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass","version":3},"cited_work":{"arxiv_id":"2602.06358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06358","snapshot_observed_at":"2026-07-03T16:18:37.220368Z","title":"Shine: A scalable in-context hypernetwork for mapping context to lora in a single pass","venue":"cs.CL","work_id":"506a565a-320f-444d-8a9f-11a065048931","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2602.06358","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f50fddc628efe0b9bde526036d5bbf8d0c67aebb717f6d4af13ae97b42343118","observation_id":"89401e05-302f-4574-9d6f-221366601686","resolution":{"observed_at":"2026-05-21T03:03:41.308564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.128873Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"e24e2207-094f-4683-b902-901f466712ba","year":2016},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6fc557e6330c636f838e91e7a56e88b74836925ee02b718b026b3e8aedda7846","observation_id":"628d164d-0462-476f-9b91-c95e952b6feb","resolution":{"observed_at":"2026-05-13T06:02:24.292079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d2e36215-c3e7-4699-91ae-025936f9450e","year":1977},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:16133a734faacda8ac7bc9a4a5d5dcac809eea1713de72b07d60ef7abeb1dd74","observation_id":"8976502a-1931-45cc-a261-2796fd872c02","resolution":{"observed_at":"2026-05-13T06:02:24.250037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.398004Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"642f5867-b098-4ec2-9fd0-c6dd37388412","year":2018},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1cfcfe6ade957698549dc77f28ab5c8bd9adc5b215951d785799d72f14bf05b3","observation_id":"bd3951d8-cdd7-41c6-9b01-43f233d1d814","resolution":{"observed_at":"2026-05-13T06:02:21.790714Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":"9cb1d057-1877-49c8-9a1f-8b067fb26859","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d07a172481128b3d60e2842055c6a76a3551087688e506e916355575b3dd0fa9","observation_id":"e313e9fa-7d48-4e25-b6fe-6b3a50bef301","resolution":{"observed_at":"2026-05-13T06:02:24.235100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:02:30.959252Z","title":"Using an llm to help with code understanding","venue":null,"work_id":"4b0794f1-1617-4c67-9224-a9b223f81303","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a18abe2d1a830b8485a2b1cbcca3c0ddfadb19d8e5534a0a0fdf007e6c1c0f27","observation_id":"e5718b8d-1ccb-478e-8d9b-d9a69704d022","resolution":{"observed_at":"2026-05-13T06:02:24.220818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context Engineering - Short-Term Memory Management with Sessions from OpenAI Agents SDK, September 2025","venue":null,"work_id":"74e41404-c5a8-4a09-9c4d-0ca9064e5354","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:0a27baa981bd6acef86a4604368a3a121b6665b44af068c7bef365fb977f615c","observation_id":"c076a8b2-29b6-4f6a-a674-b13ac4d9bd53","resolution":{"observed_at":"2026-05-13T06:02:24.223236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1043","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:02:45.926587Z","title":"Transformers are multi-state RNNs","venue":null,"work_id":"bcf46bab-4869-4065-8d61-02079a78bde8","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3a3a29c15793561de0689b93e6569d9e75e27315fd75920e8c4f4a83325c78c0","observation_id":"436b9803-9b50-47e7-8d5a-f49bbe585cbc","resolution":{"observed_at":"2026-05-13T06:02:21.803106Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:10.771953+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:10.771953+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.Advances in Neural Information Processing Systems, 37:30811–30849","venue":null,"work_id":"ac491598-4499-4e49-bc34-d6775b7688d2","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:0d59f6fc1c99e60de97a10e7f78d6270776cf383a9d87b58df9a1acc3e94cc5c","observation_id":"393bdcbc-4be4-4d49-99d4-95bf24436637","resolution":{"observed_at":"2026-05-13T06:02:24.227937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-10T20:07:33.494399Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:58e0ecf445c76830709272ce5177311b1df8b198c7ce7a3ea3f61417bbba8cce","observation_id":"4c76dc23-6216-4dfa-b833-1a6b6a2f153f","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective context engi- neering for ai agents, September 2025","venue":null,"work_id":"26b66a0f-9f69-4372-90ea-f99262b5d022","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:8dcba5a0fdeb9fda7ce6c55322ad775555d4bbface74f1927aeccb7d0b910410","observation_id":"40abb738-a348-46b4-aa94-045157a1adbb","resolution":{"observed_at":"2026-05-13T06:02:24.218665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6399","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:30:37.808511Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":"a80a62e7-1fb6-4805-a09c-3447c2c1145b","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d208f57f51b689a869e3bec1744e69bc27a3f06dd2f6b4b36ae7cfd759f432f6","observation_id":"59cfac00-a8e9-4f9b-a166-4993e0673cf3","resolution":{"observed_at":"2026-05-13T06:02:21.786005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representational strengths and limitations of transformers.Advances in Neural Information Processing Systems, 36:36677–36707","venue":null,"work_id":"44e6d702-139b-4baf-b0c2-8c9db4c8fbdd","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:bc3864280e1236295caafd46b414cedf5be4fd55f0f089cc3023c22c0d33b832","observation_id":"1d3aa75c-7184-4ffb-8779-6622470094bd","resolution":{"observed_at":"2026-05-13T06:02:24.213905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"bd729514-55dc-47bb-bc44-358cb315b444","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:315cd3f85d707c45ae443bd0f0921e2f3a19919890f55f79776a6bcae9ab1890","observation_id":"fe83771e-4d4a-471c-89e7-526400e0d2da","resolution":{"observed_at":"2026-05-13T06:02:24.225530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1454","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:06:58.245746Z","title":"Social IQ a: Commonsense reasoning about social interactions","venue":null,"work_id":"67b76bf2-8e96-4f03-93f2-2b52627b4baf","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:428b43551ce03a3ef9554c3ff577e22be1f8c65c2ea7c7c8af7d9f9f60e3af1d","observation_id":"3f357129-8531-4ade-8248-1d2c178f607b","resolution":{"observed_at":"2026-05-13T06:02:21.800181Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T03:08:11.915484+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T03:08:11.915484+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QUEST: Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":"5118dc17-8556-4370-a334-e52b6dbbfc6b","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:955f3eb3659c4499d14aeb21adc769b35040c88d4973218a06908006be6eca38","observation_id":"ce7ad80b-0f42-46bf-8ae6-71a8d92048bd","resolution":{"observed_at":"2026-05-13T06:02:24.252230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.870959Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"69d50b7a-8945-41ea-b24b-3dec8e57f9fe","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a2e9702ebdfdd892f405237de6f045b6aa77ed61168be5422429348b05bcade6","observation_id":"3080a2c0-cb92-4ffd-81ed-a3fcae3bda5f","resolution":{"observed_at":"2026-05-13T06:02:24.204011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:12:44.865658Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"a411ef93-f6ba-49cb-a261-09f4a3b6041a","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:cd1f8560cdf1d1db1a19472f011373a190ad32606747e51a110e4a7eaf131137","observation_id":"8a2a4e3b-5597-493d-bd83-ac4725c3f36a","resolution":{"observed_at":"2026-05-13T06:02:24.208978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:da1b135e6829de6e7ac9ec5f0a56e989ac43b50939a9be6ac98f0b3b29895067","observation_id":"0bd4eb5c-44b2-47f3-b70f-859d0874db08","resolution":{"observed_at":"2026-05-18T11:49:16.947404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":"2412.06464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-10T21:57:39.161066Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":"cs.CL","work_id":"884939d3-e283-4625-bff4-b7e0e4cc2a6e","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:c931a3fd08a51bc95e3cb40655104116a444f83073a09faa5dd0eb748ec8ef0a","observation_id":"6113bfcc-ac39-448c-a9d4-21b8a1d1bba4","resolution":{"observed_at":"2026-05-13T14:50:25.025022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.15160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15160 , year =","venue":null,"work_id":"35ef8ad8-49ca-40f4-8dc7-0cad75bea537","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:7cdb672277c1ff4b2d34d0d48ab0687a61f72c047c1ce73eaef0591c028ac3a7","observation_id":"dc536cf1-3d8d-4043-b146-f4033d7e12e7","resolution":{"observed_at":"2026-05-13T06:02:22.000080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep sets.Advances in neural information processing systems, 30","venue":null,"work_id":"8d0304cf-6351-445b-851d-20c1660e8fd1","year":2017},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:87b38e1d163fbc09edcd3fc1e973297501aacdb5a1828f089b5aaea01db1297c","observation_id":"2bb92f07-362e-4e28-b0da-f1f7bf28eabe","resolution":{"observed_at":"2026-05-13T06:02:24.237288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33: 17283–17297","venue":null,"work_id":"a09b5178-cc0b-4779-9512-72f8adccd8b9","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:97ccd0a0b403d10dc55e258572128f13aa0f8c36e08cd1d905df1ac409f7a99b","observation_id":"5cffa41d-2c43-4d58-931e-df3ed14a0102","resolution":{"observed_at":"2026-05-13T06:02:24.230077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:023de273c44905c21febfd3d774b53c930274a8f7271117b434abab6b458f410","observation_id":"6557247c-93a1-4764-9f98-24dfbadeb32a","resolution":{"observed_at":"2026-05-13T06:02:21.806038Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"f0b187d3-058f-49da-8b6e-9711db28c85b","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:ef4b3f7b706d98563e495203410b094beec87d07b6fc662771f3b06b5fd4e9fd","observation_id":"78c43fa5-9a10-49a3-84fc-d3d4cf794a20","resolution":{"observed_at":"2026-05-13T06:02:24.216232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong learning of large language model based agents: A roadmap.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"f0b706d2-f5fa-42a5-b836-817e328b59a2","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:cb624e060efe568737ead0c34224959cc0e1ac205e68c57a1ce4d5edebafd5ce","observation_id":"7444f49f-cb4e-4adb-83e3-5f870f1a0af6","resolution":{"observed_at":"2026-05-13T06:02:24.232644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast kv compaction via attention matching","venue":null,"work_id":"ddd7a574-ce5b-41ed-bf23-42ea0d08f3d1","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:b7a789caf03def5dc6f3978f50e9f64b6ed5bdb05841c447cf8dfda1db685d53","observation_id":"7b4e5337-878f-4ec0-a002-6601849bdb1c","resolution":{"observed_at":"2026-05-13T06:02:24.244984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"an)∈A n withn≤N, ∥f(a)−M(a)∥< ε.(70)","venue":null,"work_id":"4314ea11-21ed-4464-8573-6dddeee30a86","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1f972df0469e0f434c66c69b4db2391ba346d2503f14efc604349b56b9e7553e","observation_id":"c6758ec7-0854-4dcb-8ee1-936b6165bf6a","resolution":{"observed_at":"2026-05-13T06:02:24.247803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8dba43c9-2d82-444e-83c7-1f3998204378","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e64f210e30af286d918ecf595883a10e4ebba80922980379897073ab0de71e81","observation_id":"65356efd-af18-492c-b640-be94d32de4c7","resolution":{"observed_at":"2026-05-13T06:02:24.206400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"an)∈A n withn≤N, ∥f(a)−M(a)∥< ε.(97)","venue":null,"work_id":"768a3bf4-e65c-42fb-8d6c-f23485aba821","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:295747945c9f38896fe5d1dd56345e3ab3541a8034748cbfc411c109c896185a","observation_id":"7ac604d7-f5e5-41b1-a5f0-4b3f2221255f","resolution":{"observed_at":"2026-05-13T06:02:24.211502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7800.4610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"By the same argument as in the proof of Lemma A.7, there exist functions ϕ:R d0 →R d1 andρ:R d1 →R dout such that for everya= (a 1","venue":null,"work_id":"365cf4cb-7eac-4e6e-8bac-604973b30589","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3eca651ef5376e305a0f1a23c621e8da14064c1547ac9d353adc986f1faf0eb4","observation_id":"a0c110ff-ee9b-45a9-8cad-83a1c8769821","resolution":{"observed_at":"2026-05-13T06:02:21.950355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":23,"verified_fuzzy":35},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2605.05971."}