{"as_of":"2026-08-09T13:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1578119d62ee61a25027024520bb8fd7bf8fcf47edc00e386da6a91fb1508673","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:26:55.365808Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:07:33.537106Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:494d7c6ce01bb46e83171169235ec527ac123e2dd417f253c58a1e4d8b648259","observation_id":"baf6d7cf-8aaf-4064-8e1b-4d447055843d","resolution":{"observed_at":"2026-05-13T05:47:27.840811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2403.20208","last_updated":"2026-04-22T07:34:25Z","snapshot_observed_at":"2026-07-06T17:53:06.519891Z","submitted_at":"2024-03-29T14:41:21Z","title":"Unlock the Potential of Large Language Models for Predictive Tabular Tasks in Data Science with Table-Specific Pretraining","version":8},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T02:44:01.340415Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2403.20208"},"observation_digest":"sha256:75c63e4a012d804a963f93c377b8840ea906b403a757c6b0006f894423da32ae","observation_id":"b72ba8dd-ffa1-46c3-8ede-13d4fa5b5679","resolution":{"observed_at":"2026-05-24T02:45:56.152590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:cba0a6ac214121ebc3fb3c307606095a6c022dc08466e0ff78925be45c7e5cc4","observation_id":"e1181f8f-1386-4869-85a9-5b1aae4af19d","resolution":{"observed_at":"2026-05-11T03:55:20.448654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T18:17:00.157129Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2404.07143"},"observation_digest":"sha256:f93fb4c957527215c76b8f9f7923ac287e285f41c6e5fcfe3d9571cda6dfbf7b","observation_id":"d8481eb6-6ebf-4745-8035-4da3a1df440a","resolution":{"observed_at":"2026-05-21T18:17:00.229562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:ba9baad66a2f5e9b06acdac50bfe49494a8c02318ec7eb5ba8587869daa79663","observation_id":"228085f8-6fa4-4317-81d2-77805279be3e","resolution":{"observed_at":"2026-05-14T19:55:26.552862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-20T17:46:46.845424Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2412.13663"},"observation_digest":"sha256:7743ded9d45fc0304a1c11cd557892982e227c6ed4f88ff76214d72ccc1c670e","observation_id":"7664ed1c-a9c6-4c5d-892f-bf13a0359881","resolution":{"observed_at":"2026-05-20T17:46:47.037769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-09T13:26:55.365808Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-09T13:47:28.921977Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T13:26:55.365808Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2502.02617"},"observation_digest":"sha256:adc311a8a0ffd5049e63b56ed7f4e0643d38165964a2a57d55ad353810663840","observation_id":"51c02580-c25f-4903-81e3-50abda7004a2","resolution":{"observed_at":"2026-08-09T13:26:55.365808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-01T14:10:27.172555Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:31fa8ab65b6c97c181822bc64840e56fbffb2b5314746fbe40216e491fc0be08","observation_id":"7c1730a4-5ea6-49fe-9e82-f1906eeea3b6","resolution":{"observed_at":"2026-05-20T08:09:22.309704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T15:07:59.981503Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-09T07:25:09.275709Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:59.981503Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:d0b972d99626ce919d391d96f2d945282e972dec67d3bc89a647859fbf94f6fe","observation_id":"d0d416bc-4c4c-4280-851d-1d139362df12","resolution":{"observed_at":"2026-08-07T15:07:59.981503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T13:23:11.956205Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.956205Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e97dff18e4049d922fd5c985606ac177fe442ce4c9265d1e1e56f6c1afa873e2","observation_id":"74e21fdf-8cc7-4f77-9d34-24ad798e1e8a","resolution":{"observed_at":"2026-08-07T13:23:11.956205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T13:04:14.441793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22771","last_updated":"2025-09-02T14:02:42Z","snapshot_observed_at":"2026-08-09T13:47:43.960918Z","submitted_at":"2025-05-28T18:39:56Z","title":"Automated Essay Scoring Incorporating Annotations from Automated Feedback Systems","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:14.441793Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.22771"},"observation_digest":"sha256:386008fdd7aa6e1dc056204a0c31dd7f690b22555351248a481aea1e31c76a6e","observation_id":"4da642ac-0601-46e6-993a-1e492297e921","resolution":{"observed_at":"2026-08-07T13:04:14.441793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T10:52:06.057643Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04180","last_updated":"2025-06-04T17:27:42Z","snapshot_observed_at":"2026-08-09T07:55:46.069328Z","submitted_at":"2025-06-04T17:27:42Z","title":"SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:06.057643Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2506.04180"},"observation_digest":"sha256:6692b5d601ff5c64e2614c4ee20d938e0f9c0479ca7f609d4e8c1ee28371be97","observation_id":"ebf2ab01-97cd-4065-b5c1-a70bf9fa2800","resolution":{"observed_at":"2026-08-07T10:52:06.057643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T04:33:16.874877Z","title":"Data engineering for scaling language models to 128k con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10424","last_updated":"2025-06-12T07:23:56Z","snapshot_observed_at":"2026-08-08T16:23:05.158098Z","submitted_at":"2025-06-12T07:23:56Z","title":"SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:16.874877Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2506.10424"},"observation_digest":"sha256:13c428f942eecfa58c350548715dd0f4dcd02c1a3fb1282c83423424c017963a","observation_id":"638a5d41-4de1-4dad-b484-b1bd8adac545","resolution":{"observed_at":"2026-08-07T04:33:16.874877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-06T17:33:19.999164Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14204","last_updated":"2025-07-14T19:09:57Z","snapshot_observed_at":"2026-08-07T13:12:08.750150Z","submitted_at":"2025-07-14T19:09:57Z","title":"LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:19.999164Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2507.14204"},"observation_digest":"sha256:87c56e2304f2a8c819b74feae792a747eb2638848dd214734a31f9161a88b5be","observation_id":"62d3bfaa-5308-43fd-9496-0a6d31eda402","resolution":{"observed_at":"2026-08-06T17:33:19.999164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-06T15:20:38.626324Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16217","last_updated":"2025-08-29T18:45:22Z","snapshot_observed_at":"2026-08-08T13:31:49.745762Z","submitted_at":"2025-07-22T04:21:03Z","title":"Towards Compute-Optimal Many-Shot In-Context Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:20:38.626324Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2507.16217"},"observation_digest":"sha256:cc94663f8f6d2a27e22f7d3f5a3755749c20135b380596efd0b8dea3f7193a9f","observation_id":"6089dcf4-55b7-4407-a7b9-99669a33a215","resolution":{"observed_at":"2026-08-06T15:20:38.626324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2601.13684","last_updated":"2026-04-18T08:34:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T07:35:06Z","title":"HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:16:31.568604Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2601.13684"},"observation_digest":"sha256:f0f5efb1984a2a948db764521b25d373ee11861f1ccbaed61289495d4a01e671","observation_id":"c10f6fcb-9b05-4cee-bbf8-4f4bc853c38b","resolution":{"observed_at":"2026-05-16T13:17:54.895716Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2603.04759","last_updated":"2026-04-09T15:16:58Z","snapshot_observed_at":"2026-08-02T20:00:30.056450Z","submitted_at":"2026-03-05T03:16:16Z","title":"Stacked from One: Multi-Scale Self-Injection for Context Window Extension","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T16:57:09.401220Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2603.04759"},"observation_digest":"sha256:91ecf91824de98c1eedee77d3bf319d31e4c735319a83eaa6458bb971fac62bc","observation_id":"eae3db87-d56d-40e4-a451-d00d9b48d877","resolution":{"observed_at":"2026-05-15T17:00:10.310750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2604.08290","last_updated":"2026-04-09T14:27:02Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:27:02Z","title":"Tokalator: A Context Engineering Toolkit for Artificial Intelligence Coding Assistants","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:34:16.075235Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2604.08290"},"observation_digest":"sha256:55697174949d59cddc8458d7b786a9b80dfc9b4b987fb5327543ade99121dee0","observation_id":"be511320-5e39-417e-a4b0-7f4fb0f36a44","resolution":{"observed_at":"2026-05-11T06:36:03.095872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2604.14339","last_updated":"2026-04-15T18:46:35Z","snapshot_observed_at":"2026-07-06T23:02:09.426599Z","submitted_at":"2026-04-15T18:46:35Z","title":"Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:42:00.440049Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2604.14339"},"observation_digest":"sha256:b0b8a7c8c65da36e269553d7fd3f4e980ea26564b15f7fa99fbec550bb78eaa2","observation_id":"586d3202-9047-477c-b34e-4d37ef6f3161","resolution":{"observed_at":"2026-05-10T13:45:28.128889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2604.19777","last_updated":"2026-03-28T14:12:43Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-03-28T14:12:43Z","title":"Self-Describing Structured Data with Dual-Layer Guidance: A Lightweight Alternative to RAG for Precision Retrieval in Large-Scale LLM Knowledge Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T22:40:27.457107Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2604.19777"},"observation_digest":"sha256:885e6e425dd31e09eacf69d726f5e8de7ebc9a74882770ca7e94ccb59375b282","observation_id":"bb100be8-316f-402e-bc65-6b7f57f491e7","resolution":{"observed_at":"2026-05-14T22:43:12.141839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2604.24608","last_updated":"2026-04-27T15:36:54Z","snapshot_observed_at":"2026-08-08T23:04:29.786174Z","submitted_at":"2026-04-27T15:36:54Z","title":"Learning to Route Queries to Heads for Attention-based Re-ranking with Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T02:01:14.533941Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2604.24608"},"observation_digest":"sha256:5204af2e11c5f8dd83186f017d3579263aadb71643dc5159df92e505239c092f","observation_id":"136f9d8d-4ea0-4272-a21e-4865812045e3","resolution":{"observed_at":"2026-05-11T23:01:15.271490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:52:45.320454Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2605.10544"},"observation_digest":"sha256:f555da74d31ca0f4dde10d74282df85575086e7ce26ae5eb6040a46dbaba2515","observation_id":"d86c350b-3bcc-4dc3-a58f-d1261ada812e","resolution":{"observed_at":"2026-05-12T06:51:29.149836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2605.13831","last_updated":"2026-05-13T17:52:53Z","snapshot_observed_at":"2026-08-06T00:20:13.394323Z","submitted_at":"2026-05-13T17:52:53Z","title":"Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T19:16:07.851098Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2605.13831"},"observation_digest":"sha256:52dd0acc3ef46cf76159cc44b4c69a8e7697989b4b86e4a0148ddb757e8f71ff","observation_id":"56bbecfb-1a13-470d-a521-412f18dfe504","resolution":{"observed_at":"2026-05-14T19:17:50.134001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2605.15514","last_updated":"2026-05-15T01:16:16Z","snapshot_observed_at":"2026-08-02T14:59:47.103906Z","submitted_at":"2026-05-15T01:16:16Z","title":"RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T15:34:09.006815Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2605.15514"},"observation_digest":"sha256:bf5424e54881badf67891b91fa771acfa4eacdd69c6240102eaace977a48472d","observation_id":"b9745d4b-f2bd-479d-a873-55cf963f0097","resolution":{"observed_at":"2026-05-19T15:37:37.316022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2606.13715","last_updated":"2026-07-01T14:36:06Z","snapshot_observed_at":"2026-08-06T15:11:03.252182Z","submitted_at":"2026-06-10T21:21:35Z","title":"WorkBench Revisited: Workplace Agents Two Years On","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-02T22:32:38.005254Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2606.13715"},"observation_digest":"sha256:6f222050c4ef57029cdfc48ef68fa94c93ebef54ee4a449711d1286d6487dcf8","observation_id":"43f4273a-6f40-4463-89ff-61c983e0ccb0","resolution":{"observed_at":"2026-07-02T22:37:25.394049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:33389d2bc69189be4df0d5b2fb8cdb03d90724fcde83f66bfe1289a43d853fa9","observation_id":"05367672-8f9c-451e-adb3-b39e7e5022cb","resolution":{"observed_at":"2026-07-04T06:39:37.622643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2606.21803","last_updated":"2026-06-19T23:51:35Z","snapshot_observed_at":"2026-07-06T23:56:45.447705Z","submitted_at":"2026-06-19T23:51:35Z","title":"Test-Time Training with Next-Token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T13:52:15.078658Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2606.21803"},"observation_digest":"sha256:d58a9ffae6a57241205aa8472b1a06d85b53d26a5451b5ba9a267b0fdd4df5d2","observation_id":"6acecacd-d726-497b-b7b1-5f52e49b19e9","resolution":{"observed_at":"2026-07-04T07:09:37.401933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:01b866b085788b9096688566c6ef438808db9155353fdd87e92a3a96f2974669","observation_id":"b9ba3de5-15ad-49cf-b591-ea94623b2897","resolution":{"observed_at":"2026-07-04T11:09:46.443744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-02T10:27:16.336372Z","title":"Data Engineering for Scaling Language Models to 128K Context.arXiv Preprint arXiv:2402.10171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:16.336372Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:1b670a8910705a1b4d267bf1be29d38d919ffbe8699139d0ecc33dd6f92f5d01","observation_id":"9e310bf0-13cb-4690-8005-c75c3db0102e","resolution":{"observed_at":"2026-08-02T10:27:16.336372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":"2402.10171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-10T20:07:33.537106Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171","venue":"cs.CL","work_id":"3416cc4a-8e98-4b89-a696-760e86f3c718","year":2024},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-08-08T09:03:10.158542Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T19:59:46.713277Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:8487a885d818b20fcb374edb211e4a3644f3cbbd9de77742d5f3e28302d34231","observation_id":"482814d7-bdb6-475c-962a-6d183153fa9e","resolution":{"observed_at":"2026-07-10T20:07:33.538561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-07-13T06:47:09.927626Z","title":"Data engineering for scaling language models to 128k context.arXiv preprint arXiv:2402.10171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07740","last_updated":"2026-07-10T03:53:58Z","snapshot_observed_at":"2026-08-08T09:03:10.158542Z","submitted_at":"2026-07-08T06:23:42Z","title":"Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T06:47:09.927626Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2607.07740"},"observation_digest":"sha256:e46b62b8eafe97130ee70533efdd24c86f76bd5261e79bca190723071ffb60b7","observation_id":"8dd90981-1a13-4c1e-9f5e-b09ab1b7cc2d","resolution":{"observed_at":"2026-07-13T06:47:09.927626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.10171/citation-record","integrity":"/paper/2402.10171/integrity","json":"/paper/2402.10171/citation-record.json","paper":"/paper/2402.10171"},"outbound":[],"paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2402.10171."}