{"as_of":"2026-08-10T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd9dad1cb57b6d912dc5718c05a822c447f2aed974a4fcdae8fb0b9056af9a0a","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:23:18.048778Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:48:14.799377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:57:16.733464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"cited_work":{"arxiv_id":"2505.22107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22107","snapshot_observed_at":"2026-07-02T18:57:16.733464Z","title":"arXiv preprint arXiv:2505.22107 , year=","venue":null,"work_id":"8dea0a3c-1a57-45bc-8b90-48e126ff9e6b","year":null},"citing_paper":{"arxiv_id":"2606.07183","last_updated":"2026-06-05T11:47:22Z","snapshot_observed_at":"2026-08-02T00:42:00.662612Z","submitted_at":"2026-06-05T11:47:22Z","title":"Geometry of Semantic Space: Comparative Study of Discrete and Continuous Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T21:48:14.799377Z"},"links":{"cited_paper":"/paper/2505.22107","citing_paper":"/paper/2606.07183"},"observation_digest":"sha256:555759b2dd2f7455404d2ba7100864fc8288b1acdddf18de6647fcf9822d66b6","observation_id":"d2243730-4e23-4389-a64d-66de4541f70a","resolution":{"observed_at":"2026-07-02T18:57:16.734945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22107/citation-record","integrity":"/paper/2505.22107/integrity","json":"/paper/2505.22107/citation-record.json","paper":"/paper/2505.22107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:05.497056Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:05.497056Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:43a0c9863d71ad4a9bdb4479bd49e2877beabedb9fca268df0f7c50c836f3194","observation_id":"18651005-b509-4a02-902a-eb052e4dfd87","resolution":{"observed_at":"2026-08-07T13:23:05.497056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.765005Z","title":"and Krzywinski, M","venue":null,"work_id":"c8d7bb0e-d8c8-4858-ac2a-a9ca09ea7a57","year":2018},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.321505Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:b64b40767a1be5e8dc3ddb0f0204b89575a10c1049d02f93b0ef61f7fc05c425","observation_id":"c213ddd3-63fb-4db1-bee2-722f4144a7d1","resolution":{"observed_at":"2026-08-07T13:23:26.932302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.531232Z","title":"Training-free long-context scaling of large language models","venue":null,"work_id":"54a42408-085a-4897-af25-f474e4060386","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.456894Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:eefdf56a5bbde0e3ad265f6f637ede82d96d47ac14b92b5922eea2c6f9a17769","observation_id":"039aee5e-6eb8-4593-9211-82712562113f","resolution":{"observed_at":"2026-08-07T13:23:26.651407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.230042Z","title":"V., Du, J., Iyer, S., Pasunuru, R., et al","venue":null,"work_id":"3c16a32b-ef2f-413c-9c0d-c0cd2733fcc9","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:07.623944Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:34d05bd79bdf84328d5962a4ea3d5dbfefdb7fd8e3c45959d3fe694f4265e239","observation_id":"6c76cc74-0855-4198-99b9-b0f4a49cf3ee","resolution":{"observed_at":"2026-08-07T13:23:26.355555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:26.006309Z","title":"Proof-pile","venue":null,"work_id":"7f2a6142-c17d-4cbd-833a-03be4e69d6b7","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:08.111044Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c14fa4be8e5598a7f43e0fa61fdb55875440df7d4d0f9f50476687e760530cd5","observation_id":"35d62f6e-259c-4033-be00-0d8112a109d2","resolution":{"observed_at":"2026-08-07T13:23:26.114633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.784733Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"3d732d10-811b-433a-a9b2-98b866d5786b","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:09.937823Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:64ab99e0acab95587e89755d7edc4bf9df0400b80b9429b85504e0e8ac1e8895","observation_id":"10e4d6a9-d381-4914-bf2b-1ac3edd3cec4","resolution":{"observed_at":"2026-08-07T13:23:25.891181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T13:23:10.048655Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.048655Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:946d0779f3f18428b17b6e7cf0715220c4520b604605f89dc45b27b877cf463a","observation_id":"7cb15523-72a2-4288-b599-a467d9a24ac3","resolution":{"observed_at":"2026-08-07T13:23:10.048655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.581627Z","title":"Mathematical analysis: an introduction","venue":null,"work_id":"2a922c80-4107-43b0-b0ca-568f2dfb5bfd","year":2012},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.190604Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c230a55e32ea465cc76c3711fa277675373a4dacbb1ae814dd23d9da63f38715","observation_id":"36b19264-7f67-484a-a704-28fdec616a79","resolution":{"observed_at":"2026-08-07T13:23:25.637921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.358093Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"d300f5db-f35e-4504-9119-3ca07c86c32a","year":1901},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.300741Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a84aad6b05f5222e802a4b46155c5bbcb3cf994091312d8d3cea87c18de2d019","observation_id":"c2e4471f-e906-4e82-a20f-aa136f942541","resolution":{"observed_at":"2026-08-07T13:23:25.475625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:25.132199Z","title":"Improving multi-document summarization via text classification","venue":null,"work_id":"95888cb0-c72a-475e-8fa6-f4a58f5822af","year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.427300Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e22f13df602e0badad0e3c01fec5f44f9c43048e841aa8c69d0beb3f42a21f46","observation_id":"eaf36553-f735-4d8e-828d-b49b294c2772","resolution":{"observed_at":"2026-08-07T13:23:25.232658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.853667Z","title":"Slimpajama: A 627b token cleaned and deduplicated version of redpajama","venue":null,"work_id":"5337e22f-77f2-4d0e-840f-7490f47556a4","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.578225Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:03319d6545c166b89c7b12f3f7c0b266c3ddcb1307928f404af5397ef0caf264","observation_id":"9fd682b8-f344-4cd6-8ce6-66a366169a58","resolution":{"observed_at":"2026-08-07T13:23:24.999777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-07T13:23:10.730745Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.730745Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c54e78afd400daddc6a3cd512d86a5349c3d1b64176c67a60e64727e2c48a0af","observation_id":"19da10e4-b6ec-4d44-b805-aac4373fc6a3","resolution":{"observed_at":"2026-08-07T13:23:10.730745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.608752Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":null,"work_id":"b5224a14-7a11-43e6-86c1-17b1748c38f4","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:10.900738Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:33920bedabb6577c78ee305351ad4c388d2c2e7cd4241d72bf468764e7b843c3","observation_id":"4b167caf-ef02-49a6-95a6-e8fa051c0b25","resolution":{"observed_at":"2026-08-07T13:23:24.745161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.332113Z","title":"Core context aware transformers for long context language modeling","venue":null,"work_id":"e2bffa5d-1fdf-40b3-a6f8-40067cbb5834","year":2025},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.090094Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:600cdf06e8dab3d3515808c0af0fbdee9d09f4a33e461849f2fd842b7a3ad79d","observation_id":"97f79d5b-f42d-4bab-a439-7fff2a8e841b","resolution":{"observed_at":"2026-08-07T13:23:24.480152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:24.050304Z","title":"T., Raskar, S., Kale, B., Ferdaus, F., Tanikanti, A., Raffenetti, K., Taylor, V., Emani, M., and Vishwanath, V","venue":null,"work_id":"40c72057-c66f-42c1-b5ce-1a40553be547","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.230949Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e420f0a0037d72d57e515b936b07607ff1c3b611943597ff79b91878c519b538","observation_id":"88055cfa-c820-4caf-b54f-8978810f275f","resolution":{"observed_at":"2026-08-07T13:23:24.202919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.852616Z","title":"M., Likhosherstov, V., Dohan, D., Song, X., Gane, A., Sarlos, T., Hawkins, P., Davis, J","venue":null,"work_id":"4cb9342c-d6be-4d54-88c5-72ce4ef33724","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.429368Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:8db15b29b6aa3d891b19bdbf9024a7f3135b8dd748191c45d518aa1c6c10d8ac","observation_id":"517aeb64-6b76-4a08-a313-fd13e8f9df52","resolution":{"observed_at":"2026-08-07T13:23:23.906716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:11.567632Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.567632Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:5839129ee797c1c22be4b4412c74bec96ada98a5b51ba1901fc3b23824dde1d4","observation_id":"4c2cc6f6-ed6a-416b-9cfd-d9335b67701b","resolution":{"observed_at":"2026-08-07T13:23:11.567632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.633747Z","title":"Eigenvalues and condition numbers of random matrices","venue":null,"work_id":"6b87cb1f-1771-43f0-8360-b1a0f9750c14","year":1988},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.681991Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c1c63d3fc75066cc130a99e2f827d91a28b25b4c87c218b57663155d03bee2cf","observation_id":"b9152c8f-7bc6-4f7f-8a1d-34f11e075846","resolution":{"observed_at":"2026-08-07T13:23:23.737833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T13:23:11.844293Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.844293Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:89e33e696cc6e41506fec94f5ac415d1a1c2c77086b5a395dfbb08f51394df87","observation_id":"6cfc457e-b37f-496a-8bfc-3eb6398b8a76","resolution":{"observed_at":"2026-08-07T13:23:11.844293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10171","last_updated":"2024-02-15T18:19:16Z","snapshot_observed_at":"2026-08-08T16:22:41.396147Z","submitted_at":"2024-02-15T18:19:16Z","title":"Data Engineering for Scaling Language Models to 128K Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10171","snapshot_observed_at":"2026-08-07T13:23:11.956205Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:11.956205Z"},"links":{"cited_paper":"/paper/2402.10171","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:e97dff18e4049d922fd5c985606ac177fe442ce4c9265d1e1e56f6c1afa873e2","observation_id":"74e21fdf-8cc7-4f77-9d34-24ad798e1e8a","resolution":{"observed_at":"2026-08-07T13:23:11.956205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.393260Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"ad5467f9-0f22-42c2-8180-767d8bce6d99","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.103099Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d1f02ca523331f56be68d8ae7c550f7d15b6330c1622388fa385d5431e12af03","observation_id":"d80de69e-debf-46aa-855e-a36c9fb2f6af","resolution":{"observed_at":"2026-08-07T13:23:23.487403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-10T13:57:06.597469Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T13:23:12.222334Z","title":"LM -infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.222334Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:5cedb3682195cacf2d1396ea8823b90722b8de376345af21bc10cff8350f5023","observation_id":"b6f39f0d-4cd4-4439-ba1b-049f3fb3b6ab","resolution":{"observed_at":"2026-08-07T13:23:12.222334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:23.170155Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":"458490c2-56ee-4db5-b658-a7dd609172b7","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.395393Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2049159160bfe4ee37080e55015082be4af505c9377ed7945408639d2c3ee9f2","observation_id":"299f8050-4411-4bb5-a4a5-c68ce9bff079","resolution":{"observed_at":"2026-08-07T13:23:23.267125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.932528Z","title":"Overview of supervised learning","venue":null,"work_id":"85425b90-6ff8-4296-a949-85eb7acc3888","year":2009},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.497966Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:12a76fbeaa06cbf4f104b94b2bd6d8e8cac605654e630a09f786416248aa5de7","observation_id":"f130aae4-29b6-4714-b51c-778dcfd423b4","resolution":{"observed_at":"2026-08-07T13:23:23.031560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-07T13:23:12.619787Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.619787Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ac9a5516ad7eb6b384c878abd8b98c371994a426fafc9639d8f97db612656e5f","observation_id":"b39b5d56-55ca-4faf-bff3-a4be71881975","resolution":{"observed_at":"2026-08-07T13:23:12.619787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:12.810758Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.810758Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d822cda1319b941513084f998b8e3d0eee4536a76b7c83fc46e9c1c866acee90","observation_id":"b199c556-fb14-4647-a38d-c626f9e477c9","resolution":{"observed_at":"2026-08-07T13:23:12.810758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.726870Z","title":"Neural autoregressive flows","venue":null,"work_id":"b779be4b-ee54-4646-93a9-e93dd2850956","year":2018},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:12.923700Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:042010008a4586b671790a7346ccc52aac6ee5c03891b402c189158820cf1acd","observation_id":"a9a852a4-fb86-4ea7-84b9-7804ce802148","resolution":{"observed_at":"2026-08-07T13:23:22.833972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.487097Z","title":"and Zhang, T","venue":null,"work_id":"6c871493-5500-4a70-b8a0-dc6d3d196b40","year":2010},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.076385Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:98f5cfe89ca4f20d4a12949c9ec7a1fa254d52e7fcf1a964a3610fb7aef04303","observation_id":"f0aed81a-d536-4bfc-8211-e997cec1e746","resolution":{"observed_at":"2026-08-07T13:23:22.572849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.376076Z","title":"H., Li, D., Lin, C.-Y., Yang, Y., and Qiu, L","venue":null,"work_id":"17a12dfb-068f-4072-b157-8e948e45a882","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.232482Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:f0be32c0356913dd6b720a3106a002a028a40283e3ca256e4f9d39a41b11c760","observation_id":"63431ec6-16fa-44ca-9b6c-4f257bddefe4","resolution":{"observed_at":"2026-08-07T13:23:22.428403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.265756Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"f34b7474-8c24-4d83-b826-e668881707c4","year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.362829Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:0088075ad9ecd3eec7a277c212a0fdd2afbf7769f3733876d56110447ace8dad","observation_id":"0999e38a-3b49-45fe-a6f2-691364a638d6","resolution":{"observed_at":"2026-08-07T13:23:22.313392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:22.069547Z","title":"Continual pre-training of language models","venue":null,"work_id":"53869960-5c69-4b4d-9570-1ba8a68bb838","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.510662Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2931135d051dbf38954a5fee6612c7a851f925352d3a76fa346cbb235cc30627","observation_id":"138ba262-361c-4dca-89c9-a51e35701dd6","resolution":{"observed_at":"2026-08-07T13:23:22.176420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:13.671525Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.671525Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d774789192972acb4fee865d3a1779b45a45f838fb83d858a7978f80f680780d","observation_id":"52d14827-c8dd-401e-bd1e-1c1c4bf69142","resolution":{"observed_at":"2026-08-07T13:23:13.671525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.830542Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"e792c410-e1aa-482f-870e-9227588a429d","year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:13.861167Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:0889512f4340ad1e976f962335731861a776e028b12ce57088e4cddb4769b76f","observation_id":"37925fe8-47f5-4821-bf94-17d37850f5a8","resolution":{"observed_at":"2026-08-07T13:23:21.928588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.628234Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":"6ae1c3d1-c139-469c-b358-9b7107e25de3","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.041225Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ea2505036766e405682e2c886421a006dd2923b1483c1e33b9f31f36af192cb6","observation_id":"c3d8f57a-17d7-4407-948a-90b6cf94f3e1","resolution":{"observed_at":"2026-08-07T13:23:21.681311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.398711Z","title":"Scaling laws of rope-based extrapolation","venue":null,"work_id":"d528726f-bbfc-41c2-a59f-5a61a8da01e1","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.195471Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:f780133420075c122b9fd99d6769037a1020076dcc38a63d7df94cd26e0e2278","observation_id":"ff0e39dc-ca5c-400e-9fad-9cd93295b999","resolution":{"observed_at":"2026-08-07T13:23:21.514077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.198211Z","title":null,"venue":null,"work_id":"6051a681-33b8-475d-af59-7889c4b4b8e4","year":2011},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.372061Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7c1a615fed54e6ea300b0ad646215905ec9be216a59d40517adc3d0b5282d07a","observation_id":"65c7cbbe-2678-4700-9c13-84911fe8f69f","resolution":{"observed_at":"2026-08-07T13:23:21.302798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:21.052946Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"d61d2080-0cd6-4a04-9c9b-6e8afc78cf52","year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.484747Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:48a51ee1777748525fe7188686e3ea32cea36386a79d375649b1ca30c55b2771","observation_id":"f2735ae3-7396-4d4e-8e96-b7a3f1eea879","resolution":{"observed_at":"2026-08-07T13:23:21.119597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.871592Z","title":null,"venue":null,"work_id":"78116b5f-d7a5-4d51-900c-9b420711f079","year":2003},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.622471Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:2dbbab0f8f0cdbab351ca3add9f2fb641967724ddb22b0d7acab66b369023f27","observation_id":"03b2cd6d-a5a7-44e2-b8c1-465649052280","resolution":{"observed_at":"2026-08-07T13:23:20.968019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.732686Z","title":"The spectral norm of a nonnegative matrix","venue":null,"work_id":"c8681afc-3997-45d5-8425-defca4eab911","year":1990},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.725369Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d97c3a0773e8159ec3b976b3b43a0e03dc7aab74d9260ce50678202d1b80a9c3","observation_id":"11d0f157-9be2-49d5-9aa5-d8efe0ce3325","resolution":{"observed_at":"2026-08-07T13:23:20.788216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-07T13:23:14.831997Z","title":"and Jaggi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.831997Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:89ef21e9daf91968103428ee8b1dfed52521354f1bb1df5352229d103c1cc99c","observation_id":"2e501e07-2701-4d9a-b01d-8b65e82adb6a","resolution":{"observed_at":"2026-08-07T13:23:14.831997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.581786Z","title":"An overview of the supervised machine learning methods","venue":null,"work_id":"5fb3727f-187d-45d4-a748-7a92a60962e0","year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:14.939720Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:5a2b14b47433ec930133622a3e9618e3f2a3c46e90540147b27a63cb8b5d52bd","observation_id":"16f7f092-32d2-4705-946e-33d40cb74eea","resolution":{"observed_at":"2026-08-07T13:23:20.639432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:23:15.012231Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.012231Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:ca9942ca4333815004ba78d9eb1e805fbfa5e0da4f7f89464aa5ca1804017dc2","observation_id":"fdf156eb-a02b-4c4e-9df9-28e6a0c48363","resolution":{"observed_at":"2026-08-07T13:23:15.012231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.427771Z","title":"Data augmentation for abstractive query-focused multi-document summarization","venue":null,"work_id":"42ba0025-27c9-45f2-9af8-e3bb9c23482a","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.111944Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:c0a202a017b304111a7293d0e540d7401aad6d89c09088c201138922f507a308","observation_id":"c94da18e-f10e-4a5f-8fa7-d048b94a3e17","resolution":{"observed_at":"2026-08-07T13:23:20.504675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.294007Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":"f172c929-a634-4a92-ad30-646bfe99c5df","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.176797Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:3f9e73d17b4b3b6268ac37906ddacb26b4cb4fb224afcf26d9e5ed572f3b3845","observation_id":"54d28dc8-a9a0-4740-aaf2-58fbf48e6fce","resolution":{"observed_at":"2026-08-07T13:23:20.365654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:15.294294Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.294294Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:8ce188823dc6136678f32a61d802316e113d9be2480852bf647ecb4e112a6c21","observation_id":"be1d2524-bcde-4aa4-85a3-eed6af8735cd","resolution":{"observed_at":"2026-08-07T13:23:15.294294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:15.453551Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.453551Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:35688b1b21f3999ca1d7fbbba8fe838872776ae7bc1c7ff62ff599c060c3ed22","observation_id":"cec19125-3f2c-443c-bac0-ad8140c62852","resolution":{"observed_at":"2026-08-07T13:23:15.453551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.147235Z","title":"and Lin, S","venue":null,"work_id":"88994e8d-7cde-49be-9632-03dda9466446","year":2009},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.586474Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7e94c6c2c90a35156bc6b28ff329cf598dbda3739da71ccdb543770a81c0fb3d","observation_id":"fc8f9e81-8e5a-451c-8bfa-23eb5ebfcfc2","resolution":{"observed_at":"2026-08-07T13:23:20.196227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:20.041265Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36, 2023","venue":null,"work_id":"c972fefd-993c-40e3-a076-e3dde5676b6c","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.676961Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:f7bb35bf519d05a47913fc315f160e17f3288e1cd463f0a8f5a6078e2b83f4eb","observation_id":"fb92a7a4-729d-4d90-bc04-852bf0c02b86","resolution":{"observed_at":"2026-08-07T13:23:20.091877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.784496Z","title":"R., Cole-Lewis, H., et al","venue":null,"work_id":"7c1a51a1-727b-4e90-b5a6-bb49bb6af156","year":2025},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.822810Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:a3c644171d72d2080bff126dbd5fcf8fd9aa74a6598e86f332bec2cd1f47f4e5","observation_id":"b65a00ec-6579-499b-892e-707bc58af9bc","resolution":{"observed_at":"2026-08-07T13:23:19.908040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T13:23:15.954492Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:15.954492Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:b4a9576141d0f476e6bda80b55becdaf171a09d34f0fdbc92b60ca23e21f047c","observation_id":"d6615869-bd2d-41b9-bc50-aa1944c51ee5","resolution":{"observed_at":"2026-08-07T13:23:15.954492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.562881Z","title":"Sparse attention with learning to hash","venue":null,"work_id":"4e6a1457-5b40-4aa7-bb88-48eafdf5d7c3","year":2021},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.043002Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:52268d1a0616879e65676f045ace63c50c6b7f6722ce212cddb6a23deb80f974","observation_id":"45df5808-40aa-4e04-bb69-d7e02c445085","resolution":{"observed_at":"2026-08-07T13:23:19.670386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:23:16.146762Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.146762Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:806d4f55362ceb62d7f5b99c71385ce8261a7a7d479f20a76ef1b9f2d34f0c5d","observation_id":"c3dbd60f-dea9-4aa4-aaa1-cbf67bc6369e","resolution":{"observed_at":"2026-08-07T13:23:16.146762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:23:16.277430Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.277430Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:26766c29daad41a3abc9eb077168db1774d2debd1f3a8b45d585afee29aa015c","observation_id":"b422c2a4-0013-4502-aa35-17d807464fc1","resolution":{"observed_at":"2026-08-07T13:23:16.277430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.383210Z","title":"Focused transformer: Contrastive training for context scaling","venue":null,"work_id":"201a0dcc-6905-4af4-9c86-bc8640411025","year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.386129Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d0531eac95276c59754a31417256267b766102eb731a4e3619b893bdf7629f8a","observation_id":"84a3b04e-5b8d-44c6-82b7-27af9452da45","resolution":{"observed_at":"2026-08-07T13:23:19.478740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:16.512204Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.512204Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:63a28a2fd65955b26af5024f6c443e5aa7b10dab25fe999aef7cecf467ff5da8","observation_id":"87e4d887-0a83-4a15-8e22-2e011a254f15","resolution":{"observed_at":"2026-08-07T13:23:16.512204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T13:23:16.626693Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.626693Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:0ec27b85f47fed87ec7d0195617be2178b0422a3614f9012122e64a4c835a306","observation_id":"c97b554d-698a-4c8e-ac4d-4f4c4aec1bff","resolution":{"observed_at":"2026-08-07T13:23:16.626693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-07T13:23:16.748973Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.748973Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:d9266ff56c712bacfbd0a14471d2391645d18eea12f6a99e39f0fd2e7f41881b","observation_id":"55799ab1-3984-4f1f-8861-7db453514f8c","resolution":{"observed_at":"2026-08-07T13:23:16.748973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:16.882892Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:16.882892Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:65a536c6963425c0a148260b7497c93f4f72cb1435f4bf1acbda2bfa364831fb","observation_id":"a9f749b2-475b-4492-9d5f-065a4318b63d","resolution":{"observed_at":"2026-08-07T13:23:16.882892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:19.178242Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"f438157e-c52c-4c57-833d-7ce0eb6f2cc1","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.013916Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:4a2b6bb81f1f6c7166d0ae6b3ea03da34401d2f5391d0112bb8691f627bde743","observation_id":"fa9203f0-0b0a-4f8f-9e78-e801f189ccf9","resolution":{"observed_at":"2026-08-07T13:23:19.253659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.884532Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":"63568b9b-e3c7-4045-b99a-b12a29e6bf8c","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.147867Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:328c32f73798343bdcff07d67525e01924dd12627069592d7d52407307ed4f9f","observation_id":"1b6c7e42-8989-425b-9aad-819a31bd7dd0","resolution":{"observed_at":"2026-08-07T13:23:19.026709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.613134Z","title":"Long-context language modeling with parallel context encoding","venue":null,"work_id":"bf0f515b-237e-4b8a-9db8-777a44f95444","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.231268Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:dc48765c8ebe80dd23ebfaeb223f456038e41d2e3da4967d5bc9e63757021c47","observation_id":"1a6a0cb8-764c-4015-b57a-1585ca714643","resolution":{"observed_at":"2026-08-07T13:23:18.749679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:17.318637Z","title":"A., Ainslie, J., Alberti, C., Ontanon, S., Pham, P., Ravula, A., Wang, Q., Yang, L., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.318637Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7de171926b8abcbb0713bc278a44ae89ec9676cfe30b6ea38610fc39fd8b3152","observation_id":"906dbd58-3240-4530-a03c-1e4d84aa0c9c","resolution":{"observed_at":"2026-08-07T13:23:17.318637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-10T18:32:18.501904Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T13:23:17.432878Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.432878Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:779a99025505ec8e3805ffbe7c8b2f4ca04cea60fc1c9a7c36d7b1e5a10f9e09","observation_id":"c0cc82a2-9832-452d-874d-a6320360af00","resolution":{"observed_at":"2026-08-07T13:23:17.432878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T13:23:17.614845Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.614845Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:7211e77c50cba774aee9a1d9f4c10c7e8216c7aafed44486a2b3b2339275cd39","observation_id":"a9301f6d-79c7-40ea-8265-2caf6e639b1b","resolution":{"observed_at":"2026-08-07T13:23:17.614845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:17.750697Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.750697Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:82f86931a491d499d20fb29f9343be39cde445b77bc3394cee6a3d4cfd5456da","observation_id":"e336b779-99da-4b72-b53d-88cc1c33af2d","resolution":{"observed_at":"2026-08-07T13:23:17.750697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.366634Z","title":"Pose: Efficient context window extension of llms via positional skip-wise training","venue":null,"work_id":"63662ebf-141f-44bf-8f60-7a7542c08b48","year":2024},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:17.886475Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:4a67d08121616419d484244ac84ddc20b4e402316b7a14dfe7c63f1bac4f830c","observation_id":"86f2e456-ecf4-4ac3-a030-f06d3c57879d","resolution":{"observed_at":"2026-08-07T13:23:18.495756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:23:18.048778Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:23:18.048778Z"},"links":{"citing_paper":"/paper/2505.22107"},"observation_digest":"sha256:b62318683b9b71f7659a698c9592ace24f57c3b020a2ed30093bbadde01f3db6","observation_id":"1cf7fd48-3584-4635-871c-c3ce72914c83","resolution":{"observed_at":"2026-08-07T13:23:18.048778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22107","last_updated":"2025-08-14T11:51:31Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T13:47:44.529175Z","submitted_at":"2025-05-28T08:34:46Z","title":"Curse of High Dimensionality Issue in Transformer for Long-context Modeling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2505.22107."}