{"as_of":"2026-08-10T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f4fa8ea715d029a6872dc9e144bf816113db9f48209c8b2ae42947469ebf5a6","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T03:21:01.687528Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06601/citation-record","integrity":"/paper/2607.06601/integrity","json":"/paper/2607.06601/citation-record.json","paper":"/paper/2607.06601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.443946Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"451e5509-ddba-43d2-b361-4bf176f9cc1e","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f15c21866ace14bf37c78d0ddae3ee74d477de27071a8f3877039db6b0701672","observation_id":"c6f1d44a-58a3-41cf-9474-5a12fd4a3c62","resolution":{"observed_at":"2026-07-11T03:27:49.460673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.261092Z","title":"CoLT5: Faster long-range transformers with conditional computation.Empirical Methods in Natural Language Processing (EMNLP), 2023","venue":null,"work_id":"7371395e-1352-4821-b5bc-fb27e2b0beb1","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e42cc242c06f407c2c5c7bb7facc733030805c4ec8163b17134eb04bf10480f8","observation_id":"a16e609c-2b80-4a1f-87fb-deb0281fda50","resolution":{"observed_at":"2026-07-11T03:27:49.286954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4083c176b11b16622f587b311d9cc3d21e6ae2a28ae9ee43bc99994bd57206f4","observation_id":"8cf0eac4-4837-4025-bc5b-debbfb13014b","resolution":{"observed_at":"2026-07-11T03:27:46.701443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f2f1f930604fec791b04e0f4c49c0a7f423c1e9075769d12c85c3c7164b65ba2","observation_id":"b7702268-9035-4e0d-a534-eb861ed63f8e","resolution":{"observed_at":"2026-07-11T03:27:46.831362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.543663Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"081bbb47-663a-4e24-a196-55e54f31df34","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:15356d095ef42bff0981924fb0c281409a10995d23bd804c7c0f20363072805d","observation_id":"bc05f8c9-fe22-45da-a4e6-80438af1be29","resolution":{"observed_at":"2026-07-11T03:27:49.564973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.229865Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"618d0d25-e69e-4bbe-aa2e-5b18cfc4ba7c","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4b0116bb98a719dbd39c31cd89cd1cb5d889236266fe2d29fd3262cc3e707023","observation_id":"3b0a26b1-31fe-4e36-854a-cf17470d6d34","resolution":{"observed_at":"2026-07-11T03:27:49.257627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:0cb2a3756d53b094d66e4a1d82c362e3bbfe83fa04055e79438c0e9390d38453","observation_id":"c12fb47b-8289-42ca-b7e2-90b16f86ea63","resolution":{"observed_at":"2026-07-11T03:27:46.912589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.290669Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"b1ec6ad1-4a87-49d4-bde5-f76c3f357c2f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:46d32c3676975c9510709b388b2ee3b29e8a0c80417b2d80417338b5835bed44","observation_id":"1a129485-6300-444e-ba64-894f24bef20b","resolution":{"observed_at":"2026-07-11T03:27:49.317762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:18ee2915c8245906a40de7f81591358d3d59888ee8884d18a0831030f6950c16","observation_id":"4ee84a84-2d37-43f6-8e2f-590d3752ad65","resolution":{"observed_at":"2026-07-11T03:27:46.940199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:ea0e2ff20679c6b23a06a2369a1ffb56191e6065a1ee91bb1354e95df4ec7415","observation_id":"a2cc56b8-e4e2-46f3-b6e9-a57a31b824c9","resolution":{"observed_at":"2026-07-11T03:27:47.082510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07987","last_updated":"2024-09-30T21:19:29Z","snapshot_observed_at":"2026-08-03T12:04:56.535363Z","submitted_at":"2023-12-13T09:00:21Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention","version":3},"cited_work":{"arxiv_id":"2312.07987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07987","snapshot_observed_at":"2026-07-11T03:27:46.660519Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention, September 2024","venue":"cs.LG","work_id":"ccf4f481-e6c9-4911-9040-cacbf6460992","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2312.07987","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4c533863e8755bcde9a897c74dd0bcc2d0722283817c1b96d100c22668ad8dd6","observation_id":"93ac1217-3f18-4a5a-8422-1ebd631c2aa1","resolution":{"observed_at":"2026-07-11T03:27:46.677614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:86c846abdea01ca711776ae86d9aa635cb74aee1d6328216814f96bfd9864047","observation_id":"ec68947d-eccb-489f-8947-d8a121a03339","resolution":{"observed_at":"2026-07-11T03:27:46.995209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.168075Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"e5783130-2780-45b8-acc5-8d738e2d3e5e","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:45397cac57003259cad8fe7a0d4462e293bccdd419b636d3476175c475fa83b8","observation_id":"f27b0295-16d3-4eca-a599-62b153aec92e","resolution":{"observed_at":"2026-07-11T03:27:49.197139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:736d873bcdf5d37b0105d2cb71d0286bc9785bfc2fad7017db7ab4fb2f95a537","observation_id":"c87a8819-21cc-48ac-9b77-812de7079b25","resolution":{"observed_at":"2026-07-11T03:27:47.022883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.756423Z","title":"Uni- versal transformers","venue":null,"work_id":"c95f928b-c318-4fb0-ba2c-d40910ad92b7","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:dbcfbca1093b3b634d6cea9ce14eefbfe67c1ed6fe617d68494d2dd20886d72e","observation_id":"30ed05dd-f00c-404d-939d-fd0b287cbb43","resolution":{"observed_at":"2026-07-11T03:27:49.776327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.827543Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"233320f9-9aea-4831-9900-397cb319d078","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:0c3e4aaad28ba452c411670414d2167dc8042e3b8e18e459728d63683377a7ac","observation_id":"041e54fe-3af4-4cc1-8138-80c06638c52e","resolution":{"observed_at":"2026-07-11T03:27:49.848528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.954164Z","title":"QLoRA: Efficient finetuningofquantizedLLMs","venue":null,"work_id":"16434af3-29b1-4432-8966-dcbc232ba4ba","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e8994dd4208057100e8a037a702fb6b0146e04188b310d0ce26b3b636e5672f5","observation_id":"154b7390-4c5d-4d04-b6be-58eeeb3c2292","resolution":{"observed_at":"2026-07-11T03:27:49.975482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.200546Z","title":"Depth-adaptive transformer","venue":null,"work_id":"3f2058d3-bd42-46b2-bbbf-b60034bbd597","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:78c7015640a1e7c5d5b486b0c50917133679b7c2c0addff6a766c4823980c868","observation_id":"598e965d-9d08-4985-ab32-4b9b2ac4af9b","resolution":{"observed_at":"2026-07-11T03:27:49.226857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.141237Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":"b6c0caad-21a5-4aba-b3eb-e93282a09df0","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:86fc9c0386ba58bc079df2b7af14af2af8c4c8ee8cdc25a9449cbf3a89f3ed74","observation_id":"83ca5649-5439-469e-a9ec-eb14d5177954","resolution":{"observed_at":"2026-07-11T03:27:49.163885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.134131Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research (JMLR), 23(120):1–39","venue":null,"work_id":"60697aeb-c914-4bce-a7b0-365bd7a943d6","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:baeb21a34f381cbdbcaa33f387e7259875ebf059f0a10d4dcd6f09e661ad2b18","observation_id":"5ddb967a-5b0f-4a43-b651-12448e90d709","resolution":{"observed_at":"2026-07-11T03:27:50.163282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.011497Z","title":"GPTQ: Accurate post- training quantization for generative pre-trained transformers","venue":null,"work_id":"1fb76a5c-2e4e-4e84-b3ab-b7c9cac06574","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:46f09e7de813e207dd9b3a0ff308f1191950ba648ff5fe764e58748b2db72502","observation_id":"27c5362e-215d-4238-bcf4-7944a43492d5","resolution":{"observed_at":"2026-07-11T03:27:50.035466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.875173Z","title":"MegaBlocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"c49880cd-e000-440c-8281-98343da128ea","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:ac8550fbd81715965eaef8dd5c2e3dd7ed4c46b119261c2ed991051e09009276","observation_id":"23a0a73d-f166-400d-ab5c-b204819a0901","resolution":{"observed_at":"2026-07-11T03:27:49.893346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:57855e7f3dc6015a591555d8a8f5d69c68dbe7e16a7666936d7ca31c19730dd3","observation_id":"9c4179aa-6bcf-4687-bac6-b8be76258c17","resolution":{"observed_at":"2026-07-11T03:27:46.756821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":"1603.08983","doi":"10.48550/arxiv.1603.08983","metadata_source":"pith","pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive Computation Time for Recurrent Neural Networks","venue":"cs.NE","work_id":"75565443-173e-479c-b0e7-d2464e7630be","year":2016},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:0157a43839e112d4979387e4a890282f68966986eaa4c2b89050aa9125d40a93","observation_id":"c62f7489-23b5-419c-82aa-bd80143974bd","resolution":{"observed_at":"2026-07-11T03:27:46.968390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:748f0bf293abaa80c6700597321952619ee555653ab7ccaa4ce4aa5e2374b9ea","observation_id":"173ff941-c038-470c-b100-ab2a3fd97b21","resolution":{"observed_at":"2026-07-11T03:27:47.112092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.805633Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":"78953019-8f03-471c-b366-c2ade0049322","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:33a0d9f6c12417b9d59e6984a92a6f850f510edc5eaad3333afcd8cf2bc8ad86","observation_id":"447465bc-217c-40b2-b1e1-c99de9d7778d","resolution":{"observed_at":"2026-07-11T03:27:49.822401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.568028Z","title":"Categorical reparameterization with Gumbel-Softmax","venue":null,"work_id":"eb0de53d-c02a-49a4-bf0f-346b8261389f","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:3cd3e6cff285432ade182eed869ccfd38a391ca05868a1d46e0991cab65198d7","observation_id":"d8079ba3-b840-4b15-b822-0e11de00c7b1","resolution":{"observed_at":"2026-07-11T03:27:49.588414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:5281ce901a409a51abb41aba57fc8585a2d130691548e8d1c36c07ff2abf7b09","observation_id":"4d7f81cf-1db6-4dc2-bc20-210a94521bac","resolution":{"observed_at":"2026-07-11T03:27:47.053111Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f18f5f2b5d0201c1b815470945c32de5bce525cf7d0a89af823cd9839478d5df","observation_id":"f455abdb-917b-4b0c-8a6a-cf324a73ccb5","resolution":{"observed_at":"2026-07-11T03:27:46.858674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.463967Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"44e4dcb8-056d-4a7a-8f38-33ed28d30b53","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:0cb66197a3e84b124ac9f6fd217e7bc62047fdfa40c233c208db7fa2528725fb","observation_id":"6b209d01-b2f7-43ec-80d0-7e88dae93dc2","resolution":{"observed_at":"2026-07-11T03:27:49.484593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.414262Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"213bdeab-8322-484e-b315-095023e5166a","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:6c2cbc2d339b8643e2fbd43d2740bf7777dcc13fb4859c9f04d9f9c1869e5616","observation_id":"59880c2d-1f14-4510-a899-7a49269fdf5e","resolution":{"observed_at":"2026-07-11T03:27:49.438218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.339770Z","title":"BASE layers: Simplifying training of large, sparse models","venue":null,"work_id":"f3974bef-7236-404f-a92c-34f84d9ca20d","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:8a41a204eac75b031ed84a57a1c133d21fe59e90c401cc6106391af0dffc4f21","observation_id":"d2ac180e-cd6c-4a02-848a-411688e49dd3","resolution":{"observed_at":"2026-07-11T03:27:49.361501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.851350Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"4cfaa815-a171-4fcc-ae26-647d0b628d5a","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:75d3ade7bce8dc1bc978c533b78b18651bf77f3e094f35e62cfac889a7e17697","observation_id":"1c18df4a-df0c-441f-a228-00bc96886f8c","resolution":{"observed_at":"2026-07-11T03:27:49.869405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.924579Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a1e3c974-0c48-43bd-8f29-52f24e5371c5","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:62fa188903f29ea9e74c3096a2d41de5e574851f1cd908da0e9911a846ceddec","observation_id":"81774670-d3d7-4251-aa82-f834564c41d1","resolution":{"observed_at":"2026-07-11T03:27:49.951476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.895715Z","title":"Maddison, Andriy Mnih, and Yee Whye Teh","venue":null,"work_id":"ce42633a-cc2c-4e44-b80a-72a104960319","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:042659b117e2d647936bd03aa53b4c696742e21a51eb0512de090e1505f4db98","observation_id":"723db302-6504-4e02-97b7-aeef251d373a","resolution":{"observed_at":"2026-07-11T03:27:49.919615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.981436Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"e699764a-5082-4826-85d5-1f42e6f8edfe","year":2016},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:54931b2214dabd89a37b32257ab446e28b063facdddbdd2a1f0be2fb05bfa302","observation_id":"572dd9e7-eb83-45d0-8494-342a99c2ec90","resolution":{"observed_at":"2026-07-11T03:27:50.005465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.040816Z","title":"DeepSpeed-MoE: Advancing mixture-of- experts inference and training to power next-generation AI scale","venue":null,"work_id":"ced48599-af36-4b32-9fee-5ce0fa537bab","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:9c13e33b29272f3cbf22014a5306fcf21c60a0f684f3038a04e9659bd3253ab5","observation_id":"0323126c-2c9c-4f04-844f-889b0cfff867","resolution":{"observed_at":"2026-07-11T03:27:50.063823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":"2404.02258","doi":"10.48550/arxiv.2404.02258","metadata_source":"pith","pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":"cs.LG","work_id":"6dcdd707-a37b-49a9-9531-4fc6f5b9ed84","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4b80e3bc9ece931cdc54b1ca797538e719fd93cd4901aba1f7824979a202ff71","observation_id":"47498db2-1298-4c4a-a40d-b0f60a7031c0","resolution":{"observed_at":"2026-07-11T03:27:46.733714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.320050Z","title":"Hash layers for large sparse models","venue":null,"work_id":"12cfde79-6788-43bc-8163-759fd3d3c0fa","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4fb2922cbe26319b3824eb79fe9870393b0acec2617a74c731358406128f11d7","observation_id":"b7899cb2-a85c-438f-9a69-eea508631924","resolution":{"observed_at":"2026-07-11T03:27:49.337262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.616003Z","title":"WinoGrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106","venue":null,"work_id":"243059f7-4536-48b2-bf09-64ac04da23b9","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:05eed115dcd65531ecd7d2fd57d1a2b20e5bceac959ec1e200e3d3e557597f12","observation_id":"a3f626d7-f5e9-4783-a00a-1bdfc5dcd1c3","resolution":{"observed_at":"2026-07-11T03:27:49.640514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.488114Z","title":"Confident adaptive language modeling","venue":null,"work_id":"79b94827-7379-413c-a81e-f6102c3437fd","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:3ae816355aa7acacdb754b0851f5336dba71bfd8beec81039179b27cf6336551","observation_id":"d366ebe4-852a-4557-976f-5bacdf5bb857","resolution":{"observed_at":"2026-07-11T03:27:49.515000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:39beadfccee876d34529ba943765f26354d16cf27e2e59ad01c8633e7a018210","observation_id":"93ad1f44-0cdb-4b4e-828a-69cb4bd8bb58","resolution":{"observed_at":"2026-07-11T03:27:46.805207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:7ed63e0c4ddf21388fe4b854405f4695487913736cb3f8acd54144e2ba8ff7d2","observation_id":"98fa3c18-b935-48db-8bdb-833a3b0cd04e","resolution":{"observed_at":"2026-07-11T03:27:46.780834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.517843Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"d0219ce8-cd4a-40a6-8a52-b40dc71b1004","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:8295c1e6ace61e487d5eaebf416c3e1a714428361e031047d342c0108ad61612","observation_id":"252b5bfc-ac9d-4412-a291-f49745633493","resolution":{"observed_at":"2026-07-11T03:27:49.540517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.591479Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"d7e0bbe5-80f8-403b-97a4-92e0adb57f28","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:3f95c7785ac849b096f055b6ce754c95372307d69b22843bdc0dc97fc475ade7","observation_id":"df4ee790-2647-4e2a-9d75-146d73252b30","resolution":{"observed_at":"2026-07-11T03:27:49.613213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.780233Z","title":"Adaptive attention span in transformers","venue":null,"work_id":"3643dba3-482e-49a5-9a2d-a4143ab51739","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:82cc3720586f5dcdc14086262d327619bdadbfe92eb1e17bca9c2cdc5c8dba73","observation_id":"db412bd9-19d0-4b06-910b-a2f04c56fb64","resolution":{"observed_at":"2026-07-11T03:27:49.803006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.364389Z","title":"RedPajama: An open source recipe to reproduce LLaMA training dataset","venue":null,"work_id":"89a8f043-3dd3-435e-b70a-4ae9a4a9c466","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:005e4fee747ae4553a27aeaf18eb274d5c1516b5f9c83262c71bee3708e1da2d","observation_id":"b05a2f47-3dca-4638-80a6-e14c5c59f5de","resolution":{"observed_at":"2026-07-11T03:27:49.386197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.097604Z","title":"Williams","venue":null,"work_id":"7ce1f972-bcb3-4762-9019-4cb3501b3719","year":1992},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:dddc93793426ea1a0fb4278b57923a9eb5f9101c89a663796464a738058a6938","observation_id":"591d3d97-a3bc-40a2-a3f8-184120383b4d","resolution":{"observed_at":"2026-07-11T03:27:50.130733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.067047Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"153fd63e-49a6-41a2-ae73-882541c89257","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:112cce2a1958cb9a8ff425defb9849db288fbf3b3837bcc58b6acc4de7dc2a9b","observation_id":"e4dc1fcc-2c38-4d1c-adc2-fb6971e3ef57","resolution":{"observed_at":"2026-07-11T03:27:50.093759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.688094Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"3fab7912-1367-42b0-b545-9f5b76e989df","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:fa62d8919198f76115e51cd0f368084740996461c603473666f75e9a7f8d4042","observation_id":"1c4f6a4c-4090-4364-94fe-a5ab1d4e26e5","resolution":{"observed_at":"2026-07-11T03:27:49.705698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.389652Z","title":"HellaSwag: Can a machine really finish your sentence? InAssociation for Computational Linguistics (ACL), 2019","venue":null,"work_id":"39a5ea55-f4eb-4662-ab0f-9385ad2aadf9","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f15fca566304e96cef04aa8fe0db4493f7d2477316312d0a7b920e0f5fca0b35","observation_id":"94cf9ac2-63a2-4f92-93bf-5a894983ab02","resolution":{"observed_at":"2026-07-11T03:27:49.411597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.643680Z","title":"Root mean square layer normalization","venue":null,"work_id":"1e385089-b59f-4336-9fa1-8c58c216a921","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:c849bc37059697c52d57811f4ddff37aa3062dfdd7dd97888aefe19becbda9c8","observation_id":"0e15645e-fb27-4c74-b7ed-9562502f5ce2","resolution":{"observed_at":"2026-07-11T03:27:49.664028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.667052Z","title":"Mixture of attention heads: Selecting attention heads per token","venue":null,"work_id":"86fb5f3c-8e22-48d0-9504-2506d33f881f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2b77d2ec2306441da2ff9ce134690d477ac7082131db60a511df25e5ed0c8721","observation_id":"1bbaa7e6-ed5d-4778-b9a0-4476bc91cad6","resolution":{"observed_at":"2026-07-11T03:27:49.684979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.708611Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"bfb332dd-b361-4b48-8344-2a3bb200d983","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:1b193c07416a9f28f37145611a4c66af9e41718d1ef8a250e51262e9e6ae0e40","observation_id":"e8afb211-eee2-4214-a981-7b401ce35bd6","resolution":{"observed_at":"2026-07-11T03:27:49.728178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.732117Z","title":"Dai, Zhifeng Chen, Quoc V","venue":null,"work_id":"a2b130d8-d6f5-4c7c-ae43-8be73985fcee","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2475ebcdc898e058d16902069cae91cb077216d830be0697638687a2daddf92d","observation_id":"190c1693-34d1-4084-aae5-d3ebda45542e","resolution":{"observed_at":"2026-07-11T03:27:49.751235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f8ad64401b25c0557862d77cf5b93bc57003a9cb8ced5a00825c479ba8214592","observation_id":"a43205cb-f2bf-4834-9110-62da85b0a662","resolution":{"observed_at":"2026-07-11T03:27:46.886389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":39},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.06601."}