{"as_of":"2026-08-10T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1d1edfe135924b08ecfa0989b0b6edf6c36ff258b0d8b4c5aee6e597eca15ea","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:34:03.638787Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.05313/citation-record","integrity":"/paper/2511.05313/integrity","json":"/paper/2511.05313/citation-record.json","paper":"/paper/2511.05313"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-03T23:33:51.967485Z","title":"gpt-oss-120b & gpt-oss-20b model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:51.967485Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:64d1d805970b5b019576e6740fbd6e495ffa0b81618d49ac5a5f756eca4f497c","observation_id":"f31ee432-0c57-4f01-b740-c4b3f637ab54","resolution":{"observed_at":"2026-08-03T23:33:51.967485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-08-03T23:33:52.100391Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.100391Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:21a3681a83e05382bb94f9de85e2a80ac568fcca3795dd37f51d4cb9e9896862","observation_id":"84bbd185-97ea-424b-ba7f-cd7235fec54e","resolution":{"observed_at":"2026-08-03T23:33:52.100391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09433","last_updated":"2025-03-07T17:33:50Z","snapshot_observed_at":"2026-08-06T01:09:40.526196Z","submitted_at":"2023-04-19T06:00:26Z","title":"Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09433","snapshot_observed_at":"2026-08-03T23:33:52.278564Z","title":"Language models enable simple systems for generating structured views of heterogeneous data lakes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.278564Z"},"links":{"cited_paper":"/paper/2304.09433","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:9465ac2ce7b4ab9071e4fc3450ce341e7310f33fd68eb4036b2a8e91220ac5ef","observation_id":"c3755546-f36b-4f49-a888-6856a99e84b3","resolution":{"observed_at":"2026-08-03T23:33:52.278564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-03T23:33:52.464870Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.464870Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:44583bc00581db188c75a97f93058eed2c6a093df481df3cc4b74359d5b09f03","observation_id":"b6a5d79a-bbc0-4398-9c2e-0d29f0220b10","resolution":{"observed_at":"2026-08-03T23:33:52.464870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05483","last_updated":"2024-07-07T19:55:09Z","snapshot_observed_at":"2026-08-02T03:13:14.123634Z","submitted_at":"2024-07-07T19:55:09Z","title":"Just read twice: closing the recall gap for recurrent language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05483","snapshot_observed_at":"2026-08-03T23:33:52.586902Z","title":"Just read twice: closing the recall gap for recurrent language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.586902Z"},"links":{"cited_paper":"/paper/2407.05483","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:37fd88d810530e8740cd8198c9ef1a7fab3f3952280adf650e37ac643b81952c","observation_id":"6e049d7e-d541-4901-a43f-5631b65a9810","resolution":{"observed_at":"2026-08-03T23:33:52.586902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:52.719531Z","title":"How to scale your model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.719531Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:4e067488cb250e301e405c9c08e6e58a0ade96d6f00e6ee43701fbf6030c2a18","observation_id":"0d7a5402-de5f-4207-b442-21a3b8508d60","resolution":{"observed_at":"2026-08-03T23:33:52.719531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-03T23:33:52.869712Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:52.869712Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:db618eb5ef0181e6fca5f32daa3515dc5bb62bec3a13dae1fb4e466891098e12","observation_id":"73751852-6914-4cfa-88ea-b6650c79a247","resolution":{"observed_at":"2026-08-03T23:33:52.869712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-03T23:33:53.021093Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.021093Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:d568d0965859818e03bbbc88a97d1ad7bc039868ffa4418a55fda3dee5e10747","observation_id":"d152bfad-8134-44c8-9b7a-f20422a98c28","resolution":{"observed_at":"2026-08-03T23:33:53.021093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:53.144347Z","title":"Transformers need glasses! information over-squashing in language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.144347Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:dc05eb319b1261233758be83cf8ec43aab510defe7f51c5619319e9365d79503","observation_id":"993f876d-5050-4296-8947-5fd8d7825eff","resolution":{"observed_at":"2026-08-03T23:33:53.144347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08821","last_updated":"2024-12-15T21:20:12Z","snapshot_observed_at":"2026-08-06T10:11:02.511531Z","submitted_at":"2024-12-11T23:36:20Z","title":"Large Concept Models: Language Modeling in a Sentence Representation Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08821","snapshot_observed_at":"2026-08-03T23:33:53.304599Z","title":"Large concept models: Language modeling in a sentence representation space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.304599Z"},"links":{"cited_paper":"/paper/2412.08821","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:5ba7eb317cbc12ea75edbc67edee4a54380062b2aa37addda684a387fea82969","observation_id":"2276db91-4b47-41f6-8b8b-0d0dd4484280","resolution":{"observed_at":"2026-08-03T23:33:53.304599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-03T23:33:53.461340Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.461340Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:6f840c93db4f9703fe7200f2bc7e8dc2283e2b069a03606e2a9e0417fdf2cd7f","observation_id":"8ca648cb-47da-487f-b18f-5029b19abe03","resolution":{"observed_at":"2026-08-03T23:33:53.461340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-03T23:33:53.602718Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.602718Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:1b6ba756cf32b2bf0082aadbd986d9010e7348218fd40ca3afb566651480ce4f","observation_id":"a642a052-83c7-4be8-a96a-fbfb33159988","resolution":{"observed_at":"2026-08-03T23:33:53.602718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:53.751932Z","title":"Flexivit: One model for all patch sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.751932Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:06a2de8085948e97b4110b7f61cda600ff6186b8412005e473ef64ab7f15956f","observation_id":"110e89bc-a0a2-47e3-bcd4-03bda494dd5d","resolution":{"observed_at":"2026-08-03T23:33:53.751932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:53.987182Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:53.987182Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:cf0c150a471996a17e8c1dbbc6be0d2660ec934a14c8af7f6a53f1d81466b546","observation_id":"e4e77e54-04d4-4e2c-9459-fd07059fbf30","resolution":{"observed_at":"2026-08-03T23:33:53.987182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:54.115968Z","title":"Adapting language models to compress contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.115968Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a42bec2ffeb365ab5367a7f7e30910ca2250c30696756415556309bea0169c02","observation_id":"96683785-752a-412a-993f-85bec3c24e50","resolution":{"observed_at":"2026-08-03T23:33:54.115968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12172","last_updated":"2022-02-24T16:14:29Z","snapshot_observed_at":"2026-08-04T09:52:50.540335Z","submitted_at":"2022-02-24T16:14:29Z","title":"Overcoming a Theoretical Limitation of Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12172","snapshot_observed_at":"2026-08-03T23:33:54.260769Z","title":"Overcoming a theoretical limitation of self-attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.260769Z"},"links":{"cited_paper":"/paper/2202.12172","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:49fa233a8225118facfcdd1a97675e825b3a1be7ebc6348100d44f12d7e2b086","observation_id":"4c865657-ed21-45ef-9bed-d0a716a929ef","resolution":{"observed_at":"2026-08-03T23:33:54.260769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-03T23:33:54.352747Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.352747Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:175b0e2c6ec477241a6fb454c838fad61ac789c9ecbb9b73128ddc2c5d824932","observation_id":"5df8a36e-2400-407b-9a9c-f2035357cf9e","resolution":{"observed_at":"2026-08-03T23:33:54.352747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T23:33:54.444640Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.444640Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:ea42afaa8e21787c8413be4b6585e1d850e64069c7d246106fa66caef1b8bf1f","observation_id":"52d5c907-7a1f-4118-9de4-03bd4e0be61d","resolution":{"observed_at":"2026-08-03T23:33:54.444640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:54.546457Z","title":"Funnel-transformer: Filtering out sequential redundancy for efficient language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.546457Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:320b949babd01e1b9c7708a681c87f20b531bd33ab904309558c72b7efa0b0db","observation_id":"28f59c38-b09a-4d5e-946b-f7cbf66cb2a9","resolution":{"observed_at":"2026-08-03T23:33:54.546457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-03T23:33:54.645983Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.645983Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:3e907b306a211867257c58b06b1c2b915e5bad7a32cccb762839c7d7ad52a75e","observation_id":"8a44282c-6d9b-40c0-bb9b-04968cb2d662","resolution":{"observed_at":"2026-08-03T23:33:54.645983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:54.729595Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.729595Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:1fe0781f35c9e6449a52b87e0291e5af6836a603185d823cb615747a27e95301","observation_id":"c7ec9ae0-c2de-465f-b26b-fa48d9f64456","resolution":{"observed_at":"2026-08-03T23:33:54.729595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:54.834896Z","title":"Matformer: Nested transformer for elastic inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.834896Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:3c97c89367b9fb491b77a2156e1f4027a9d5f7ab25013abbb4f34ce2d42bce7c","observation_id":"3d3b6f76-9922-4c8b-8191-94d830645711","resolution":{"observed_at":"2026-08-03T23:33:54.834896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-03T23:33:54.935011Z","title":"Flex attention: A programming model for generating optimized attention kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:54.935011Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:91307af41b181634829d47a0a54d3d36ea02a3b4e5dbda533157ca736df0d2bf","observation_id":"563bfbff-9d26-4e4d-bcfc-01b4def9fef9","resolution":{"observed_at":"2026-08-03T23:33:54.935011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-03T23:33:55.068944Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.068944Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:84f35bd6eda7aee26860da5fbab86d8fbfe65c4c12af4d95185fecb4cf64201b","observation_id":"2c36dbf2-848c-4c5f-9355-ebe795c7abd3","resolution":{"observed_at":"2026-08-03T23:33:55.068944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14052","last_updated":"2023-04-29T03:18:40Z","snapshot_observed_at":"2026-08-06T18:01:24.576458Z","submitted_at":"2022-12-28T17:56:03Z","title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14052","snapshot_observed_at":"2026-08-03T23:33:55.173974Z","title":"Hungry hungry hippos: Towards language modeling with state space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.173974Z"},"links":{"cited_paper":"/paper/2212.14052","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a0243a42593ae9d3939e1fd96290d21f0bae810a5841a6e2321c56a2164acdf6","observation_id":"459b76c8-ac26-4782-8cc5-a6066ff01919","resolution":{"observed_at":"2026-08-03T23:33:55.173974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-03T23:33:55.285309Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.285309Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:69de9e66f87244b63935e9c9bfdeb8023d6b6abda413c2e417674b5e2c60625d","observation_id":"596865b9-53a5-47c0-afad-0e1bb137fd30","resolution":{"observed_at":"2026-08-03T23:33:55.285309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:55.408794Z","title":"Ai and memory wall","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.408794Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:3e493f749fde28fb10945d64ea039d79a137dda0457205d66ccdda376c7415b8","observation_id":"4f67ff52-2dfa-4347-bcf6-4eebe876007b","resolution":{"observed_at":"2026-08-03T23:33:55.408794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00927","last_updated":"2025-07-11T15:49:30Z","snapshot_observed_at":"2026-08-07T16:17:02.389734Z","submitted_at":"2025-04-01T15:59:32Z","title":"Multi-Token Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00927","snapshot_observed_at":"2026-08-03T23:33:55.536316Z","title":"Multi-token attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.536316Z"},"links":{"cited_paper":"/paper/2504.00927","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:21ea0ca58a8eee9dec7e035532e0564e621a3939ae41799246e1961e0cc19fa5","observation_id":"c28ea875-8e7c-43e7-ac6a-c860e6cbb4b9","resolution":{"observed_at":"2026-08-03T23:33:55.536316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-03T23:33:55.673830Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.673830Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:209e3a5404eed44ccbd9616261079fab20bfffadc88c747a0a28835a07416510","observation_id":"dd420224-1cd1-4fab-b3ea-3054f9e4d8cf","resolution":{"observed_at":"2026-08-03T23:33:55.673830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-03T23:33:55.769204Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.769204Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:14024811f32d7de2e6036e14938f90c1e1a5873263229d9af790950e71911f3b","observation_id":"42e700d9-5079-4f05-8136-aee825a7039d","resolution":{"observed_at":"2026-08-03T23:33:55.769204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:55.903631Z","title":"Transformer in transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:55.903631Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:d4bade2c2edc5c06d945f12a042600774ff5ecc0aff33cb6133fd616c79267af","observation_id":"1bebe3b0-619b-43f7-afb6-29ba8e79e53b","resolution":{"observed_at":"2026-08-03T23:33:55.903631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:56.006822Z","title":"Block transformer: Global-to-local language modeling for fast inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.006822Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:791174fdf1d3e0e189c02d420ef7f1e71f8f8af647e9e7b9590d9dec81ae1e20","observation_id":"7c548c31-0ca0-4a5e-ac79-487c786081a7","resolution":{"observed_at":"2026-08-03T23:33:56.006822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:56.116543Z","title":"functorch: Jax-like composable function transforms for pytorch","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.116543Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:c65fb16c5f6692cbad1332b49e568b7370f3bff91c6d7960b5170924a2bae692","observation_id":"81e42c13-d365-4e0d-af5b-68def8d0eac3","resolution":{"observed_at":"2026-08-03T23:33:56.116543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-03T23:33:56.240171Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.240171Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:edd4d229292bd7c55d03ca05e5d0d7196fac91e33dd7277269ebae1c4f5ccb2b","observation_id":"4fdf4524-0a13-45db-94ad-9cd088e66d7b","resolution":{"observed_at":"2026-08-03T23:33:56.240171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-08-03T23:33:56.393190Z","title":"Dynamic chunking for end-to-end hierarchical sequence modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.393190Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a2fdea4a7814121094d421a7e7b9eee485b1e6f7fdcc1deb11bbcf9dd56d435e","observation_id":"5e9d73fa-dc57-4337-abf8-ef5c8045dbe2","resolution":{"observed_at":"2026-08-03T23:33:56.393190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T23:33:56.548151Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.548151Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:659236f1261aebfc25c025dff3c80dcebec916c2f38ae809f6147fccb16beeee","observation_id":"8103b078-7df7-4329-8404-fb9a9755987a","resolution":{"observed_at":"2026-08-03T23:33:56.548151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-03T23:33:56.627634Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.627634Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:634711b522d84b50f95b69022690e6699b39d724c640688c2e234cbc720a0267","observation_id":"af4c7222-d26c-4ab5-a758-e926e265ecd7","resolution":{"observed_at":"2026-08-03T23:33:56.627634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-03T23:33:56.777094Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.777094Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:1e23b9eb226ef6198be5cea82e345f5c6c34b7d2d701266ea33e53ec137db214","observation_id":"1fecb2ce-a985-41f8-841f-e30c937b7451","resolution":{"observed_at":"2026-08-03T23:33:56.777094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:56.934583Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.934583Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:db821b36f427f11b0082555f633f96f092aeda91a1d31e0207f1931b62948caa","observation_id":"52f09885-9892-499e-9b8a-8781767292af","resolution":{"observed_at":"2026-08-03T23:33:56.934583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:57.061128Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.061128Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:b51ef3950f30ddc4b532c63b6d08d613382e653b6ee97bcc731f340d3eeeadfe","observation_id":"d6f56781-7e16-40b6-8dc6-0feb16c7262c","resolution":{"observed_at":"2026-08-03T23:33:57.061128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:57.173889Z","title":"Matryoshka representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.173889Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a30258b31752b2352805675c895e33b80d96864acdfaad07045259b06de4cec8","observation_id":"1f175543-bfcd-481e-89cf-42e0491e105a","resolution":{"observed_at":"2026-08-03T23:33:57.173889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:57.348990Z","title":"Inference-time hyper-scaling with kv cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.348990Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:c568058dbe5b4f89dfeaa3713338a1b5638112674b7e1b4c71425cd271b0025b","observation_id":"f5fccd5f-e1b4-4801-9feb-36533a92919e","resolution":{"observed_at":"2026-08-03T23:33:57.348990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09827","last_updated":"2025-01-23T07:25:28Z","snapshot_observed_at":"2026-08-06T20:10:53.073960Z","submitted_at":"2024-06-14T08:32:45Z","title":"A Training-free Sub-quadratic Cost Transformer Model Serving Framework With Hierarchically Pruned Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09827","snapshot_observed_at":"2026-08-03T23:33:57.502308Z","title":"A training-free sub-quadratic cost transformer model serving framework with hierarchically pruned attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.502308Z"},"links":{"cited_paper":"/paper/2406.09827","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:295be043c8f7860b1ddae7865edebe3347528d02acd460c4b2ea43497d75bee1","observation_id":"38fe05fb-1178-4439-8c23-8595ac381ef6","resolution":{"observed_at":"2026-08-03T23:33:57.502308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-10T09:14:28.107387Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08910","snapshot_observed_at":"2026-08-03T23:33:57.667935Z","title":"Infinitehip: Extending language model context up to 3 million tokens on a single gpu, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.667935Z"},"links":{"cited_paper":"/paper/2502.08910","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:1b9c6a6b0097a370540281de384a0b6b58c54a2a7ed6ba06d081d051d88675b7","observation_id":"be78e69b-d60a-44a1-b951-354d1b35ac41","resolution":{"observed_at":"2026-08-03T23:33:57.667935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:57.776369Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.776369Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:b883356ed90ac1142d81e6cf195bcaf54f8ea4670422e50f104eb6cf6329afd3","observation_id":"b4737703-15f4-474d-aad4-7df565ad98be","resolution":{"observed_at":"2026-08-03T23:33:57.776369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:57.878890Z","title":"Openceres: When open information extraction meets the semi-structured web","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.878890Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:b75c2364cbe62cae7ff12dd019f66a0e723defbaa043e361b469fd1cc0868573","observation_id":"5c41e4df-f6d0-4eb8-b56e-a50412000701","resolution":{"observed_at":"2026-08-03T23:33:57.878890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T23:33:58.019489Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.019489Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:ff771c9d444a50441f1da3c93d2a3847ffdcb4d5b26c974c7f8a97326ecc3da6","observation_id":"40a3483b-0d90-4f0b-aff9-ce0ed6750d7f","resolution":{"observed_at":"2026-08-03T23:33:58.019489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10975","last_updated":"2025-08-19T17:56:36Z","snapshot_observed_at":"2026-08-05T20:14:57.566953Z","submitted_at":"2025-08-14T17:55:47Z","title":"BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10975","snapshot_observed_at":"2026-08-03T23:33:58.134824Z","title":"Beyondweb: Lessons from scaling synthetic data for trillion-scale pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.134824Z"},"links":{"cited_paper":"/paper/2508.10975","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:545f62c05b57b671e620c45bb076eec9d9c8aefad106aee925b003d96a0a59d0","observation_id":"f0433471-6744-4cde-8e03-160a390f6dfa","resolution":{"observed_at":"2026-08-03T23:33:58.134824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-03T23:33:58.233366Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.233366Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:deb795d765d0a97084a321cd4a1c52932b9f8097066e1449c3f0961ac6f6ecdb","observation_id":"76bcc4f8-8028-46d7-94ba-93e5722eede8","resolution":{"observed_at":"2026-08-03T23:33:58.233366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-03T23:33:58.412745Z","title":"Online normalizer calculation for softmax","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.412745Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:4a9a84b39ec5666e975f64d1f57b84fc4fe91ac586baea63f6109856800f4547","observation_id":"efee2872-8e7c-48b7-a3d9-2e04f4343eb6","resolution":{"observed_at":"2026-08-03T23:33:58.412745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-03T23:33:58.538138Z","title":"Olmoe: Open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.538138Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:994d75961c13b841d15f14b165cdc969cd974c45a579e03c639d8279f0918e6d","observation_id":"8a0768db-e298-4849-bca3-9133dbcbff82","resolution":{"observed_at":"2026-08-03T23:33:58.538138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13711","last_updated":"2022-04-16T20:47:45Z","snapshot_observed_at":"2026-08-02T23:31:06.593557Z","submitted_at":"2021-10-26T14:00:49Z","title":"Hierarchical Transformers Are More Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13711","snapshot_observed_at":"2026-08-03T23:33:58.639384Z","title":"Hierarchical transformers are more efficient language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.639384Z"},"links":{"cited_paper":"/paper/2110.13711","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:fab636077781a17f612317897ee6eb8c13729dc71b6a8d574b3dd701774f1adb","observation_id":"0eb3e795-1ba5-45fe-bed3-4fff3bc1ada8","resolution":{"observed_at":"2026-08-03T23:33:58.639384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09761","last_updated":"2023-05-24T17:32:56Z","snapshot_observed_at":"2026-08-06T06:48:45.920223Z","submitted_at":"2022-11-17T18:39:23Z","title":"Efficient Transformers with Dynamic Token Pooling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09761","snapshot_observed_at":"2026-08-03T23:33:58.766767Z","title":"Efficient transformers with dynamic token pooling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.766767Z"},"links":{"cited_paper":"/paper/2211.09761","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:62905d48d8eb78f5e3763fd0239def373b7d2430d8ac2b31d2fe5e6a4ef6d896","observation_id":"4819815b-cf87-4e23-ac21-f99d3131a3e3","resolution":{"observed_at":"2026-08-03T23:33:58.766767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09636","last_updated":"2024-07-23T17:55:30Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:59:26Z","title":"Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09636","snapshot_observed_at":"2026-08-03T23:33:58.921784Z","title":"Dynamic memory compression: Retrofitting llms for accelerated inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:58.921784Z"},"links":{"cited_paper":"/paper/2403.09636","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:0afcf149edfc4576fb2cbf6f1974239e5c703286609fb44f73835151a1fc8b7c","observation_id":"b6763228-711e-4bcd-8240-3fc1b58fd1d5","resolution":{"observed_at":"2026-08-03T23:33:58.921784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17768","last_updated":"2026-06-22T18:38:34Z","snapshot_observed_at":"2026-08-07T15:59:25.196048Z","submitted_at":"2025-04-24T17:39:25Z","title":"The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17768","snapshot_observed_at":"2026-08-03T23:33:59.082317Z","title":"The sparse frontier: Sparse attention trade-offs in transformer llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.082317Z"},"links":{"cited_paper":"/paper/2504.17768","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:3980d6354a275050a157890dcd6ae8fa818c6afffbf2fa103321cec1cf410657","observation_id":"47d5ac34-31c3-46d8-aad6-586dfe9b5dea","resolution":{"observed_at":"2026-08-03T23:33:59.082317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-07T20:55:15.330079Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-03T23:33:59.230152Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.230152Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:48e5ad204d66f93122f56c9559b95a461ccabcffb6610088b2d066bdd73bc42d","observation_id":"feceae77-34d1-45af-8e80-c03eabab59b4","resolution":{"observed_at":"2026-08-03T23:33:59.230152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-03T23:33:59.340379Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.340379Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:830a535a7f4d2027a2ed104bcf309624b8c759a5f696a32e88367c31973c30e0","observation_id":"73da1e76-a640-4cee-9104-fe5a029dab56","resolution":{"observed_at":"2026-08-03T23:33:59.340379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:59.513639Z","title":"Hierarchical transformers for long document classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.513639Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a6cd51f4087b060b1e19ea7d7e34d2809cf7b1cea554e64624312d25f86a4d85","observation_id":"0c02a50b-e20a-4b05-bfdb-e6b92c29115d","resolution":{"observed_at":"2026-08-03T23:33:59.513639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:59.679673Z","title":"Image transformer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.679673Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:99639635416bdf63152c5ed7553092a5d68f6347e7da5e1d7b945c181f5470a5","observation_id":"86e1cb58-a968-4965-b88e-9374c0b2110a","resolution":{"observed_at":"2026-08-03T23:33:59.679673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:59.847950Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.847950Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:a09c66a51c1f1ab85bc6132df3050b10a1f03648ad6a81d00b60c1ec3e375da3","observation_id":"10255ec1-712d-4dd7-8133-72da4f8dce19","resolution":{"observed_at":"2026-08-03T23:33:59.847950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-03T23:33:59.981988Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:59.981988Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:39cb27691bf716bd53f03ceaa0c1dac46f4c8f31a8f3c4b5f779ab985f5e3d18","observation_id":"bb3bf95e-dfd0-4a3e-9f33-0ab58208b486","resolution":{"observed_at":"2026-08-03T23:33:59.981988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:00.183830Z","title":"Hyena hierarchy: Towards larger convolutional language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.183830Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:dd9c0aa450a6183a8cca0dcd8db9ff912fee3013d6a5bf8c5ed3e49b07fe19d9","observation_id":"8221b64f-0408-4959-90f2-7191a66bc340","resolution":{"observed_at":"2026-08-03T23:34:00.183830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:00.306085Z","title":"Qwen3-next: Towards ultimate training & inference efficiency, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.306085Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:87431781470eed1194a814d981be1b2d7229ddb75a74e2e9d59b3255a4df08c5","observation_id":"47e1585d-1060-4773-af56-61e5cd5886f7","resolution":{"observed_at":"2026-08-03T23:34:00.306085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:00.412422Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.412422Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:7f175201bc9ad4a7f5687fd0d0b0bfae32bd720d1fa8dd7989da01b7cdf7d84e","observation_id":"e2273f60-b621-4d92-b865-eaaa36e7f3d3","resolution":{"observed_at":"2026-08-03T23:34:00.412422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:00.537110Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.537110Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:6cffd0fe8656185dd6ffe6418ff455b11d5ed0cdadfb383c490bab1c8d8d56d7","observation_id":"234d56c0-f7ff-4d5f-ba8e-d3301656faab","resolution":{"observed_at":"2026-08-03T23:34:00.537110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-10T03:45:00.871928Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-03T23:34:00.637989Z","title":"Know what you don't know: Unanswerable questions for squad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.637989Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:bebabc8b5dcb329bd51531e40c06184f9b30d5a1f93fd2193fa853581806a9dd","observation_id":"11fa7bf4-aa49-41ce-8d0a-f56ba3fe0caa","resolution":{"observed_at":"2026-08-03T23:34:00.637989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:00.714474Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.714474Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:8948024645c41f49f331f543389a72c472dbd25c9963f109e41575e49f9e1ea0","observation_id":"6f30815b-300c-4c39-8b6d-3ad0958f855e","resolution":{"observed_at":"2026-08-03T23:34:00.714474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-03T23:34:00.847597Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.847597Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:ee047755ba8dddec0a5cee9151ba26e38a33a8003ad2762ebfdb355901d3b6ce","observation_id":"f5dd56e3-022e-4f4d-bd56-fcb3fc0462cb","resolution":{"observed_at":"2026-08-03T23:34:00.847597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-03T23:34:00.954690Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:00.954690Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:723bc95c3161b9d984f7e6aedb0c78b2f86daf526f46c2b512d8e3d6537f169e","observation_id":"34ea441a-a600-4372-8f3f-69fec8920cae","resolution":{"observed_at":"2026-08-03T23:34:00.954690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:01.058268Z","title":"Spacebyte: Towards deleting tokenization from large language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.058268Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:5e2d8fdd99b22f6f10cfe3e73f0a630f14eed463589f7b669f6ea8bccc2060fe","observation_id":"e5e016b5-ff1a-47ff-801f-87f1ce3c3045","resolution":{"observed_at":"2026-08-03T23:34:01.058268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-03T23:34:01.136033Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.136033Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:85de50fe4e4ccddcc82b2333bc46d374d986e81e7a19c38216c71330702b3386","observation_id":"cf322614-469e-447d-826a-2ea1b609e2e5","resolution":{"observed_at":"2026-08-03T23:34:01.136033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-03T23:34:01.311105Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.311105Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:81621cfe1f60f741ac87a1c44a6728568863c4b77abb83cbd597a37bf554cdbe","observation_id":"2f78c862-f3a3-48f8-8b14-791d1edf10ee","resolution":{"observed_at":"2026-08-03T23:34:01.311105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T23:34:01.405536Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.405536Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:6970484eb42fd27de55781e3daeefea4e3efb75072a6c2fd00b2772e812e095b","observation_id":"6f0f53df-7c87-4a38-b167-3698409b3afa","resolution":{"observed_at":"2026-08-03T23:34:01.405536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:01.628861Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.628861Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:095ee8b378130eb089d12c37658cd68e190625972436a7d58c8c9dc995aea708","observation_id":"95725d55-15aa-43a7-992c-9d7f3df25158","resolution":{"observed_at":"2026-08-03T23:34:01.628861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-03T23:34:01.701947Z","title":"An empirical study of mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.701947Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:08eb1de60a7d8e6cf7c39b8891f0bafbf4477adfa083ae85c187c17971f6bfb7","observation_id":"b4f79500-c358-4059-bb5f-98b746648751","resolution":{"observed_at":"2026-08-03T23:34:01.701947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-06T19:01:34.447479Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-03T23:34:01.832889Z","title":"A systematic analysis of hybrid linear attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.832889Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:b26e4c584ddf211e4e22bd760b2e4a910dd8ed5f9df8eec0e9f36b0a3c512ab3","observation_id":"701d657e-5446-47c6-8977-09b3b9e41f66","resolution":{"observed_at":"2026-08-03T23:34:01.832889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18510","last_updated":"2024-12-06T19:50:34Z","snapshot_observed_at":"2026-08-06T00:21:22.707014Z","submitted_at":"2024-02-28T17:38:06Z","title":"RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18510","snapshot_observed_at":"2026-08-03T23:34:01.985027Z","title":"Rnns are not transformers (yet): The key bottleneck on in-context retrieval, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:01.985027Z"},"links":{"cited_paper":"/paper/2402.18510","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:57474c75100b89118ae32e6baa31aa730456178ec53dbbea2fcb44fc9f243ce2","observation_id":"f8d687bc-a3ce-47d4-ad52-4884142b9fc0","resolution":{"observed_at":"2026-08-03T23:34:01.985027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T23:34:02.066497Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.066497Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:cfc37e758ace9a1ce77c64c62da3cf6af079d9d68ca8ebce8b2c3e6b25b48fc9","observation_id":"a566006c-e113-46b9-8acb-eb055fbf78d1","resolution":{"observed_at":"2026-08-03T23:34:02.066497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:02.202813Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.202813Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:12ae8f8180536ff933f40246877b7819f69190dce604710d083218841c886247","observation_id":"8fca704d-1836-4dbd-a532-7dfdb71489d4","resolution":{"observed_at":"2026-08-03T23:34:02.202813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:02.335542Z","title":"Long-context language modeling with parallel context encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.335542Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:c9cf580f4633955867f5bb2122d219bbb08f4f813ebcb769e2f04187322ae5e9","observation_id":"4fe82a1b-2d77-4d51-90d9-a34c60dfdacd","resolution":{"observed_at":"2026-08-03T23:34:02.335542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:02.500224Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.500224Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:7c73750fcbf28f8ecfec4d8e4e1c4dd13b56c51f87f8533bd2f39eab2edd225e","observation_id":"aa9a0b41-f33c-4c96-b949-0730b1adcf4d","resolution":{"observed_at":"2026-08-03T23:34:02.500224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-03T23:34:02.651609Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.651609Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:9f49e42146da50f93dad0b2b793ddf8c9e6e38dc7641e1a143a465fb127f42f0","observation_id":"6ad72cb6-fabc-4662-910c-855e4f3259d5","resolution":{"observed_at":"2026-08-03T23:34:02.651609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:02.781218Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.781218Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:d7b22308a6d2699c88f0e05f409fb8fcfc65a1f219c1451c0cd97e93f3a3ab1b","observation_id":"d868f5dc-9d09-41bb-8828-910976dee525","resolution":{"observed_at":"2026-08-03T23:34:02.781218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-03T23:34:02.975875Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:02.975875Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:0a46be5ec6564d32a909bd579299f73d1a8793bf83577955a8054169bdc8b692","observation_id":"31f4c21a-6f7e-402e-8f27-c7649ca3f272","resolution":{"observed_at":"2026-08-03T23:34:02.975875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:03.105381Z","title":"Preference learning made easy: Everything should be understood through win rate","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:03.105381Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:5b4a94813295d4b5617ef4a852af71942b23ad24353fd9abf0f9a8684edceb7d","observation_id":"e5772a9c-62cc-4f72-a18a-c57d24330541","resolution":{"observed_at":"2026-08-03T23:34:03.105381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:03.290389Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:03.290389Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:b9fd3c0a6a75cfece5c9c4d4028efa5f1fbbd5102df2fb8fd3af6b33a893401a","observation_id":"f831c6f1-5bb5-4093-9c27-55c64da39b18","resolution":{"observed_at":"2026-08-03T23:34:03.290389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:03.396939Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:03.396939Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:dbe42e221fd41233f0420056d0fc9a0ed02ca84e218edacf6265a7bc4dabef15","observation_id":"18133eed-25a0-4780-94cc-1e1e61e08850","resolution":{"observed_at":"2026-08-03T23:34:03.396939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:03.499389Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:03.499389Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:f55994747310c54a1a25cc1aa5b615fab62110f6948415e17605113837b69bc4","observation_id":"27f6c759-d020-4966-99be-262a53674c00","resolution":{"observed_at":"2026-08-03T23:34:03.499389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:34:03.638787Z","title":"global” chunk embedding. An embedder first compresses each chunk independently, then these “local","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-03T23:34:03.638787Z"},"links":{"citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:714ce293a347067bc43f36db19e37248c25c56a656a624fda424b314a3e9b9db","observation_id":"56c04b40-c098-48b7-9951-b87380d5e5a8","resolution":{"observed_at":"2026-08-03T23:34:03.638787Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2511.05313."}