{"as_of":"2026-08-12T23:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fb86b27f1b9ad6c184230f8e81e9ad2c104d3db51e5653d25cf9c38045377e7","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:16:20.792657Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T03:42:21.307552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:47:48.559145Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"cited_work":{"arxiv_id":"2501.10322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10322","snapshot_observed_at":"2026-07-11T03:47:48.559145Z","title":"Hierarchical autoregressive transformers: Combining byte-\\ and word-level processing for robust, adaptable language models","venue":"cs.CL","work_id":"f1b77678-4225-4a48-aa56-d3168260cf0d","year":2025},"citing_paper":{"arxiv_id":"2605.09630","last_updated":"2026-05-10T16:18:22Z","snapshot_observed_at":"2026-07-31T18:27:32.630942Z","submitted_at":"2026-05-10T16:18:22Z","title":"Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:28.713898Z"},"links":{"cited_paper":"/paper/2501.10322","citing_paper":"/paper/2605.09630"},"observation_digest":"sha256:bf0a3540d585d5deab5a9b9a1d1cc0b6dd96693d583687b95c500f77bbda6391","observation_id":"e2b73c34-d868-473f-b1c9-35637e98a049","resolution":{"observed_at":"2026-05-12T06:36:28.879364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"cited_work":{"arxiv_id":"2501.10322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10322","snapshot_observed_at":"2026-07-11T03:47:48.559145Z","title":"Hierarchical autoregressive transformers: Combining byte-\\ and word-level processing for robust, adaptable language models","venue":"cs.CL","work_id":"f1b77678-4225-4a48-aa56-d3168260cf0d","year":2025},"citing_paper":{"arxiv_id":"2607.05691","last_updated":"2026-07-06T23:16:51Z","snapshot_observed_at":"2026-08-07T16:26:53.142666Z","submitted_at":"2026-07-06T23:16:51Z","title":"Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T03:42:21.307552Z"},"links":{"cited_paper":"/paper/2501.10322","citing_paper":"/paper/2607.05691"},"observation_digest":"sha256:f838e68f144f0a7e96e238597b121cc68c8a0cf75c4b84ba8108d1ae83649b2d","observation_id":"c8705c67-22f6-4b94-8b48-f2e04376b670","resolution":{"observed_at":"2026-07-11T03:47:48.584286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10322/citation-record","integrity":"/paper/2501.10322/integrity","json":"/paper/2501.10322/citation-record.json","paper":"/paper/2501.10322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.525205Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.525205Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:70096e2a8fa6a9b2087a60ce4b09cca4c883f400e00a3a79317027136b13ce46","observation_id":"3de18d85-dfa7-4811-aa6a-c90d5856cd2a","resolution":{"observed_at":"2026-08-10T19:16:20.525205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.findings-emnlp.141","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.073880Z","title":"C har2 S ubword: Extending the subword embedding space using robust character compositionality","venue":null,"work_id":"142587ab-6a4c-48d0-8d5d-29de4441b718","year":2021},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.531884Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:b814cf3cbb38ee5b7170692a1b0cf026143c3f2313608681293138a04b44aa65","observation_id":"cbeb6181-a3c8-489b-9edd-16cc8ea47f3f","resolution":{"observed_at":"2026-08-10T19:16:21.079048Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.537264Z","title":"Character-level language modeling with deeper self-attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.537264Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:b7f7d552e4516b541772107950a617ca8e7ba7e5951d32416dd7a35de549492b","observation_id":"933d638a-7d56-4add-b6e5-84d415df53d7","resolution":{"observed_at":"2026-08-10T19:16:20.537264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.543430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.543430Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:c52de522cf3757daeada4aaabd81ac94c9f9cb5bf95d29dfd2d42ef72245143b","observation_id":"bb07750b-a32c-4997-a03a-f78160021689","resolution":{"observed_at":"2026-08-10T19:16:20.543430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.598512Z","title":"Semantic parsing on F reebase from question-answer pairs","venue":null,"work_id":"89bb3e3d-7148-451a-836f-ada9831c921d","year":2013},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.548554Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:ee198158d2ff31849ce7ac946152c1af7ce2a0b02a7674a114510806c69dfd21","observation_id":"8ece48a5-8ffd-460b-bafa-2bb2cc5d30a1","resolution":{"observed_at":"2026-08-10T19:16:21.604001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.579845Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"5d5d996e-2f91-401d-b0b8-3ef28380a7e9","year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.554031Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:84b11675168fb918e00a91f6b90404f1f78a5b0a2ed44ae69c234cd67cfab8c6","observation_id":"1220c9c1-7765-4959-b42b-3d103c8aa7e6","resolution":{"observed_at":"2026-08-10T19:16:21.585064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.563125Z","title":"Occiglot fineweb v0.5, 2024","venue":null,"work_id":"15f2539f-d64a-4b02-b255-0bbc4d8dd88c","year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.559649Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:3e943b1a3e784b4b69007762466a19e84a2cae4a4965f492499eaafe91631244","observation_id":"414fed55-78ec-4436-92e8-2150c3d30aa3","resolution":{"observed_at":"2026-08-10T19:16:21.567965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10322","last_updated":"2019-08-27T16:53:59Z","snapshot_observed_at":"2026-08-04T09:34:19.963110Z","submitted_at":"2019-08-27T16:53:59Z","title":"Bridging the Gap for Tokenizer-Free Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10322","snapshot_observed_at":"2026-08-10T19:16:20.565344Z","title":"Bridging the gap for tokenizer-free language models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.565344Z"},"links":{"cited_paper":"/paper/1908.10322","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:bbb0edbaa3c6ffa1d01b4f625a4dd52a5242b52770700ca9314067794188461d","observation_id":"c0102fa2-af1d-4228-8664-4be39b1f8aa5","resolution":{"observed_at":"2026-08-10T19:16:20.565344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.570745Z","title":"B ool Q : Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.570745Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:c3947de3d8404ea64bdac3cc63351751a580a504b9d97b53dc45d4e0c353808d","observation_id":"6fe2a8b4-c99a-43ee-a251-0ea9812ca2f9","resolution":{"observed_at":"2026-08-10T19:16:20.570745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.535472Z","title":"Bowman, Holger Schwenk, and Veselin Stoyanov","venue":null,"work_id":"85437747-42a6-4672-9190-f31a2a0fc36b","year":2018},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.581145Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:e64f34eb456d624fb7605f07af59caa301d6a6c1571d7c7b99ce0ea9339a9ef9","observation_id":"e54a72f7-d208-4f53-ba61-ca3ff6cbd064","resolution":{"observed_at":"2026-08-10T19:16:21.540576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.518204Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\' e","venue":null,"work_id":"50b784f5-5617-4aef-bb46-5ff8d4d03106","year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.586757Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:855b48e1009e161f3a119dce3df0a087d380ff9917c14a26d831c280ad9096f2","observation_id":"d9904d11-5bd0-4444-b023-d8eae768ce5a","resolution":{"observed_at":"2026-08-10T19:16:21.523486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19223","last_updated":"2025-01-07T16:20:17Z","snapshot_observed_at":"2026-08-12T23:33:35.526243Z","submitted_at":"2024-06-27T14:49:08Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19223","snapshot_observed_at":"2026-08-10T19:16:20.592713Z","title":"T-FREE: tokenizer-free generative llms via sparse representations for memory-efficient embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.592713Z"},"links":{"cited_paper":"/paper/2406.19223","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:291ff5400f4cd0b015b9264694f2183f58da7bd9ce6cb9eabee6925407a8c399","observation_id":"8a168cc1-d65a-4b9d-aa61-d38ce01d6f32","resolution":{"observed_at":"2026-08-10T19:16:20.592713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.597892Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.597892Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:3006f49a8450355d376d93019a3f33afb4770d1a27f6cd130065a27ea9bcc0ae","observation_id":"782f88d9-861e-4520-b119-60c30e302157","resolution":{"observed_at":"2026-08-10T19:16:20.597892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T19:16:20.602612Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.602612Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:1eb6c22ea75b7884796ba34fe5c6154e649ee0b24409da2abab10daa96e4c4f8","observation_id":"5da89344-4a69-4cd2-823b-bccc91664fb0","resolution":{"observed_at":"2026-08-10T19:16:20.602612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.coling-main.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.027988Z","title":"C haracter BERT : Reconciling ELM o and BERT for word-level open-vocabulary representations from characters","venue":null,"work_id":"3212e921-32ad-4880-a86b-544ded2d44f2","year":2020},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.607848Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:5e17333d6e7b3c8cfe10311640b49504cd2d97521e056270e35ab9ffeb88a472","observation_id":"1b555442-5b81-4784-aa2a-f7b709d46e53","resolution":{"observed_at":"2026-08-10T19:16:21.033923Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.612830Z","title":"A new algorithm for data compression","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.612830Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:2d5cfadf9b91381c66f809fea25e69cc886a17a829b64c88a4e9cfa6b004f9b6","observation_id":"73b683fb-60de-4cce-92ee-48bb9f33c1c8","resolution":{"observed_at":"2026-08-10T19:16:20.612830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.617517Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.617517Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:be2563ead16b88da0db0489dbc806cb76a136f946b259df9cc616939dbf966ba","observation_id":"656f9556-601f-446c-b152-fdca2744171e","resolution":{"observed_at":"2026-08-10T19:16:20.617517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.479445Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":"aa21e557-ea7c-458b-84ce-0eaedc7f4f9a","year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.623085Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:784855f05b1a1915a8a76951f37464040eeeea695ee076ea064a590b9456606f","observation_id":"b78784f5-7632-4cdf-ad9a-b779d1a3f5eb","resolution":{"observed_at":"2026-08-10T19:16:21.485778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.463406Z","title":"Botvinick, Ian Simon, Hannah Sheahan, Neil Zeghidour, Jean - Baptiste Alayrac, Jo \\ a o Carreira, and Jesse H","venue":null,"work_id":"af686e98-8ce6-40ca-8d94-9a73d18891f6","year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.628241Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:4845fe1e1a3ac8391008925b2337979b71b9ccd7470cbaceee080d5987b102dc","observation_id":"d9eca35e-c863-4917-81db-3df6e9cd72de","resolution":{"observed_at":"2026-08-10T19:16:21.468811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00220","last_updated":"2022-11-29T08:59:40Z","snapshot_observed_at":"2026-08-01T16:28:46.947101Z","submitted_at":"2022-07-01T06:25:15Z","title":"Pile of Law: Learning Responsible Data Filtering from the Law and a 256GB Open-Source Legal Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00220","snapshot_observed_at":"2026-08-10T19:16:20.633112Z","title":"Krass, Lucia Zheng, Neel Guha, Christopher D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.633112Z"},"links":{"cited_paper":"/paper/2207.00220","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:9380cb0232fc91c0732e5efe0017764dbf7b14edd33ba5db35765c8b23f16f7d","observation_id":"6f10e283-7a25-418f-b2b8-b3659d8ce36a","resolution":{"observed_at":"2026-08-10T19:16:20.633112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.638405Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.638405Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:c67d4f6de23274ea8e63b1e1769004bde86690e1f6694df43126cf007a741093","observation_id":"93bdbdc7-51e1-44f8-a080-af2eab71825a","resolution":{"observed_at":"2026-08-10T19:16:20.638405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.643281Z","title":"T rivia QA : A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.643281Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:9c4a7025b2c677fd82e84b77f2d16bb0fe07bbc624e642096372f5b4db130b49","observation_id":"88d0a68e-a3a3-4cf2-8383-2381420f2759","resolution":{"observed_at":"2026-08-10T19:16:20.643281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-10T19:16:20.648279Z","title":"Pratt, Sunny Sanyal, Gabriel Ilharco, Giannis Daras, Kalyani Marathe, Aaron Gokaslan, Jieyu Zhang, Khyathi Raghavi Chandu, Thao Nguyen, Igor Vasiljevic, Sham M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.648279Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:2a975834396562cb2b76d90a204197def7437324617b260ba2aaa95922650952","observation_id":"be429736-ed51-4512-9f19-57a2ea1d3b50","resolution":{"observed_at":"2026-08-10T19:16:20.648279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.436653Z","title":"Hashimoto","venue":null,"work_id":"3772fba0-9dc8-46c1-90f7-bc3bc8030deb","year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.653654Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:b5085b3caa5cfe7f72fd9bcadbeeadc618b9c3f06d123b4dfe1f80d680ae3023","observation_id":"660921d5-e930-4439-9f8b-10154c24dde9","resolution":{"observed_at":"2026-08-10T19:16:21.441723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.658426Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.658426Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:0e0fa0d2eb5385bbd48d06aaccecb8af3d52a56b3caf029f4bc5ceff3fcabaeb","observation_id":"8933bb48-3fbe-4f11-8f7c-4ef8681aafba","resolution":{"observed_at":"2026-08-10T19:16:20.658426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.663439Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.663439Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:4bc8f48eaab77da1bfd803b2fb2a0be7b5a7152b70c27cd2e84745b206184df4","observation_id":"7ecbde2d-a12a-4623-81e2-61804aaee209","resolution":{"observed_at":"2026-08-10T19:16:20.663439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.668608Z","title":"C har BERT : Character-aware pre-trained language model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.668608Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:d9c50bda1070be754600c9934a2d67aa4c24fa9d4892a158d5222c9e5fcbf16f","observation_id":"2fa6d751-0c1e-498a-89de-b04d24e64ae2","resolution":{"observed_at":"2026-08-10T19:16:20.668608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-10T19:16:20.673355Z","title":"Between words and characters: A brief history of open-vocabulary modeling and tokenization in nlp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.673355Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:6d8f512bde241f390ad20ae3687703b18bcc62e026987422cdfab515631c330f","observation_id":"96634558-8a12-4a1e-883d-2375d3d142b5","resolution":{"observed_at":"2026-08-10T19:16:20.673355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.678410Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.678410Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:f9859087990e1923ce83fa5286d90db2e9ae4647ec0888f0ec1d1ce8cad4308b","observation_id":"fbac2ce3-d16b-4cb6-a7e4-e25169452ad4","resolution":{"observed_at":"2026-08-10T19:16:20.678410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.407645Z","title":"Mmmlu, 2024","venue":null,"work_id":"6569413d-5020-4e89-bbae-4c6f98bc52c4","year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.684951Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:11061cc0f325a013d8156c1ef3dbf28b757bd8419c1aef236b0046e628a602f4","observation_id":"a7114735-6bee-4cc9-a853-5bd59a842d07","resolution":{"observed_at":"2026-08-10T19:16:21.413125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.689907Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.689907Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:8372f3bfbfe3a1db97aac192f486db09d52e916b498f788a68610c7798da1300","observation_id":"fb4d1ed9-bada-4e93-8008-4a8e2c546bca","resolution":{"observed_at":"2026-08-10T19:16:20.689907Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.695245Z","title":"Openwebmath: An open dataset of high-quality mathematical web text, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.695245Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:03bb802c925dbaa90a3666e2217b2b09e155d317866438396d72ee80d07b393b","observation_id":"4920c0d1-870a-4343-9e07-a1ec82e2e7b6","resolution":{"observed_at":"2026-08-10T19:16:20.695245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-10T19:16:20.700411Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.700411Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:e8565bae4e2c2267564ea1a9afdfefe63ff57d7bdbdceb1b6bb4331b8961de00","observation_id":"0f524630-137f-4cae-ad5c-b0dfdde3b122","resolution":{"observed_at":"2026-08-10T19:16:20.700411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.378545Z","title":"Language model tokenizers introduce unfairness between languages","venue":null,"work_id":"13a4ce35-7c2b-4061-9006-8cde45feac20","year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.705646Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:27cffd7e08e9d98ed03b69a2b7be9f63838ac451183d444888f7a20239cb78e2","observation_id":"b122c748-f7d3-4765-b9f1-722e781c350d","resolution":{"observed_at":"2026-08-10T19:16:21.384278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.711185Z","title":"W i C : the word-in-context dataset for evaluating context-sensitive meaning representations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.711185Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:8c138024c9e4e985c1e209b462ca5f1767df636615abc42400996f410edc755c","observation_id":"0087ec6c-2aa5-4ee4-9ba8-bd65f7aed6bc","resolution":{"observed_at":"2026-08-10T19:16:20.711185Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.362085Z","title":"Germanbenchmark, 2024","venue":null,"work_id":"6c90e760-40d5-4908-b177-0ae752be8531","year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.716273Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:70a5a31210785f5ec2e27d36414ded6cad2113de34abd0d25e21efe844b256b3","observation_id":"336de9ed-8e9f-4f7a-8c1e-2ee9afbacf21","resolution":{"observed_at":"2026-08-10T19:16:21.367231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.345909Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"338cecdc-528c-4085-bf22-52dd52c26bfb","year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.721304Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:8b77e992c9b5988c7efe3b0b084162860b7ab0b8e08e923f191de66246524af9","observation_id":"38759c8e-ccbc-435a-aa92-a26b40a9f5cc","resolution":{"observed_at":"2026-08-10T19:16:21.351227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.726054Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.726054Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:793d956be13f70f4e395cf07933d06ab189d16e891894b0af94bcab357f326e7","observation_id":"169d0db1-22b1-4897-958f-6eeaf8fe2c05","resolution":{"observed_at":"2026-08-10T19:16:20.726054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.730719Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.730719Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:63b004e4a3de03cb50d6103ee673e951758b272804b58e312a44a22ac9fa3fb3","observation_id":"aa5f9226-e877-49ac-b01d-6c3740db7e4c","resolution":{"observed_at":"2026-08-10T19:16:20.730719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14408","last_updated":"2024-10-06T02:17:26Z","snapshot_observed_at":"2026-08-09T10:53:12.514568Z","submitted_at":"2024-04-22T17:59:29Z","title":"SpaceByte: Towards Deleting Tokenization from Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14408","snapshot_observed_at":"2026-08-10T19:16:20.735877Z","title":"Spacebyte: Towards deleting tokenization from large language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.735877Z"},"links":{"cited_paper":"/paper/2404.14408","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:4b3c867094086f11ec601f5b076d775e0d171847bab23db92e5b197e886cb15e","observation_id":"20926a3b-0f62-45e6-a6f7-e97a45f61b93","resolution":{"observed_at":"2026-08-10T19:16:20.735877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.200","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.881390Z","title":"From characters to words: Hierarchical pre-trained language model for open-vocabulary language understanding","venue":null,"work_id":"b0bb5c30-97f8-4b1c-ba72-dc9a872484bf","year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.741445Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:081c5c6457b3d2e808317f79846138ab38392f2c2d45c8e504dfb499267311fa","observation_id":"b4a657ca-7ccf-4c2b-b7eb-eefefbfce51c","resolution":{"observed_at":"2026-08-10T19:16:20.888678Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.328481Z","title":"Tran, Sebastian Ruder, Jai Prakash Gupta, Hyung Won Chung, Dara Bahri, Zhen Qin, Simon Baumgartner, Cong Yu, and Donald Metzler","venue":null,"work_id":"b70f9f7a-ea6c-49fe-a8c3-45c4cbd91570","year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.746281Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:f33378b27d9e7e25e087b432c7e24c5c54db670a69f98fd43845dfab307328b6","observation_id":"3afa7e17-d33e-4208-9623-f0e9d23d5e58","resolution":{"observed_at":"2026-08-10T19:16:21.334501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.751455Z","title":"Learn your tokens: Word-pooled tokenization for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.751455Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:98300e49adeb7b4a64dfc0f7ce907aaf5cbbc0667fa607e048aa6f61a7136e78","observation_id":"e6ffb928-35e1-4086-96e2-56637c7195a6","resolution":{"observed_at":"2026-08-10T19:16:20.751455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T19:16:20.756271Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.756271Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:49c513258f9d4378e46a45c4be907de3ca40c452f78a8791cf38fc242954ae60","observation_id":"878598da-bec5-4c1e-8e7e-89b674f45275","resolution":{"observed_at":"2026-08-10T19:16:20.756271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.761511Z","title":"Skywork: A more open bilingual foundation model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.761511Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:5059e5daf77020ccfc739955982d3a420d4126408632effdfc70db3c558b7713","observation_id":"f7d60f3f-f0d0-4a13-9bd3-73083189e0f4","resolution":{"observed_at":"2026-08-10T19:16:20.761511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.766254Z","title":"B y T 5: Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.766254Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:780924a0e2a3cc9e9a7e3a51deee553675d2e8b4cd3540c376da2b5027e713e0","observation_id":"937b5811-b6f4-445d-ba3f-d3069313addb","resolution":{"observed_at":"2026-08-10T19:16:20.766254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:21.300237Z","title":"MEGABYTE: predicting million-byte sequences with multiscale transformers","venue":null,"work_id":"bd0cb85d-11f5-4be4-9ac0-45ef09cb9738","year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.771088Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:6bb430a6d8c3e26c3178fb81160ee50f0454de4d91047a885a6970cbe11a0558","observation_id":"f5ac978a-6974-4c1c-aac0-18890fd35edd","resolution":{"observed_at":"2026-08-10T19:16:21.306409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.775743Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.775743Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:1d505db764001e61d6fcadafe740d9af23c97fdc56fddb95322e4fc461753898","observation_id":"a9035346-a518-4497-9d04-4106f6631988","resolution":{"observed_at":"2026-08-10T19:16:20.775743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.781482Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.781482Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:215b39feab68d83527c3e50dc89a4a1652e37ef6fac6362af234aee3d6c46fbe","observation_id":"d8770478-1b87-44cb-9c73-05f7bd567182","resolution":{"observed_at":"2026-08-10T19:16:20.781482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:16:20.786674Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.786674Z"},"links":{"citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:21e1e44c914571931016b4bdabea15cf0908e6f7c553c3638b4b2534102ff42a","observation_id":"f090c69b-7d44-49b4-9c00-dfd4e5a5f5d7","resolution":{"observed_at":"2026-08-10T19:16:20.786674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T19:16:20.792657Z","title":"From Characters to Words: Hierarchical Pre-trained Language Model for Open-vocabulary Language Understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T19:16:20.792657Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.10322"},"observation_digest":"sha256:1d59f4c39fbffe7b251ea593904c968518a10f0554a64067385223573880497f","observation_id":"1ce16206-2216-4b9e-9bdd-b8a2ac8537d4","resolution":{"observed_at":"2026-08-10T19:16:20.792657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10322","last_updated":"2025-01-20T09:33:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T19:10:16.784019Z","submitted_at":"2025-01-17T17:51:53Z","title":"Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":3,"verified_fuzzy":14},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2501.10322."}