{"as_of":"2026-08-14T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b100822dc8be68fed66ff28d4a16d63181fbf4133349eb8835ec936d319138c","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:46:08.884591Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09093/citation-record","integrity":"/paper/2608.09093/integrity","json":"/paper/2608.09093/citation-record.json","paper":"/paper/2608.09093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.516340Z","title":"OLMo-core: src/scripts/official/OLMo3/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.516340Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:eb03ab8645068184720ad192cc26035ab87a7216a3e47500686362da38ec012c","observation_id":"7d80d665-7783-47b8-b398-985c485bc325","resolution":{"observed_at":"2026-08-11T23:46:08.516340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14316","last_updated":"2024-07-16T10:22:51Z","snapshot_observed_at":"2026-08-13T10:05:19.974160Z","submitted_at":"2023-09-25T17:37:20Z","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14316","snapshot_observed_at":"2026-08-11T23:46:08.520788Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction.arXiv preprint arXiv:2309.14316, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.520788Z"},"links":{"cited_paper":"/paper/2309.14316","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f41d896fa6a003c0618811f4758ef729017c769513a9fd6fbc7e02ac073b803a","observation_id":"7b1702d0-a405-4401-b8c6-294d43e24ab5","resolution":{"observed_at":"2026-08-11T23:46:08.520788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.525122Z","title":"Altmann, Giampaolo Cristadoro, and Mirko Degli Esposti","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.525122Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ebd26999b783e37fd7aee5af1e487e3ba791dca104695a9205c799746ea06fdf","observation_id":"08c41e25-757f-40c0-b855-2fd6185ed4d1","resolution":{"observed_at":"2026-08-11T23:46:08.525122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.529259Z","title":"Álvarez-Lacalle, B","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.529259Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b2d7471066e1f9e36a6a5174359fa11d0bd4a200292434d2bcbc1a8a8e4872d4","observation_id":"2ca7b3bd-3eec-4f70-879a-c680a63efbe1","resolution":{"observed_at":"2026-08-11T23:46:08.529259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16893","last_updated":"2026-07-05T02:34:16Z","snapshot_observed_at":"2026-08-10T05:00:54.764769Z","submitted_at":"2025-11-21T02:17:01Z","title":"Predicting the Emergence of Induction Heads in Language Model Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16893","snapshot_observed_at":"2026-08-11T23:46:08.533454Z","title":"Predicting the emergence of induction heads in language model pretraining.arXiv preprint arXiv:2511.16893v3, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.533454Z"},"links":{"cited_paper":"/paper/2511.16893","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:d669267481728888c6eb62795bb2b9cb1798a703eb2c49a153a6db3c88b4935c","observation_id":"a7e1a1d5-c899-4e67-8e42-2ff258354cfc","resolution":{"observed_at":"2026-08-11T23:46:08.533454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09869","last_updated":"2024-12-09T09:20:54Z","snapshot_observed_at":"2026-08-12T23:01:33.671101Z","submitted_at":"2024-08-19T10:20:06Z","title":"Docling Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09869","snapshot_observed_at":"2026-08-11T23:46:08.537942Z","title":"Docling technical report.arXiv preprint arXiv:2408.09869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.537942Z"},"links":{"cited_paper":"/paper/2408.09869","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5e8264f4e92444aebc0bcfd050eefb55052bcec2f89ebcda49953eced0683cf6","observation_id":"4b526753-8d16-4b72-9684-f05e771197f8","resolution":{"observed_at":"2026-08-11T23:46:08.537942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11499","last_updated":"2026-06-09T22:44:47Z","snapshot_observed_at":"2026-08-13T14:10:23.874785Z","submitted_at":"2026-06-09T22:44:47Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","version":1},"cited_work":{"arxiv_id":"2606.11499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11499","snapshot_observed_at":"2026-08-11T23:46:09.984166Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","venue":"cs.CL","work_id":"846d0c43-1d1a-4a5a-857f-9ef84baf16c6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.542506Z"},"links":{"cited_paper":"/paper/2606.11499","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:920cfe8cd4b99936f0241dfcf9a8cbf63d1b5b33682381cebbf33cf25db56e1d","observation_id":"3ee3c7b5-e28b-4441-98da-1e15113f6aae","resolution":{"observed_at":"2026-08-11T23:46:09.988195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13006","last_updated":"2026-04-27T17:56:40Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:40:01Z","title":"One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness","version":2},"cited_work":{"arxiv_id":"2604.13006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13006","snapshot_observed_at":"2026-08-11T23:46:09.967851Z","title":"One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness","venue":"cs.CL","work_id":"9a12705f-07fc-4306-a299-7f6d1f9d5d9d","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.546573Z"},"links":{"cited_paper":"/paper/2604.13006","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f4c57a6380342763398507026bfe70d0fa4c7473b47b51999907597519aaf92f","observation_id":"281a80ca-56a9-4770-bf0d-cf4a8498a064","resolution":{"observed_at":"2026-08-11T23:46:09.972459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.550671Z","title":"trafilatura: trafilatura/xml.py","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.550671Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:1ae52640a733c983aca59e2f261184781f7356159541d04410db57ab285d7b20","observation_id":"41bcf5ad-13c7-433a-a79e-24192c9b15cb","resolution":{"observed_at":"2026-08-11T23:46:08.550671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.554957Z","title":"so much depends / upon / a whitespace: Why whitespace matters for poets and LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.554957Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6aafbf18bf5b49892c63ce691bbe8da30e9690264893f501193eee0b91bb1d57","observation_id":"fe866f33-5d83-4152-a709-23cb068733a7","resolution":{"observed_at":"2026-08-11T23:46:08.554957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07311","last_updated":"2022-01-13T23:45:24Z","snapshot_observed_at":"2026-08-13T16:59:27.224776Z","submitted_at":"2022-01-13T23:45:24Z","title":"Datasheet for the Pile","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07311","snapshot_observed_at":"2026-08-11T23:46:08.558757Z","title":"Datasheet for the Pile.arXiv preprint arXiv:2201.07311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.558757Z"},"links":{"cited_paper":"/paper/2201.07311","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c88bf02a6bb20288b9bdc6960267ca70e0f3782f4f0859df5800311b79ff5d31","observation_id":"2f9d920d-da0f-464f-9bd6-bbb8cda7e9ab","resolution":{"observed_at":"2026-08-11T23:46:08.558757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.562683Z","title":"Document structure in long document transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.562683Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:14191d09cbda0e983bac57ba3b643f2116560e9e1663ac3a2ee258916c77d198","observation_id":"f461e1e9-fc02-44e2-8ec1-199119b99b6c","resolution":{"observed_at":"2026-08-11T23:46:08.562683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08300","last_updated":"2025-06-10T00:11:30Z","snapshot_observed_at":"2026-08-13T20:55:27.716348Z","submitted_at":"2025-06-10T00:11:30Z","title":"Institutional Books 1.0: A 242B token dataset from Harvard Library's collections, refined for accuracy and usability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08300","snapshot_observed_at":"2026-08-11T23:46:08.566283Z","title":"Institutional books 1.0: A 242B token dataset from Harvard Library’s collections, refined for accuracy and usability.arXiv preprint arXiv:2506.08300, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.566283Z"},"links":{"cited_paper":"/paper/2506.08300","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6fb704782d759dc7a308691d8491eba61dcef70e8d873647e1a74941b9f45260","observation_id":"8de5518a-bc11-4239-b640-0938ff3c83a7","resolution":{"observed_at":"2026-08-11T23:46:08.566283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.570096Z","title":"The hyperfitting phenomenon: Sharpening and stabilizing LLMs for open-ended text generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.570096Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ba8838e8f55c7361b099ef15eca9c3b49fab609d77abf16078081dcbff80be74","observation_id":"43aa3385-dc1c-4f16-b758-417d27f747bb","resolution":{"observed_at":"2026-08-11T23:46:08.570096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.573675Z","title":"LADM: Long-context training data selection with attention-based dependency measurement for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.573675Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:9a58ff73dfa819d50e5a3bbfc167247f0e0e0efa365eafa4470b07125b14b487","observation_id":"156cc986-1daa-496c-8fe1-8c5cc669b1fc","resolution":{"observed_at":"2026-08-11T23:46:08.573675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.16246","last_updated":"2026-06-19T17:02:20Z","snapshot_observed_at":"2026-08-03T18:12:06.699075Z","submitted_at":"2026-06-15T05:48:57Z","title":"Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining","version":2},"cited_work":{"arxiv_id":"2606.16246","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16246","snapshot_observed_at":"2026-08-11T23:46:09.930199Z","title":"Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining","venue":"cs.LG","work_id":"f624b4b4-a8f5-4db2-89ae-319e04006d81","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.577429Z"},"links":{"cited_paper":"/paper/2606.16246","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:bbd26efa53a2737a3c6c67fca1c7d798fcf6d8c6973cd94f3786d7af7d91e693","observation_id":"4d1abd8a-90fd-4fb2-a152-b747d8e0faf0","resolution":{"observed_at":"2026-08-11T23:46:09.934456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.581164Z","title":"Data mixing for large language models pretraining: A survey and outlook.Data Intelligence, 8, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.581164Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:1f56b114150f5f9d5b58eeb83d1f6ee1bd72f525b42f89c1a3e2979e17c22f39","observation_id":"d160b479-63d7-48c9-9ddb-34bcb237ebf9","resolution":{"observed_at":"2026-08-11T23:46:08.581164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10975","last_updated":"2025-08-19T17:56:36Z","snapshot_observed_at":"2026-08-11T22:11:30.788526Z","submitted_at":"2025-08-14T17:55:47Z","title":"BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10975","snapshot_observed_at":"2026-08-11T23:46:08.585204Z","title":"BeyondWeb: Lessons from scaling synthetic data for trillion-scale pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.585204Z"},"links":{"cited_paper":"/paper/2508.10975","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2a23c0221d65e2410ac627bab76b4058a7e0a09170f0e2f5dfeb4eb235787506","observation_id":"1e9d02fe-702a-4a6d-9bd9-36f582b86f14","resolution":{"observed_at":"2026-08-11T23:46:08.585204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-11T23:46:08.589022Z","title":"DeepSeek-V3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.589022Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:17a3c7d2beba11077e3a00044ca397738a17aae1b31ebab6cebff841b1316f38","observation_id":"0027d995-38f6-4114-be5c-b034cb9789c5","resolution":{"observed_at":"2026-08-11T23:46:08.589022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.592974Z","title":"Beyond length: Quantifying long-range information for long-context LLM pretraining data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.592974Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7e388e3d1537b1bbcc762f0b29bf5e13955e2fbf054f309f00750b86fd319e58","observation_id":"d17b519e-7057-4453-a0ee-27e1357acfee","resolution":{"observed_at":"2026-08-11T23:46:08.592974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.596787Z","title":"Documenting large webtext corpora: A case study on the Colossal Clean Crawled Corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.596787Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:097b32c57d068e8449b330acb6cf9a5c83da1ca96585f74c39164a76c94f0255","observation_id":"dc48d7d6-ec33-42c2-a612-f06bfed0e0b9","resolution":{"observed_at":"2026-08-11T23:46:08.596787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.600442Z","title":"Smith, and Jesse Dodge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.600442Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:bd96a7dc4a8831c4b4b106484b765d1dfc035c134f3c1fa82fe30ee914d0f6dd","observation_id":"60dba6c3-a6b3-4fb0-b134-fa4678e33448","resolution":{"observed_at":"2026-08-11T23:46:08.600442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-13T05:42:40.085088Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-11T23:46:08.603929Z","title":"DoGE:Domainreweightingwithgeneralization estimation.arXiv preprint arXiv:2310.15393, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.603929Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:778db00144695b1aafa222c24c0787e9d8d2dc2f1b6979e876d5adf2c1b146e9","observation_id":"2f086de1-d48e-434e-9b24-b4b1eb57ce2e","resolution":{"observed_at":"2026-08-11T23:46:08.603929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27006","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.880313Z","title":null,"venue":null,"work_id":"ab44df4f-3e26-4c62-abdc-c4cea340a016","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.607893Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6e5d274c28714c8d54ed145eebc55a8bbd963544e70c447c61183809ccdb64e9","observation_id":"a3e7197c-7b1b-46bc-a46d-1c4d09f3ff21","resolution":{"observed_at":"2026-08-11T23:46:09.886029Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.611346Z","title":"NExtLong: Toward effective long-context training without long documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.611346Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6a19293bf36b7f452c3e214c35616580e017060cc9dbcdf39fa01d5b081b1657","observation_id":"3e9aba69-4f7d-463e-95a0-eb3bf5b0e4bf","resolution":{"observed_at":"2026-08-11T23:46:08.611346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T23:46:08.615026Z","title":"The Pile: An 800GB dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.615026Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f1986d2efddac58c2cf2725fc3c42b2b26a945cada2fd493f91d6f10669195e5","observation_id":"780f5689-7f57-44f5-ba34-548b09c5bf5b","resolution":{"observed_at":"2026-08-11T23:46:08.615026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.618858Z","title":"Wichmann","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.618858Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:dee5fd9743b1f2d591d8f938deb70fa281890ce9933adb3375cfc5450e7c5a4b","observation_id":"752ff431-3dd6-4c6f-a132-661c6eab5275","resolution":{"observed_at":"2026-08-11T23:46:08.618858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.622436Z","title":"Hermann, Hossein Mobahi, Thomas Fel, and Michael C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.622436Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6c03dc766e9ced2369b3067c9ba689d149aa6b74ed877a2b10a0670377416a26","observation_id":"fbbda0e3-3cdd-4758-98c2-c72dd6e775a1","resolution":{"observed_at":"2026-08-11T23:46:08.622436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.626015Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.626015Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:119fa90781c6771393f1ac6a5e7babea744610167cc2c1461528348f15c2263b","observation_id":"b64d7edb-c0ac-44e5-85ea-1cc7665e7609","resolution":{"observed_at":"2026-08-11T23:46:08.626015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.629298Z","title":"FinePDFs dataset card.https://huggingface.co/datasets/HuggingFaceFW/ finepdfs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.629298Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ecfb2f9ed53843da5fa31a3efceb95bc4b42644e0a389cd8e859ba3290c4cf17","observation_id":"aa679acf-0007-439e-b231-fad4420d4a08","resolution":{"observed_at":"2026-08-11T23:46:08.629298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.632840Z","title":"SmolLM3: smol, multilingual, long-context reasoner.https://huggingface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.632840Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:7be1a28fd72803100319c39b7ff6e7471131ef7e312d84830254c59dada5499b","observation_id":"3c955657-891e-4f49-84d4-8db2aa5e1140","resolution":{"observed_at":"2026-08-11T23:46:08.632840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.636370Z","title":"datatrove: src/datatrove/pipeline/extractors/trafilatura.py","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.636370Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:a08c2790492c472cdf2f267b71f057e2074526bee8619e90e6a7f0f5df58b507","observation_id":"862abf38-3a6a-40c5-93b0-a12c7dca6b4e","resolution":{"observed_at":"2026-08-11T23:46:08.636370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12414","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.791863Z","title":"propella-1: Multi- property document annotation for LLM data curation at scale.arXiv preprint arXiv:2602.12414,","venue":null,"work_id":"e801ee49-3a69-4c5b-adcd-a70c99b1a988","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.640149Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e51d988660e26b7ae2e0072c4f8366f192c20cf789667d56ee0df6d15280a121","observation_id":"26f2f108-79da-4d13-9933-880d8f48d324","resolution":{"observed_at":"2026-08-11T23:46:09.797822Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.368685Z","title":"ISO 32000-1:2008 — document management: Portable document format — part 1: PDF 1.7.https://www.iso.org/standard/51502.html, 2008","venue":null,"work_id":"c6040e7f-4b67-4aac-ad8e-99d4ff5a13c1","year":2008},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.648169Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:cd7e515b50b45e036df42301389c05fb3c55ca4cd65821d97074a549e89e966e","observation_id":"8fd8c20a-b9e8-4d63-8eb5-69148ae621eb","resolution":{"observed_at":"2026-08-11T23:46:10.372740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.651907Z","title":"EntropyLong: Effective long-context training via predictive uncertainty.arXiv preprint arXiv:2510.02330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.651907Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:59d056eebe7e0ffb866c1621436e32f02b7790493e35f6d1e0b156bdc06384b0","observation_id":"20791109-1ad6-4676-8a88-0b2e79946650","resolution":{"observed_at":"2026-08-11T23:46:08.651907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19468","last_updated":"2026-06-17T18:03:34Z","snapshot_observed_at":"2026-08-12T18:27:38.677169Z","submitted_at":"2026-06-17T18:03:34Z","title":"Characterizing Narrative Content in Web-scale LLM Pretraining Data","version":1},"cited_work":{"arxiv_id":"2606.19468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.19468","snapshot_observed_at":"2026-08-11T23:46:09.646354Z","title":"Characterizing Narrative Content in Web-scale LLM Pretraining Data","venue":"cs.CL","work_id":"2960f08a-aa29-47af-bb6b-19b9769e1607","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.655949Z"},"links":{"cited_paper":"/paper/2606.19468","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c67c5c1d53e3372fe5f54cfe55cb45c5b93da63a827a3476ecf16c9872f018b5","observation_id":"8d9332d1-f141-423a-b1ca-9e2f33cbea40","resolution":{"observed_at":"2026-08-11T23:46:09.650579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05209","snapshot_observed_at":"2026-08-11T23:46:08.659888Z","title":"Feder Cooper, Aviya Skowron, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.659888Z"},"links":{"cited_paper":"/paper/2506.05209","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:d453d6f4a5e66cb01cd88494a998962c64354e47fc2d5fafaeeb17fc2d52986d","observation_id":"b3db8665-93de-423c-ab03-44d3c2ed960e","resolution":{"observed_at":"2026-08-11T23:46:08.659888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15096","last_updated":"2025-08-20T22:16:57Z","snapshot_observed_at":"2026-08-05T18:08:02.752427Z","submitted_at":"2025-08-20T22:16:57Z","title":"Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15096","snapshot_observed_at":"2026-08-11T23:46:08.663478Z","title":"Nemotron-CC-Math: A 133 billion-token-scale high quality math pretraining dataset.arXiv preprint arXiv:2508.15096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.663478Z"},"links":{"cited_paper":"/paper/2508.15096","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6c4c6ef18cea414b8a169e0745bd5d4cc83922910b189b703df9dcf18c09a1ca","observation_id":"8770db68-bc35-41c0-a8bd-1816e6f2bbc5","resolution":{"observed_at":"2026-08-11T23:46:08.663478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.357430Z","title":"Is a document educational or just Wikipedia- style? pitfalls of classifier-based quality filtering","venue":null,"work_id":"9cad92f8-f1e3-46bb-8976-62090f6455db","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.667449Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:cdb598d5282f3d8af34ee429953780a72687a0c1dec004215119668667fda886","observation_id":"063ebcf7-a380-4951-96a6-57115306b83a","resolution":{"observed_at":"2026-08-11T23:46:10.361337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.345830Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets.Transactions of the Association for Computational Linguistics, 10:50–72, 2022","venue":null,"work_id":"e699aff7-a2cb-4887-b3f1-4f8b0b071d57","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.670936Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e5135d685599c3ca25ea44140968e82526df5bdbdccccafa13373da02c31d642","observation_id":"0898c310-284c-4ae5-a459-5fe06675fb02","resolution":{"observed_at":"2026-08-11T23:46:10.349832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03616","last_updated":"2026-04-04T07:16:28Z","snapshot_observed_at":"2026-08-13T23:01:26.336964Z","submitted_at":"2026-04-04T07:16:28Z","title":"The Format Tax","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03616","snapshot_observed_at":"2026-08-11T23:46:08.674823Z","title":"The format tax.arXiv preprint arXiv:2604.03616, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.674823Z"},"links":{"cited_paper":"/paper/2604.03616","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2b3736587be804d4b51315bc512f42c1548dc42f6f86b3c9b69eea12962ee18a","observation_id":"f27ed3ec-bb4c-46b4-ae4d-2a9b886c6118","resolution":{"observed_at":"2026-08-11T23:46:08.674823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.334990Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":null,"work_id":"d7fb10c7-b230-4430-9ae4-2e9cfeb9db00","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.678804Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f8026e4e077559ea793ec11f515e5af197bf41e3d8940ea0d05c9492492baf88","observation_id":"04a49aa9-d9a4-4fad-9e93-22da0bd35bbf","resolution":{"observed_at":"2026-08-11T23:46:10.338832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.324475Z","title":null,"venue":null,"work_id":"8abbaabe-6391-4127-9955-0ddb63dded93","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.682276Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b1cc6990399dee6fa00d396cab763a52cae4dbd10318b501fbb28116d465cdb1","observation_id":"aa88155a-04b1-45bd-afa0-d5877de7cee9","resolution":{"observed_at":"2026-08-11T23:46:10.328421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27878","last_updated":"2026-05-27T02:55:34Z","snapshot_observed_at":"2026-08-12T22:04:47.149824Z","submitted_at":"2026-05-27T02:55:34Z","title":"Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction","version":1},"cited_work":{"arxiv_id":"2605.27878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27878","snapshot_observed_at":"2026-08-11T23:46:09.600967Z","title":"Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction","venue":"cs.CL","work_id":"62e3deb6-ba5e-4547-9d49-8198063c63c6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.689681Z"},"links":{"cited_paper":"/paper/2605.27878","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e8994e4b0b1df156c4efb475b41fd08a7b4107b2db61bb2fa8979f2dd38a43bf","observation_id":"6aa3bdc4-83d8-4685-9b83-2bf562688710","resolution":{"observed_at":"2026-08-11T23:46:09.604854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.313376Z","title":"URLhttps://aclanthology.org/2026","venue":null,"work_id":"e6165d1f-73a3-4ee5-bbbe-5afabc823874","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.685954Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:fea912aa94905c7410b577b8731b81f62d3f313a69b6b251eb215426f39ce073","observation_id":"401910f7-8ab2-4722-a830-9af0d7ee73e4","resolution":{"observed_at":"2026-08-11T23:46:10.317293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11643","last_updated":"2026-06-10T04:07:41Z","snapshot_observed_at":"2026-08-13T04:42:19.291169Z","submitted_at":"2026-06-10T04:07:41Z","title":"Improving Cross-Format Robustness in Language Models with Multi-Format Training","version":1},"cited_work":{"arxiv_id":"2606.11643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11643","snapshot_observed_at":"2026-08-11T23:46:09.583748Z","title":"Improving Cross-Format Robustness in Language Models with Multi-Format Training","venue":"cs.CL","work_id":"515edace-2b0a-4f3f-936b-a5e40a8e3488","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.697003Z"},"links":{"cited_paper":"/paper/2606.11643","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2895b26eae60c81008f43c5ea5e5cbdeab16c375091413b5f1f92e2b241845fc","observation_id":"961851e4-9ba4-43ca-8d08-4eca71cb8af8","resolution":{"observed_at":"2026-08-11T23:46:09.589660Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.303297Z","title":"Lin and Max Tegmark","venue":null,"work_id":"4d28feb0-4892-4a6e-8284-eb8c7e924788","year":2017},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.693474Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:4710bbb3b8883e78b7f1406c2c4f9e818d1e714b77166a59326dc6686b6c3147","observation_id":"25f795c0-df9c-40f4-9f66-2c55d3361661","resolution":{"observed_at":"2026-08-11T23:46:10.306962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.291830Z","title":"RegMix: Data mixture as regression for language model pre-training","venue":null,"work_id":"17f4ff3c-9f66-4fa4-84ca-7b98efc6a1e1","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.704493Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:72948b84314f03c1be7b338861f819248e7715f2776674f04f05e22312f4ccba","observation_id":"7d56fd29-a374-40ca-90a0-4d17fc40d3bb","resolution":{"observed_at":"2026-08-11T23:46:10.295866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.700743Z","title":"Dripper: Token-efficient main HTML extraction with a lightweight LM.arXiv preprint arXiv:2511.23119, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.700743Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:8e3812799b56a43e8b4a5166a6feeaf0c2952a18f532ffaef4e1ef47288ad374","observation_id":"870ff3b3-931c-4fa5-a01d-ef7c61816860","resolution":{"observed_at":"2026-08-11T23:46:08.700743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T23:46:08.712036Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.712036Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:2a548f07994482c2c086ae477ebfe475837c979b253b47167104e2f24f6a5527","observation_id":"3ad61780-a039-46e8-8f0e-eb7cfe61e40d","resolution":{"observed_at":"2026-08-11T23:46:08.712036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24077","last_updated":"2026-06-23T02:42:33Z","snapshot_observed_at":"2026-08-03T17:16:10.837184Z","submitted_at":"2026-06-23T02:42:33Z","title":"Sentence-Level Contextual Entrainment in Large Language Models","version":1},"cited_work":{"arxiv_id":"2606.24077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.24077","snapshot_observed_at":"2026-08-11T23:46:09.503188Z","title":"Sentence-Level Contextual Entrainment in Large Language Models","venue":"cs.CL","work_id":"2920eaed-bc3e-4720-a634-9470ef98b0a6","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.708161Z"},"links":{"cited_paper":"/paper/2606.24077","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:0396b75f9a3bfa374592cd6236e67a805f072a7deaa506d41880aeb3ec724b14","observation_id":"caddb278-c690-4090-852b-6567f647e123","resolution":{"observed_at":"2026-08-11T23:46:09.507694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16397","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.475810Z","title":"AICC: Parse HTML finer, make models better — a 7.3T AI-ready corpus built by a model-based HTML parser.arXiv preprint arXiv:2511.16397, 2025","venue":null,"work_id":"7561199a-5dac-48c5-bd07-2a1345104202","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.719503Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5d44e1ea2be7007bc9ad8788764e3489f5839757c4e9b95934e26d73c4687bdb","observation_id":"b5137b5c-cf5d-47a5-84ea-9e466309a633","resolution":{"observed_at":"2026-08-11T23:46:09.481795Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.280968Z","title":"Klein, and Jesse Dodge","venue":null,"work_id":"17b50deb-0dfb-4563-85d5-6b2bcad72659","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.715836Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:dce0b32c5dffc6fae90a148cf4de596d620cc4b0639e3c2b73b4632c55e1270c","observation_id":"93ae5958-d8be-46eb-85f4-3c175b4b06f0","resolution":{"observed_at":"2026-08-11T23:46:10.284672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.269163Z","title":"Measuring fingerprints of web-filtered text datasets and fingerprint propagation through training","venue":null,"work_id":"84e8f506-1b9d-41ab-9f21-601b0ed5c925","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.726933Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:599dc28796d328a00af1a2078a135674512636e28b2bb4805915b1bc83a5268a","observation_id":"10e8715e-bef4-4679-b9da-9eb126cf768c","resolution":{"observed_at":"2026-08-11T23:46:10.273034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16380","last_updated":"2024-01-29T18:19:08Z","snapshot_observed_at":"2026-08-13T04:32:26.957409Z","submitted_at":"2024-01-29T18:19:08Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16380","snapshot_observed_at":"2026-08-11T23:46:08.722972Z","title":"Rephrasing the web: A recipe for compute and data-efficient language modeling.arXiv preprint arXiv:2401.16380, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.722972Z"},"links":{"cited_paper":"/paper/2401.16380","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:310e4e5147d2eb4890859ad12c7a561bddf453b9d1417691eb5ac5ca3a711893","observation_id":"444cfb4f-cdf9-472d-976a-a057fb97ee46","resolution":{"observed_at":"2026-08-11T23:46:08.722972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.245356Z","title":"Register always matters: Analysis of LLM pretraining data through the lens of language variation","venue":null,"work_id":"aedcc807-9d06-424f-95cd-c52fcec17ec0","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.734114Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:42012af2e9a80f5868f7575f421b1a199a1f9dc83ea94846195bbe9f3fab2ff8","observation_id":"aa540b93-f654-4ab3-84f3-d1e757d5e802","resolution":{"observed_at":"2026-08-11T23:46:10.249473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.257032Z","title":"Autocorrelations decay in texts and applicability limits of language models","venue":null,"work_id":"469235ab-6009-4390-b229-ca7fe6cf7ba6","year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.730477Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:84b0dbaf24bb9b2c329ed8e5acc910abbe88e89de421e392530356d7985f4ccf","observation_id":"97697682-5627-4c5a-a214-f2ee8e11b7c1","resolution":{"observed_at":"2026-08-11T23:46:10.261287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.05141","last_updated":"2026-08-05T17:58:15Z","snapshot_observed_at":"2026-08-11T07:48:33.858916Z","submitted_at":"2026-08-05T17:58:15Z","title":"OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling","version":1},"cited_work":{"arxiv_id":"2608.05141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.05141","snapshot_observed_at":"2026-08-11T23:46:09.377203Z","title":"OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling","venue":"cs.AI","work_id":"3034b877-77cd-4763-a60e-e650a7d6f3d7","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.741761Z"},"links":{"cited_paper":"/paper/2608.05141","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:5bc875ee4c000c711751485b90e025cee29d109a9e7bd11a0c604cc3ced3c751","observation_id":"b557be46-2c86-42f9-b7f5-81062df62b81","resolution":{"observed_at":"2026-08-11T23:46:09.381154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.232616Z","title":"How can we synthesize high-quality pretraining data? a systematic study of prompt design, generator model, and source data","venue":null,"work_id":"ced651a5-52f0-4b7c-89ee-59ec99a88c35","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.738014Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:71d8e66e238e55ae5b0e4298c7e3bdd27bb2f1ec0af896989983f12f5436a623","observation_id":"51c0e49c-0dc6-42b7-bf33-b9b0d4c9e571","resolution":{"observed_at":"2026-08-11T23:46:10.237160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.207886Z","title":"Chapter captor: Text segmentation in novels","venue":null,"work_id":"0258773a-c843-4758-b9dc-a3272537eefd","year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.749302Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f08926291228320d09a56f670b934f5942aba4ba03905f7203befd83614adba7","observation_id":"c942c904-4efd-4d69-986e-b685988a64f1","resolution":{"observed_at":"2026-08-11T23:46:10.212033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.220327Z","title":"The FineWeb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"2163d7bb-182c-4f78-9362-0c4542905747","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.745705Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c973ec36a3c7f4329fad168c2a3e108fb7ba9943b17e363e514d96e10b871073","observation_id":"f850bd65-f37e-43a8-aa69-76b26ee8073d","resolution":{"observed_at":"2026-08-11T23:46:10.224614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.196078Z","title":"epub2txt-all (the Books3 converter)","venue":null,"work_id":"33e77d4b-0f20-462c-8c7e-1d829a4aae47","year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.756470Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f9a4016513a6606d4d73e65a574b8de46640e609a054147bbdef3041e7d63a26","observation_id":"5621d9f2-4963-4970-9a38-b58d6e7f334c","resolution":{"observed_at":"2026-08-11T23:46:10.199905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.752778Z","title":"olmOCR: Unlocking trillions of tokens in PDFs with vision language models.arXiv preprint arXiv:2502.18443, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.752778Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:665fdb62e79a125957d31b011a07feadd1bf35f028f18f61621811ebc36aa51c","observation_id":"4d9838a3-5ba8-4b88-9e4c-f7158e283ada","resolution":{"observed_at":"2026-08-11T23:46:08.752778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-11T23:46:08.767917Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.767917Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:984d2e5881c8ee17123c06e702b7833071333293615f8b3e00067036ddd787c1","observation_id":"446a9c39-3345-49e4-9aef-f56c30b97526","resolution":{"observed_at":"2026-08-11T23:46:08.767917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.772122Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.772122Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:083cf49b95b88b2532f6567f45ec422ad26ef3d561bccaeeb18e2a99c31b417f","observation_id":"a7ceff82-8002-4e0a-be0d-3efb1465cc9e","resolution":{"observed_at":"2026-08-11T23:46:08.772122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T23:46:08.764228Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.764228Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:130f293e79e0b89dca3dea28668e4956f37885b7816a47bc4b82f8adca67770b","observation_id":"a0bb3eb7-1ceb-47b6-bf73-1ed42815cf9c","resolution":{"observed_at":"2026-08-11T23:46:08.764228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15968","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:09.270562Z","title":"From reflection to repair: A scoping review of dataset documentation tools.arXiv preprint arXiv:2602.15968, 2026","venue":null,"work_id":"7d56a1b1-2678-4e6c-8251-e7b0ed24eabe","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.779814Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:074ba3a485192c0d1edcc49a85d96bc44c1b55e90bc6ea9bfe9a56b8b7a5cacc","observation_id":"36d60be1-2d4a-48ba-8dda-7d2d8d797a99","resolution":{"observed_at":"2026-08-11T23:46:09.276678Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.07506","last_updated":"2019-12-16T17:12:00Z","snapshot_observed_at":"2026-08-03T15:37:40.504515Z","submitted_at":"2019-12-16T17:12:00Z","title":"Scale-dependent Relationships in Natural Language","version":1},"cited_work":{"arxiv_id":"1912.07506","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.07506","snapshot_observed_at":"2026-08-11T23:46:09.121921Z","title":"Scale-dependent Relationships in Natural Language","venue":"cs.CL","work_id":"60e6a407-1c2b-46c3-aeff-1db22760eee3","year":2019},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.783358Z"},"links":{"cited_paper":"/paper/1912.07506","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:25bcdd70e71254e641b93d31c82ddd6abca54d0ace72d65a0d987639ce012df5","observation_id":"750a02df-cc2a-49d0-a0b3-b44af8141697","resolution":{"observed_at":"2026-08-11T23:46:09.126130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.167048Z","title":"RolmOCR model card.https://huggingface.co/reducto/RolmOCR, 2025","venue":null,"work_id":"01df278a-e4f9-43ec-9a36-1a517b4c7fa2","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.775948Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:72be2a8f09e44344e791242630bb05e0f1012fd24e4bc9bd702cb47703cc3783","observation_id":"b128d4cb-385d-4b47-b6b6-327a3051d027","resolution":{"observed_at":"2026-08-11T23:46:10.171029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.156415Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":"44003043-0810-43af-92bc-54559da93fcc","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.791038Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:db42d8285c0b8351286e637b594759b04cc6b62a22a1a4ab80e83311c4fb867b","observation_id":"a1587bca-a466-47c0-b32e-464756d736b5","resolution":{"observed_at":"2026-08-11T23:46:10.160064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.144987Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":"a8b6de35-9e14-460c-a7e2-c85bdaa87347","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.794756Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c845d6cbbb534ffa04a7e39333a17f98890bb1908e21eb8b2acbba50f12ec697","observation_id":"29167a1b-8011-4c3f-900d-5dc057727d6c","resolution":{"observed_at":"2026-08-11T23:46:10.149510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04271","last_updated":"2019-05-10T17:21:21Z","snapshot_observed_at":"2026-08-07T07:10:05.141697Z","submitted_at":"2019-05-10T17:21:21Z","title":"Mutual Information Scaling and Expressive Power of Sequence Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04271","snapshot_observed_at":"2026-08-11T23:46:08.787163Z","title":"Mutual information scaling and expressive power of sequence models.arXiv preprint arXiv:1905.04271, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.787163Z"},"links":{"cited_paper":"/paper/1905.04271","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:a697979f5b82cc5d28b97a4900b2020489f330669319fe8b5075394d61c07ca6","observation_id":"62b3ba69-8815-4713-bb09-6d9e2ed0ef23","resolution":{"observed_at":"2026-08-11T23:46:08.787163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.122878Z","title":"ChapterBreak: A challenge dataset for long-range language models","venue":null,"work_id":"c9888e71-001d-4994-b814-6a706e6c22cf","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.801750Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:be2b48acb202148b19959038ebc4f10bbf7164cb25283e2e57275b2eb4b23e9e","observation_id":"da602af8-0010-4589-8474-d649bc5a0871","resolution":{"observed_at":"2026-08-11T23:46:10.126803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.111732Z","title":"Accessed 2026-08-09","venue":null,"work_id":"2241c4e3-50c2-4edc-9df3-a0cc30f33b73","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.805338Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6447b846f4587855b0ab8757b3dca1e4b90eb9b808d7146b18f8c21a7b082f45","observation_id":"76e0f288-a66c-47b6-a6e8-09f72bfec00d","resolution":{"observed_at":"2026-08-11T23:46:10.115418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.133907Z","title":"Zico Kolter, and Zhuang Liu","venue":null,"work_id":"b0b29893-462e-4e5e-8ffc-dc34de79a618","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.798336Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b0cd562d07b5a2567f3998416e5521878fd607930e1d27fbe87edd61fef4767f","observation_id":"a4994bef-5a84-4127-a17e-4746bbf90d83","resolution":{"observed_at":"2026-08-11T23:46:10.137800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-11T23:46:08.812864Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.812864Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:bc457f312dd6f938a67d79381a2a4d07f4e4f4adb6ff1327342eef0731c64d2e","observation_id":"5550b4f1-6a93-4bcb-b9a6-2ca0d227321a","resolution":{"observed_at":"2026-08-11T23:46:08.812864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T23:46:08.816699Z","title":"LLaMA: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.816699Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:724f5e56e76b65167dd0b40396c49c19b94689cd23ca0a2df7c69fcba2ecd3f8","observation_id":"289ede77-7263-4f8d-a5f7-ef76910dc4c5","resolution":{"observed_at":"2026-08-11T23:46:08.816699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.28109","last_updated":"2026-07-30T12:15:41Z","snapshot_observed_at":"2026-08-09T09:41:46.448779Z","submitted_at":"2026-07-30T12:15:41Z","title":"Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training","version":1},"cited_work":{"arxiv_id":"2607.28109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.28109","snapshot_observed_at":"2026-08-11T23:46:09.094834Z","title":"Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training","venue":"cs.AI","work_id":"9c16bcc9-96bf-4be7-890a-4cfadd5d35de","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.808708Z"},"links":{"cited_paper":"/paper/2607.28109","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:8d14f076dd8c00aaa5bb1bb9cd12ef9423e9304dfb0aea7be9c6bf99bad4ae22","observation_id":"d8d3ea3d-4234-465e-a029-1c2afa2026c7","resolution":{"observed_at":"2026-08-11T23:46:09.099133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-11T23:46:08.824450Z","title":"MinerU: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.824450Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:25acfbd1abcb64a7c88da7473e528567ced3a1aad32edb1bbd30325986bfb4e3","observation_id":"0e46ee02-9ea8-4e60-90cc-bbb5544db8d6","resolution":{"observed_at":"2026-08-11T23:46:08.824450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28344","last_updated":"2026-06-01T23:20:51Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-01T23:20:51Z","title":"PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2606.28344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28344","snapshot_observed_at":"2026-08-11T23:46:09.029653Z","title":"PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation","venue":"cs.IR","work_id":"a3ada67c-a353-446e-8d28-5ced9aaa124d","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.828474Z"},"links":{"cited_paper":"/paper/2606.28344","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:22c66d7ccc120ee5933a1e2a464c760181dd957ba0aaae3b1d0fbc3c86f8135d","observation_id":"ea6d276c-610c-4bd9-a5b5-32e35470cdcd","resolution":{"observed_at":"2026-08-11T23:46:09.034640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.04330","last_updated":"2026-08-05T01:17:12Z","snapshot_observed_at":"2026-08-12T15:21:09.710996Z","submitted_at":"2026-08-05T01:17:12Z","title":"Right Reset: Chunking by Prefix Removal","version":1},"cited_work":{"arxiv_id":"2608.04330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.04330","snapshot_observed_at":"2026-08-11T23:46:09.057632Z","title":"Right Reset: Chunking by Prefix Removal","venue":"cs.CL","work_id":"0e63e10a-2990-44eb-89f8-746a2004a60e","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.820342Z"},"links":{"cited_paper":"/paper/2608.04330","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:b5a229dc85b4049c8de47fa9546d3515689f752a1af7ca4b2a27be33f7912702","observation_id":"919507d1-adee-44a2-83b1-faa97958128e","resolution":{"observed_at":"2026-08-11T23:46:09.062126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16860","last_updated":"2025-02-27T14:50:10Z","snapshot_observed_at":"2026-08-10T06:16:54.502401Z","submitted_at":"2025-02-24T05:51:53Z","title":"LongAttn: Selecting Long-context Training Data via Token-level Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16860","snapshot_observed_at":"2026-08-11T23:46:08.837385Z","title":"LongAttn: Selecting long-context training data via token-level attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.837385Z"},"links":{"cited_paper":"/paper/2502.16860","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6ba5451f514d4bfb749592d5e6fbbc548547f7c4bd75d28c6e8f4b7f701ce4a5","observation_id":"98108d02-c141-47d1-b782-01ac336a211b","resolution":{"observed_at":"2026-08-11T23:46:08.837385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.100579Z","title":"Morris, and Lionel Levine","venue":null,"work_id":"38b718ee-e37d-44bb-bf5b-a33680feb4ac","year":2024},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.841338Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:93479aa8aadaa6c2efa56ce4ac191dce6ce73c8d92be56dfb7aa9ea769e1e391","observation_id":"bf2ba5af-8693-43c8-be69-52a84b441af7","resolution":{"observed_at":"2026-08-11T23:46:10.104141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01789","last_updated":"2025-06-03T04:18:39Z","snapshot_observed_at":"2026-08-08T11:39:24.709844Z","submitted_at":"2025-06-02T15:31:52Z","title":"Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01789","snapshot_observed_at":"2026-08-11T23:46:08.832563Z","title":"Datasheets aren’t enough: DataRubrics for automated quality metrics and accountability.arXiv preprint arXiv:2506.01789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.832563Z"},"links":{"cited_paper":"/paper/2506.01789","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:61185183f3af5aa779082fd3131f63b72ed3dd789cdffebac527f9e14601d3b3","observation_id":"f755bad9-c5f7-4fd5-aac2-ad53e0bfc3d9","resolution":{"observed_at":"2026-08-11T23:46:08.832563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.077089Z","title":"Learning to break the loop: Analyzing and mitigating repetitions for neural text generation","venue":null,"work_id":"012e578f-7087-4f53-816a-0fa9ac037731","year":2022},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.848523Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ab056bcda1f965236cd8d9f52bdff16d2edd897244ba2e70d0b09521e2d82923","observation_id":"2f060d25-0c30-40be-b921-38c88aca8d45","resolution":{"observed_at":"2026-08-11T23:46:10.081092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.065742Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"2d212cac-5f37-4182-9352-468f5144795a","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.852100Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:45f788fdef832ec6ecc80e45997109883dceb4a7a7444eba2ad1758b4b9e637b","observation_id":"ab284549-a24a-4633-b8d2-26b4f68c11b5","resolution":{"observed_at":"2026-08-11T23:46:10.069815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.089095Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":"a01f3083-4d8a-43df-81f0-5819408cdbbd","year":2023},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.844966Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:d0c89f46f53de6739e7a50f8ae07ff4db37089f5b5b5326a3a67b5cc3d5b0e1b","observation_id":"3478cf59-34f1-41c0-aec3-6735908add7d","resolution":{"observed_at":"2026-08-11T23:46:10.093107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.054116Z","title":"Zacks, Nicole K","venue":null,"work_id":"7d7c5e13-ecc8-41fa-95bc-a83980dbc2ed","year":2007},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.860828Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:705c482c31c1a697c84a8494f8da4b342628be83d424da0f2deebc2d6be7cfc6","observation_id":"9f9598ca-fc52-4c51-a957-b418b878adba","resolution":{"observed_at":"2026-08-11T23:46:10.058298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.041837Z","title":"From lists to emojis: How format bias affects model alignment","venue":null,"work_id":"91bfcd88-2b1e-41f0-9a92-6d1a23ed15d9","year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.864257Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:e866896b06fe5fe14d5e8cc262674b913aba3071c3ba3bf23199ca4e0d1e5c10","observation_id":"85c2b94d-26cb-436d-9add-963dc6f821d8","resolution":{"observed_at":"2026-08-11T23:46:10.046021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18949","last_updated":"2025-05-25T02:52:35Z","snapshot_observed_at":"2026-08-13T21:15:10.734752Z","submitted_at":"2025-05-25T02:52:35Z","title":"The Price of Format: Diversity Collapse in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18949","snapshot_observed_at":"2026-08-11T23:46:08.856924Z","title":"The price of format: Diversity collapse in LLMs.arXiv preprint arXiv:2505.18949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.856924Z"},"links":{"cited_paper":"/paper/2505.18949","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:fa5d0ff1b621f52f65df07537cceb2444a7c25dbb695eb44a1a37ba282e501c7","observation_id":"55707357-ff8e-4d89-a41d-509c1a44cd00","resolution":{"observed_at":"2026-08-11T23:46:08.856924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11198","last_updated":"2026-04-21T08:47:00Z","snapshot_observed_at":"2026-08-03T18:51:30.407210Z","submitted_at":"2026-04-21T08:47:00Z","title":"The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content","version":1},"cited_work":{"arxiv_id":"2606.11198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11198","snapshot_observed_at":"2026-08-11T23:46:08.966786Z","title":"The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content","venue":"cs.CL","work_id":"aaddb521-1f6b-41a5-a1b7-4707880df0e3","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.871727Z"},"links":{"cited_paper":"/paper/2606.11198","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:ccf1e9f9e7ac5a2d13aff1684f89fdef274b3a8030ad3f912dd47085cce9452f","observation_id":"6e68ee45-f4ca-422f-b1fa-1e001cbd6add","resolution":{"observed_at":"2026-08-11T23:46:08.971210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-08-13T23:35:48.315549Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"cited_work":{"arxiv_id":"2605.10544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10544","snapshot_observed_at":"2026-08-11T23:46:08.947663Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","venue":"cs.CL","work_id":"83b55444-f2ef-4a91-a372-269bd632e9a9","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.875599Z"},"links":{"cited_paper":"/paper/2605.10544","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:c096ae6ac8326ff7d2165f4bb9ae134843659fa01c3d2bd8c457f90bf2f87efc","observation_id":"84df4455-b9e6-4dd6-a651-dabc1196f62e","resolution":{"observed_at":"2026-08-11T23:46:08.954229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-13T16:28:40.945834Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"cited_work":{"arxiv_id":"2607.09657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09657","snapshot_observed_at":"2026-08-11T23:46:08.982743Z","title":"Scalable Visual Pretraining for Language Intelligence","venue":"cs.CV","work_id":"afd98409-e372-4bec-8459-446265af679a","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.868091Z"},"links":{"cited_paper":"/paper/2607.09657","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:f16dcb1b419410e66fd876417887b91f1a12ace0e5fe536d9d7f9db9f497a0d3","observation_id":"9619982f-93a7-474e-989e-ae8073391783","resolution":{"observed_at":"2026-08-11T23:46:08.987020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.030245Z","title":"Zwaan and Gabriel A","venue":null,"work_id":"ddaa00e8-49df-4571-b75f-24c181b4ffe2","year":1998},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.884591Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:6146c4035766e48cd94602a877ebaa91f05f24bac7f15294658476355fdf8bc2","observation_id":"58d6a4af-29c9-4e81-8567-412d9a7bc57c","resolution":{"observed_at":"2026-08-11T23:46:10.034224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03705","last_updated":"2025-06-22T19:25:04Z","snapshot_observed_at":"2026-08-10T13:36:42.908582Z","submitted_at":"2025-03-05T17:56:20Z","title":"Enhancing LLM Knowledge Learning through Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03705","snapshot_observed_at":"2026-08-11T23:46:08.879720Z","title":"Enhancing LLM knowledge learning through generalization.arXiv preprint arXiv:2503.03705, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.879720Z"},"links":{"cited_paper":"/paper/2503.03705","citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:0437bf8af5244ceec034070bc6bce4c5f9996b502fd9cbf25e11187f40bf7879","observation_id":"075984c6-1b52-438d-be3c-70502615977e","resolution":{"observed_at":"2026-08-11T23:46:08.879720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:10.184951Z","title":null,"venue":null,"work_id":"8e5f2dac-441c-4c53-a83d-3862c66c6ce5","year":2026},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.760319Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:20749ff9c9b18286ebe23a6cb8f8f5a939fff823424d41d2ee974891a6fde42c","observation_id":"812918f9-4bb3-4ae1-b781-fff4d2ae9688","resolution":{"observed_at":"2026-08-11T23:46:10.188682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:08.644369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T23:46:08.644369Z"},"links":{"citing_paper":"/paper/2608.09093"},"observation_digest":"sha256:21ae095e4d7c8bcf632b566b0415869fe3ef4a0e6b785e1733c401880eed880a","observation_id":"769428fc-d8fc-4600-8193-4babf0e61a92","resolution":{"observed_at":"2026-08-11T23:46:08.644369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09093","last_updated":"2026-08-10T03:43:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T23:41:25.074745Z","submitted_at":"2026-08-10T03:43:30Z","title":"The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":50,"verified_exact":16,"verified_fuzzy":28},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 0 inbound Pith citation observations for arXiv:2608.09093."}