{"as_of":"2026-08-09T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce33244521ff05ac683d4264cbc71bee7aca61c4d5b0c5210231d6e11027ba79","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:57:12.006202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T17:02:24.078563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-02T09:09:10.011185Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:23:29.564169Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/1911.02116"},"observation_digest":"sha256:c97bfe4b213dee83f57d6bfcbfa30be84fd34094a60a722f9bd49b7f1e6118d9","observation_id":"03788d16-a6c8-4673-98d0-0fb7a9a07835","resolution":{"observed_at":"2026-05-16T16:23:29.600855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2002.08910","last_updated":"2020-10-05T21:26:45Z","snapshot_observed_at":"2026-08-03T03:30:56.636820Z","submitted_at":"2020-02-10T18:55:58Z","title":"How Much Knowledge Can You Pack Into the Parameters of a Language Model?","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-15T02:00:28.055865Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2002.08910"},"observation_digest":"sha256:0dbd53be8daaf9afde4dacb9f6ab6ac45815198faa0410510542f520e5e7bd82","observation_id":"e3d827c7-880e-4f0b-ba3f-c7f1c1468c77","resolution":{"observed_at":"2026-05-15T02:00:28.169302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-10T21:35:18.513342Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2101.00027"},"observation_digest":"sha256:d4a7af398c87c33bf6f9dd73ae466d080535b3aa59c126d6cd3940ce9221355e","observation_id":"5472dbef-3a53-48ca-a44a-1da109dc35b6","resolution":{"observed_at":"2026-05-10T21:35:18.906502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T07:36:55.087443Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2305.07759"},"observation_digest":"sha256:f733d1699bd79d239d15717b53f5508d5f7af6fbde4d907f131e95a7ce4b1634","observation_id":"40b2432e-8c0f-4e45-be7d-32348da2309d","resolution":{"observed_at":"2026-05-25T07:36:55.190800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:2680169575f97e2c0a0d1ace6cf00d42108129abc99a3316f8870178ac16a367","observation_id":"5dd9c545-4321-49a5-a26c-66e1f6a9193d","resolution":{"observed_at":"2026-05-18T01:35:21.469750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:0d9b53f38bab79f698600cc74b7a6d537d0ccf681e8fe5012f6e280184d7c667","observation_id":"0fc3d07e-10cb-4433-b4ff-e7a1743f9cea","resolution":{"observed_at":"2026-05-13T05:47:27.920584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:0d2d45bbff8d980d41bf25241e8984378f2f98f2f7b42fdb66099936ab377d8b","observation_id":"a44804af-48ca-4012-862d-891579879888","resolution":{"observed_at":"2026-05-16T04:09:36.325229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-08T11:57:12.006202Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.09650","last_updated":"2025-05-13T18:54:09Z","snapshot_observed_at":"2026-08-09T02:50:07.586622Z","submitted_at":"2025-02-11T17:01:11Z","title":"Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T11:57:12.006202Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2502.09650"},"observation_digest":"sha256:98382d1c5ddb4e34f73b12e2d7948faa9666414e02accda4195fd5f827c597ae","observation_id":"0b6dea10-5fa3-4ed9-8f74-42e7b1419e38","resolution":{"observed_at":"2026-08-08T11:57:12.006202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:3ab8362453dced3d7b7daa5493a7a00e914f78bb9b1a0237c70307092f287415","observation_id":"c6ceac81-6d16-4aeb-98e0-477ea8bbe813","resolution":{"observed_at":"2026-05-19T08:02:23.384376Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-07T15:33:55.441839Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.14826","last_updated":"2025-05-20T18:41:34Z","snapshot_observed_at":"2026-08-09T02:47:54.126071Z","submitted_at":"2025-05-20T18:41:34Z","title":"FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:33:55.441839Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2505.14826"},"observation_digest":"sha256:5c36789d4fd211be2bf610351221718624561f4b0843103b69e68e687d175d28","observation_id":"253f9be1-f33b-44e4-8048-6bebdc1a3247","resolution":{"observed_at":"2026-08-07T15:33:55.441839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-06T17:52:50.757421Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.10618","last_updated":"2025-07-13T21:28:02Z","snapshot_observed_at":"2026-08-08T03:18:40.989863Z","submitted_at":"2025-07-13T21:28:02Z","title":"Compute Requirements for Algorithmic Innovation in Frontier AI Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:50.757421Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2507.10618"},"observation_digest":"sha256:db215f419c6ecb2d743e11d6f854a2cd59007784eacff73a3752ae9ea1c7e30f","observation_id":"a2a851bd-e006-4495-871c-b13c6e4a11ce","resolution":{"observed_at":"2026-08-06T17:52:50.757421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-06T16:53:15.031829Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-09T12:12:41.025897Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:15.031829Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:1afada4486f36ccfaae6933bd2439ed97ab5516aa17a9211171f26b8be8c7a3c","observation_id":"137788bf-f801-4910-8e92-490cd5ecc825","resolution":{"observed_at":"2026-08-06T16:53:15.031829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T21:43:37.162870Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2508.00795"},"observation_digest":"sha256:d94bdc5ede705ce5e34d8cd4edea7750231872bcc3235600cbbb9844e06fbb05","observation_id":"06259a0d-4dd2-4298-a957-7f7bc7057306","resolution":{"observed_at":"2026-05-15T21:43:37.312838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-04T11:16:14.514772Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.514772Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:3b71941910617a015530659a4268afe3530d171f5ebb2db3fc4bd44b95c3c11e","observation_id":"e31f17c5-f02a-4005-8b4d-9c7ae6b0fe08","resolution":{"observed_at":"2026-08-04T11:16:14.514772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2606.01196","last_updated":"2026-05-31T12:19:40Z","snapshot_observed_at":"2026-07-06T23:41:48.357871Z","submitted_at":"2026-05-31T12:19:40Z","title":"Low-Resource Safety Failures Are Action Failures, Not Representation Failures","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T16:59:51.969896Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2606.01196"},"observation_digest":"sha256:7aa83dd89532809b7f83944949f6e9e0d37fbdfc83ae8009363d1402aedca398","observation_id":"c2f873c2-2cd4-4d8d-9414-99f5d0a039c9","resolution":{"observed_at":"2026-06-28T17:02:24.079935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-04T08:28:17.704940Z","title":"Wenzek, M.-A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02376","last_updated":"2026-08-06T13:36:52Z","snapshot_observed_at":"2026-08-09T14:11:52.739296Z","submitted_at":"2026-08-03T15:20:36Z","title":"Token-Native Storage: Read and Write in your Agent's Language","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T08:28:17.704940Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2608.02376"},"observation_digest":"sha256:d5ee2f0f40fbff8925b9040ae46f370acdb0704d0b51475e0f98a9f5072dd891","observation_id":"029975e0-6f6f-401b-aedf-afed6ac63fae","resolution":{"observed_at":"2026-08-04T08:28:17.704940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-07T01:05:13.475406Z","title":"Wenzek, M.-A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02376","last_updated":"2026-08-06T13:36:52Z","snapshot_observed_at":"2026-08-09T14:11:52.739296Z","submitted_at":"2026-08-03T15:20:36Z","title":"Token-Native Storage: Read and Write in your Agent's Language","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:13.475406Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2608.02376"},"observation_digest":"sha256:0ddc499ee0d0357393fb9711a22afd77c55acfb3c974fd5c4f405224e48a73c9","observation_id":"6a3654bb-915b-476a-a125-591c2aa20ab2","resolution":{"observed_at":"2026-08-07T01:05:13.475406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1911.00359/citation-record","integrity":"/paper/1911.00359/integrity","json":"/paper/1911.00359/citation-record.json","paper":"/paper/1911.00359"},"outbound":[],"paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:1911.00359."}