{"as_of":"2026-08-14T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70692942ca8a34faba60f714c5c34fd8dc261d94eb4c40d4829e436d373318d7","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:45:47.456648Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11289/citation-record","integrity":"/paper/2411.11289/integrity","json":"/paper/2411.11289/citation-record.json","paper":"/paper/2411.11289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.275930Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.275930Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:f15b27c1be001bfc000699e993ac8a76f0623016fc2fde436c3fb73e63af6f5d","observation_id":"e505cc8e-abb1-461d-a3f9-9e173c33a16a","resolution":{"observed_at":"2026-08-12T18:45:47.275930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.281045Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.281045Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:66936d5cd3509cf165327a454a9a97b68b7e72128307b5332d7ca284598a654d","observation_id":"a5877f6c-8252-4ead-a9cf-37c6047e80cf","resolution":{"observed_at":"2026-08-12T18:45:47.281045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:48.001064Z","title":null,"venue":null,"work_id":"de7e7523-9111-4892-bf51-350b1a2d5d02","year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.285258Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:800c7e4485afeb9e4e6704b96eef63185cbebf0d650e49e3b8d682d3228cee9a","observation_id":"a88e7e4e-3016-4037-b503-f83531d6c160","resolution":{"observed_at":"2026-08-12T18:45:48.004599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.990144Z","title":null,"venue":null,"work_id":"9851e4a3-ee0f-4a99-93fb-dccb54f9217d","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.289270Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:37d1c8f370d821aa6452bf7da1b8db4f7637b5ac458c450314ae821489078a28","observation_id":"49244de8-3e6e-493f-bb21-2d486fef0b19","resolution":{"observed_at":"2026-08-12T18:45:47.993728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.979359Z","title":null,"venue":null,"work_id":"46b4102a-aa44-4835-862f-a952f47d83b7","year":2018},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.293373Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:c38c154910bc00a7c5ed242f1a090f0475f9909a615d324bcc2dba3e2f9aef6f","observation_id":"4a628319-8cf8-44c8-bd8a-b33e7edf056c","resolution":{"observed_at":"2026-08-12T18:45:47.983224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.297558Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.297558Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:f6f27f34a9b886bf08296e0fac03fb68a33f56a9cbaffdc3efd446332125b64b","observation_id":"c4d78c37-cda5-4eff-9b41-cb463bd6fb13","resolution":{"observed_at":"2026-08-12T18:45:47.297558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.962429Z","title":null,"venue":null,"work_id":"4abbaf04-4841-4fed-9d9a-c5e675812a05","year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.301614Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:331c0f2e1f97b57f80012827cbb0842b4ea3bcc6433df4cbad8cccaa19e90a62","observation_id":"71be09d8-9059-4f0c-8cce-b89197e44551","resolution":{"observed_at":"2026-08-12T18:45:47.966152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09530","last_updated":"2024-07-25T03:08:18Z","snapshot_observed_at":"2026-08-13T10:11:07.103614Z","submitted_at":"2023-09-18T07:17:52Z","title":"Adapting Large Language Models to Domains via Reading Comprehension","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09530","snapshot_observed_at":"2026-08-12T18:45:47.305514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.305514Z"},"links":{"cited_paper":"/paper/2309.09530","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:7d7c8f530e56f556eb37ad001e6303afb9afb727af668fcea9f5fea09cc2f30e","observation_id":"5647e516-a565-4874-8267-3ee41f1a8693","resolution":{"observed_at":"2026-08-12T18:45:47.305514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06599","last_updated":"2020-05-13T21:41:29Z","snapshot_observed_at":"2026-07-06T09:20:09.390875Z","submitted_at":"2020-05-13T21:41:29Z","title":"Phishing URL Detection Through Top-level Domain Analysis: A Descriptive Approach","version":1},"cited_work":{"arxiv_id":"2005.06599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.06599","snapshot_observed_at":"2026-08-12T18:45:47.862909Z","title":"Phishing URL Detection Through Top-level Domain Analysis: A Descriptive Approach","venue":"cs.CR","work_id":"26e96cb7-678f-42fd-ae07-f95a5fb2bf48","year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.309948Z"},"links":{"cited_paper":"/paper/2005.06599","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:e70cecb041420c7a35f32cc0253c79ebc6c866884eb34c094b593ebfaf897acd","observation_id":"27e35cb7-e3fb-4721-beb4-3a92ec083588","resolution":{"observed_at":"2026-08-12T18:45:47.866879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00075","last_updated":"2019-04-30T19:43:53Z","snapshot_observed_at":"2026-08-14T09:32:23.662075Z","submitted_at":"2019-04-30T19:43:53Z","title":"On the Use of ArXiv as a Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00075","snapshot_observed_at":"2026-08-12T18:45:47.314293Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.314293Z"},"links":{"cited_paper":"/paper/1905.00075","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:09b2662ceec6d1d4f017815594bc866214654ccdb677ffe019e32433f77d11d0","observation_id":"1d069b1b-f0c9-495a-8c1c-f34ab889b51f","resolution":{"observed_at":"2026-08-12T18:45:47.314293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.951063Z","title":null,"venue":null,"work_id":"f4110043-9655-4c9c-b071-f822de68303e","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.318395Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:6c1af083b78344992f537b80a5ba1c82bebe6f3c1ed80f447e4cab1f93eed6e7","observation_id":"73a62454-40bf-4f5f-af00-0fe41e54a12f","resolution":{"observed_at":"2026-08-12T18:45:47.955064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.322374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.322374Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:76096042ce71864088ffb322e8379ff2fb5ad39021b83f1fd1e907879b30447e","observation_id":"7e26c37d-631e-4a13-8e85-00606b53cbd5","resolution":{"observed_at":"2026-08-12T18:45:47.322374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-11T11:33:47.725577Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-12T18:45:47.325992Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.325992Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:341175c4fe55cdf271511badee13e371e065deaf3a453d6c0e9697f73f854d53","observation_id":"259781e1-1179-4b19-9d5b-72610e974917","resolution":{"observed_at":"2026-08-12T18:45:47.325992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11540","last_updated":"2025-02-28T14:35:58Z","snapshot_observed_at":"2026-08-12T22:22:48.348205Z","submitted_at":"2024-10-15T12:14:57Z","title":"Data Quality Control in Federated Instruction-tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11540","snapshot_observed_at":"2026-08-12T18:45:47.330011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.330011Z"},"links":{"cited_paper":"/paper/2410.11540","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:b8e2c5a0f7e914f58394cca0458d5c610d088dbee74704c682166f6c1c0d0a9a","observation_id":"a6ae8fc1-d58a-4850-982d-360f3ee55ee6","resolution":{"observed_at":"2026-08-12T18:45:47.330011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:45:47.334094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.334094Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:3ad2e8905c3fa1d0e8d2fe26df0f853cfffaf44f84683f310d6f3c5ca978166a","observation_id":"6f540b78-7172-4ca0-ba3b-5906990ecb16","resolution":{"observed_at":"2026-08-12T18:45:47.334094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.934188Z","title":null,"venue":null,"work_id":"91877de3-da4d-4e89-a673-6d0a2160d6dd","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.337887Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:7938fed6b4870946386c6a44a15ea29460e49eaa93e7309d56822bb5cd5b2adf","observation_id":"0b0540e2-641a-45b1-baed-c59bcd8b7d58","resolution":{"observed_at":"2026-08-12T18:45:47.937576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-12T18:45:47.340919Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.340919Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:5470d06363ab5ede9f6de0202cebcbe181398610f2b5ad723770f9a915d6230d","observation_id":"56830293-ee0c-42cb-8170-52d29974fe33","resolution":{"observed_at":"2026-08-12T18:45:47.340919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-12T18:45:47.344463Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.344463Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1cc70d122ff26618f06062a2184285766112297665c6c57e6be85a4e8862742d","observation_id":"3db9891d-f6de-43e7-88d7-82bba16f8de5","resolution":{"observed_at":"2026-08-12T18:45:47.344463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05694","last_updated":"2025-01-27T03:50:31Z","snapshot_observed_at":"2026-08-13T05:53:55.378073Z","submitted_at":"2023-10-09T13:15:23Z","title":"A Survey of Large Language Models for Healthcare: from Data, Technology, and Applications to Accountability and Ethics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05694","snapshot_observed_at":"2026-08-12T18:45:47.348202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.348202Z"},"links":{"cited_paper":"/paper/2310.05694","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:9dcf9d1e4fca724d9472ccb6fb54344660da3faaaeb5385fe67d77a5a1657fa6","observation_id":"f8f45303-ff9b-4ae4-9439-d3f80663947c","resolution":{"observed_at":"2026-08-12T18:45:47.348202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.352002Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.352002Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1ad564644326f1d791b349293a4b06eb39bc8d2ecdf69b8c9961a58b98ed3c66","observation_id":"e7fbd059-4ac2-467e-be30-3a8de261fbfa","resolution":{"observed_at":"2026-08-12T18:45:47.352002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12053","last_updated":"2024-04-02T06:04:16Z","snapshot_observed_at":"2026-08-13T10:08:24.364744Z","submitted_at":"2023-09-21T13:20:13Z","title":"AceGPT, Localizing Large Language Models in Arabic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12053","snapshot_observed_at":"2026-08-12T18:45:47.355694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.355694Z"},"links":{"cited_paper":"/paper/2309.12053","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:b10186d1e872446abcb6d857bdf453a90bf064b95003954629e5ac79e6d4cb5f","observation_id":"0f623f01-33f5-4707-8538-7b3077cb2f5f","resolution":{"observed_at":"2026-08-12T18:45:47.355694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.359225Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.359225Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:84224cdd35e52098f4dae561f3c5bf037b99fdf332cde219cec358b65fbcbbd0","observation_id":"d6e6250e-023d-4d6d-a103-021db00e6a67","resolution":{"observed_at":"2026-08-12T18:45:47.359225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-08-14T01:16:52.740875Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-12T18:45:47.362493Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.362493Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:940c5905ba5807d6f5721d5f9e261c8079cd3696cd90ebbd6b5a96eb05b23313","observation_id":"e306c955-246b-4b5b-b0f2-d0ebd66141ae","resolution":{"observed_at":"2026-08-12T18:45:47.362493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.366251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.366251Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:141f38756f11e0c0ede674855a6686bd4f9e20b3f319dddba3857a732a10e6fe","observation_id":"c493f4d8-994e-4771-8471-d6d58d7eed69","resolution":{"observed_at":"2026-08-12T18:45:47.366251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04795","last_updated":"2024-10-08T04:05:18Z","snapshot_observed_at":"2026-08-12T22:29:27.074300Z","submitted_at":"2024-10-07T07:14:37Z","title":"Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.04795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04795","snapshot_observed_at":"2026-08-12T18:45:47.701097Z","title":"Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models","venue":"cs.CL","work_id":"9e4883da-1460-44f6-8a04-d7145340b174","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.369787Z"},"links":{"cited_paper":"/paper/2410.04795","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:9f181b21722d5740775afa765f561151ab35bf9a6cb970aacb919423fbac6634","observation_id":"67c03c44-4ea8-49cf-b150-d5e53cc813e5","resolution":{"observed_at":"2026-08-12T18:45:47.705456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09613","last_updated":"2024-09-15T05:27:56Z","snapshot_observed_at":"2026-08-14T06:36:15.829467Z","submitted_at":"2024-09-15T05:27:56Z","title":"Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora","version":1},"cited_work":{"arxiv_id":"2409.09613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09613","snapshot_observed_at":"2026-08-12T18:45:47.685317Z","title":"Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora","venue":"cs.CL","work_id":"b1daf073-65b6-4fde-ac5c-ab154a6e6130","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.373671Z"},"links":{"cited_paper":"/paper/2409.09613","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:f3742459a8c424e4adbea4f79df5f157557f68dc49d77aaba53416a1f0f0c715","observation_id":"fcccf092-180c-4eb0-94de-4d42536a4822","resolution":{"observed_at":"2026-08-12T18:45:47.689752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.377494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.377494Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:d52ed2e9941fce02d9a566d749f84517ccecdb27396b3a5409c048c321479fe5","observation_id":"14047864-7f4e-4151-9a07-5b9d27dae966","resolution":{"observed_at":"2026-08-12T18:45:47.377494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02315","last_updated":"2024-02-04T02:06:57Z","snapshot_observed_at":"2026-08-14T07:03:06.939458Z","submitted_at":"2024-02-04T02:06:57Z","title":"A Survey of Large Language Models in Finance (FinLLMs)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02315","snapshot_observed_at":"2026-08-12T18:45:47.380962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.380962Z"},"links":{"cited_paper":"/paper/2402.02315","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:10eabbd284ad1c23ea3959d60da9bf64ac60fb22080d343b105d648ff6476b0c","observation_id":"2e0b4a27-b7c8-4664-8681-5df646ce620a","resolution":{"observed_at":"2026-08-12T18:45:47.380962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08310","last_updated":"2024-08-15T17:59:30Z","snapshot_observed_at":"2026-08-12T23:02:59.660640Z","submitted_at":"2024-08-15T17:59:30Z","title":"ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08310","snapshot_observed_at":"2026-08-12T18:45:47.384702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.384702Z"},"links":{"cited_paper":"/paper/2408.08310","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:285c03c22b12b905823425833c43e517925172db7946ec1b0d4572348b05975c","observation_id":"4c72d3dd-a3df-4e6a-b461-9f0e09781dfe","resolution":{"observed_at":"2026-08-12T18:45:47.384702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-12T18:45:47.388685Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.388685Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:405679be50772a165fc627b0dda92dd6cc523e5b5f84557755b9f80cdd730433","observation_id":"af398f6b-33f5-4362-92d1-3dc7512643f2","resolution":{"observed_at":"2026-08-12T18:45:47.388685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18703","last_updated":"2024-03-29T14:05:07Z","snapshot_observed_at":"2026-08-13T11:29:52.204008Z","submitted_at":"2023-05-30T03:00:30Z","title":"Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18703","snapshot_observed_at":"2026-08-12T18:45:47.392578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.392578Z"},"links":{"cited_paper":"/paper/2305.18703","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:c30533960a58c10ce08646a63707971652a210b4ff8a235bce4e5fccab4ff2a3","observation_id":"4ccd94f2-71d0-40b4-9a6c-c400eed6ac19","resolution":{"observed_at":"2026-08-12T18:45:47.392578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-13T04:08:35.663182Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-12T18:45:47.396379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.396379Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:624d15db5d98c45aaa5f7a1d10f579b952b17d38a9da976ebbb385bda8672dcb","observation_id":"37096026-1430-4e0c-8202-edc335fd51ae","resolution":{"observed_at":"2026-08-12T18:45:47.396379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-08-13T11:37:07.444877Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-12T18:45:47.400107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.400107Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:063f6a98841193c1b752e6b78966b47def4a0ae96bc73edc761dfd61a646497b","observation_id":"52887b6f-242a-42ba-a6a8-527b283ffe2f","resolution":{"observed_at":"2026-08-12T18:45:47.400107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.904364Z","title":null,"venue":null,"work_id":"ab84c2d8-c40e-4e84-9b4f-d967bad5e210","year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.404147Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:4aa62a20374066a803921bb4b8a2586cab17d9eec9c85b9c8ed205b24794cef6","observation_id":"a0afc553-5248-47f1-8675-99c78764db6e","resolution":{"observed_at":"2026-08-12T18:45:47.907757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-12T18:45:47.408142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.408142Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:11d2614aecf834fcdb263b9f7318fa1c126076055215e9992bb973ebdc098542","observation_id":"4a0dba26-7c89-486b-91b2-1df0765b4655","resolution":{"observed_at":"2026-08-12T18:45:47.408142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.411968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.411968Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1e1a6b3bb02331c362bd750003b04eb9215c752c87654fadde4dd5f527eba145","observation_id":"db0e676f-f173-4203-8376-45b5f9a53136","resolution":{"observed_at":"2026-08-12T18:45:47.411968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-13T00:35:36.874116Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-12T18:45:47.415474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.415474Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1f795b9e6a835a8381f3db309dbc4a96548ba25dd23d38531e893d7fe58fc699","observation_id":"c4a4a7a2-4d5d-4754-a317-017caa9419c0","resolution":{"observed_at":"2026-08-12T18:45:47.415474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-12T18:45:47.418939Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.418939Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:f36f324d05675ac8b4b5228ff280a86e65751f9fdac8b4df8914a376f12e1bbf","observation_id":"8a99f2ae-5b13-4e08-90b5-ef4151953a8b","resolution":{"observed_at":"2026-08-12T18:45:47.418939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.422041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.422041Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:1a7477b48f8041c50036509aa87426bc086691f2dcb76559bd2e18afdba4014e","observation_id":"115cdbb7-6edb-4bc4-9cf9-7979d9badd47","resolution":{"observed_at":"2026-08-12T18:45:47.422041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13086","last_updated":"2024-01-23T20:55:49Z","snapshot_observed_at":"2026-08-13T04:35:58.770389Z","submitted_at":"2024-01-23T20:55:49Z","title":"Towards Trustable Language Models: Investigating Information Quality of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13086","snapshot_observed_at":"2026-08-12T18:45:47.424969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.424969Z"},"links":{"cited_paper":"/paper/2401.13086","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:5a99870ddfe6cb2819fc73522c562edd0dffe37bc9e1c1c272969c1f4f2f1df3","observation_id":"ba007ee1-7879-4889-8ecc-81f8c819e6ee","resolution":{"observed_at":"2026-08-12T18:45:47.424969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-13T04:18:39.535968Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-12T18:45:47.427739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.427739Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:dadc81c33e1fe6c6f836d31f813bf56c5d816bc255677e314f3e668e8855f805","observation_id":"c3d4efd7-58b9-4bca-be02-88d5c24569b8","resolution":{"observed_at":"2026-08-12T18:45:47.427739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-13T10:09:46.005593Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-12T18:45:47.431927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.431927Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:ec1dfc803e1984d679cdf7a1c6dccd8807b6460f3666731d45d1db156469ddc9","observation_id":"8d292b3c-475e-4d4a-95d0-54bfb8352ec4","resolution":{"observed_at":"2026-08-12T18:45:47.431927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:45:47.435174Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.435174Z"},"links":{"citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:d6a957225be49217e72a8bdc66de46722f8468479464cc6918396efefc1287b3","observation_id":"ace21aff-d788-466c-b759-b0916ab20317","resolution":{"observed_at":"2026-08-12T18:45:47.435174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05558","last_updated":"2022-07-27T17:26:18Z","snapshot_observed_at":"2026-08-09T15:45:49.951754Z","submitted_at":"2020-07-10T18:26:17Z","title":"The Computational Limits of Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05558","snapshot_observed_at":"2026-08-12T18:45:47.438429Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.438429Z"},"links":{"cited_paper":"/paper/2007.05558","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:ba3c09f0dfa86f76ea44e63428f6ee084fc32b796e49f033f9ed98c854f43242","observation_id":"3cab4dd2-992a-49d9-9ce9-52b24aa345f8","resolution":{"observed_at":"2026-08-12T18:45:47.438429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07922","last_updated":"2024-07-16T06:37:43Z","snapshot_observed_at":"2026-08-14T04:18:31.813386Z","submitted_at":"2024-04-11T17:09:28Z","title":"LaVy: Vietnamese Multimodal Large Language Model","version":6},"cited_work":{"arxiv_id":"2404.07922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07922","snapshot_observed_at":"2026-08-12T18:45:47.534154Z","title":"LaVy: Vietnamese Multimodal Large Language Model","venue":"cs.CL","work_id":"7c1f0cc0-ddd7-4f40-8d10-e8c9a0685159","year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.441989Z"},"links":{"cited_paper":"/paper/2404.07922","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:a052bba038d7ce2c167a2c0ce8f2e809b8cc92453fde52f910409c8e36107811","observation_id":"e22af3df-990c-46e8-853a-605afbf5b485","resolution":{"observed_at":"2026-08-12T18:45:47.539891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-12T18:45:47.445614Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.445614Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:7c53da9f7414ad9903626cbfb06f84758fc57ad0d6334aa75cf216372e01119f","observation_id":"056c7337-fd3a-4750-b319-ba5022c4b0e8","resolution":{"observed_at":"2026-08-12T18:45:47.445614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T18:45:47.449325Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.449325Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:0991536a16b04131dcd405235f43023d8bec5d4126bb1686febe09da05c9b014","observation_id":"7484a543-0137-4b88-b206-5367299cfeff","resolution":{"observed_at":"2026-08-12T18:45:47.449325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18815","last_updated":"2024-11-10T12:49:15Z","snapshot_observed_at":"2026-08-14T09:34:14.564617Z","submitted_at":"2024-02-29T02:55:26Z","title":"How do Large Language Models Handle Multilingualism?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18815","snapshot_observed_at":"2026-08-12T18:45:47.452845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.452845Z"},"links":{"cited_paper":"/paper/2402.18815","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:e31b5c1dbb84085dffdb7084aacce4fdeedbb0ce10520404e1387a52dd399297","observation_id":"bbcbf633-7451-4458-907c-cdfd33e8a7aa","resolution":{"observed_at":"2026-08-12T18:45:47.452845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-13T10:08:28.290453Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-12T18:45:47.456648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T18:45:47.456648Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2411.11289"},"observation_digest":"sha256:54da999504459e6923ce0ca517bc18556bbeabfc7d2c14e19e74481027008fcd","observation_id":"6f51b415-8845-43ba-bc12-264b5b970d3e","resolution":{"observed_at":"2026-08-12T18:45:47.456648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11289","last_updated":"2024-11-18T05:17:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T01:17:30.026997Z","submitted_at":"2024-11-18T05:17:27Z","title":"LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2411.11289."}