{"as_of":"2026-08-17T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28b368b538683466eee6927d293e21af18c9c751bc26118771ce87534e1abe37","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:34:53.589828Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:29:44.273599Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:39:46.610216Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12427","snapshot_observed_at":"2026-08-07T10:29:44.273599Z","title":"Position: The most expensive part of an llm should be its training data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:44.273599Z"},"links":{"cited_paper":"/paper/2504.12427","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:3385e2e136d63cf1c9057b1f28b4c7c72a6a7fce4829563d9d944d4b4bd96351","observation_id":"179fac02-40ff-4f0c-a983-85f16f6422af","resolution":{"observed_at":"2026-08-07T10:29:44.273599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"cited_work":{"arxiv_id":"2504.12427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12427","snapshot_observed_at":"2026-07-04T11:39:46.610216Z","title":"and Raffel, C","venue":null,"work_id":"cef4cbe6-0e27-48b6-a4eb-db8b2dfc072b","year":2025},"citing_paper":{"arxiv_id":"2603.09046","last_updated":"2026-07-01T17:06:07Z","snapshot_observed_at":"2026-08-15T00:33:57.336764Z","submitted_at":"2026-03-10T00:31:25Z","title":"FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T14:21:53.325788Z"},"links":{"cited_paper":"/paper/2504.12427","citing_paper":"/paper/2603.09046"},"observation_digest":"sha256:3ed933cf7f6ffa78937f558d61d2cd34652552cc5ac52697a7f7d6507e82db2e","observation_id":"7895a035-1447-469b-a995-8b83e5474abe","resolution":{"observed_at":"2026-05-15T14:25:55.503750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12427","snapshot_observed_at":"2026-07-15T12:17:47.123519Z","title":"Position: The most expensive part of an llm should be its training data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.09046","last_updated":"2026-07-01T17:06:07Z","snapshot_observed_at":"2026-08-15T00:33:57.336764Z","submitted_at":"2026-03-10T00:31:25Z","title":"FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T12:17:47.123519Z"},"links":{"cited_paper":"/paper/2504.12427","citing_paper":"/paper/2603.09046"},"observation_digest":"sha256:0fdbefbb74503744a7cbc69f33d786c1d5e30ee9d6d15e98648c21bfbd85399f","observation_id":"de189bdf-7b49-496d-8753-7ab89b8483e5","resolution":{"observed_at":"2026-07-15T12:17:47.123519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"cited_work":{"arxiv_id":"2504.12427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12427","snapshot_observed_at":"2026-07-04T11:39:46.610216Z","title":"and Raffel, C","venue":null,"work_id":"cef4cbe6-0e27-48b6-a4eb-db8b2dfc072b","year":2025},"citing_paper":{"arxiv_id":"2605.15520","last_updated":"2026-05-15T01:34:55Z","snapshot_observed_at":"2026-08-15T03:49:13.229897Z","submitted_at":"2026-05-15T01:34:55Z","title":"On the Fragility of Data Attribution When Learning Is Distributed","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T15:16:32.125215Z"},"links":{"cited_paper":"/paper/2504.12427","citing_paper":"/paper/2605.15520"},"observation_digest":"sha256:b7fb73e612b3a3a3eab9731016d623fdd4cf80867f1e60a612bb40902640bbb6","observation_id":"f2438a06-593e-4df0-9cc9-bd8ff63152eb","resolution":{"observed_at":"2026-05-19T15:17:39.452630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"cited_work":{"arxiv_id":"2504.12427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12427","snapshot_observed_at":"2026-07-04T11:39:46.610216Z","title":"and Raffel, C","venue":null,"work_id":"cef4cbe6-0e27-48b6-a4eb-db8b2dfc072b","year":2025},"citing_paper":{"arxiv_id":"2606.23370","last_updated":"2026-07-01T17:07:48Z","snapshot_observed_at":"2026-07-06T23:58:07.236199Z","submitted_at":"2026-06-22T14:05:51Z","title":"FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T07:52:24.053501Z"},"links":{"cited_paper":"/paper/2504.12427","citing_paper":"/paper/2606.23370"},"observation_digest":"sha256:312aedfef5cd174fbc097e74e618013a1e41f3e54ce5c2b173c55a49477da066","observation_id":"fc6c92ef-bb74-4ea7-8367-1d7781beffa3","resolution":{"observed_at":"2026-07-04T11:39:46.611909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12427/citation-record","integrity":"/paper/2504.12427/integrity","json":"/paper/2504.12427/citation-record.json","paper":"/paper/2504.12427"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.218450Z","title":"https://huggingface.co/collections/r-three/common-pile-665a13e48528df6b00416dc0, 2025","venue":null,"work_id":"baa2719a-a064-47ca-99fa-970bb6f7f3c4","year":2025},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.416080Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:79f99a030fab5a52d56d741172acc00b42944af7c64e850b08b850ae307ee19c","observation_id":"6ffee95a-85f2-44e2-8647-575ce81577e8","resolution":{"observed_at":"2026-08-16T12:34:54.222109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T12:34:53.420387Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, H., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.420387Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:5885b20f0ed73889963570fbffa6969e3489d4b9032a189c0c6fc9eb1f209f04","observation_id":"c0836bd0-436d-4232-a7b5-5f1de43df576","resolution":{"observed_at":"2026-08-16T12:34:53.420387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-16T12:34:53.424961Z","title":"J., Javaheripi, M., Kauffmann, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.424961Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:1280967d77d782a95b92a25aa8eb735bfa8881e30005f24254eb726b87a50b90","observation_id":"29a1ac42-8e9a-48f9-bc48-2966b1f50e70","resolution":{"observed_at":"2026-08-16T12:34:53.424961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"com/1831000","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:53.970334Z","title":"Alden newspapers v","venue":null,"work_id":"62edded5-68d6-4057-8cce-8223fdd70251","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.429188Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:5652019cdb0f4d3d4e6bcabd9288644426e289021f15a40f027b44b956d9d8de","observation_id":"94a2aa78-8802-47da-b446-a0bfd1abc6e2","resolution":{"observed_at":"2026-08-16T12:34:53.976485Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:53.433029Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.433029Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:900a9acd878486d808addd59e2195871c70544d4978241671ace3ef6ef5b0882","observation_id":"60d5f8ad-9b5f-4da0-bfcd-50cdfb622b42","resolution":{"observed_at":"2026-08-16T12:34:53.433029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.202869Z","title":"Authors guild v","venue":null,"work_id":"a76b65f0-5110-46be-ac11-ff549c191111","year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.437311Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:969951bb795b3e23415228060af1606beae6e64333027a9ba4f813f3ee49562a","observation_id":"7adfd76b-b4c3-45f7-b7cc-788c976aecab","resolution":{"observed_at":"2026-08-16T12:34:54.206262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13954","last_updated":"2024-05-22T19:39:05Z","snapshot_observed_at":"2026-08-16T13:50:29.559994Z","submitted_at":"2024-05-22T19:39:05Z","title":"What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13954","snapshot_observed_at":"2026-08-16T12:34:53.441434Z","title":"K., Ahn, H., Bae, J., Zhao, K., Kang, M., Chung, Y., Pratapa, A., Neiswanger, W., Strubell, E., Mitamura, T., Schneider, J., Hovy, E., Grosse, R., and Xing, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.441434Z"},"links":{"cited_paper":"/paper/2405.13954","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b072f0e9f461e8340d0a8a4ad2c7d26753e46fb193737d8f2705e992053fb79a","observation_id":"72bb5d94-82ea-4e6d-abb9-10b563348510","resolution":{"observed_at":"2026-08-16T12:34:53.441434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.193603Z","title":"Common crawl dataset","venue":null,"work_id":"784b2f54-36a7-4707-80e8-ffcc49d93de5","year":2025},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.445464Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:417cc43ea2f97bfc65bf6c8480734d3462af237422f3cda7456ac3efc42ef1f5","observation_id":"558c1ceb-306d-4caa-86a9-1ef6e5f74c7d","resolution":{"observed_at":"2026-08-16T12:34:54.196771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.184033Z","title":"Concord music group v","venue":null,"work_id":"2b56d6ec-7ce5-490b-a8a4-636a85a5a330","year":null},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.449194Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:92d9685a3079f2cfbd93bb88437738b5a12715fb2322b8d5c1b4b5fbc7d38ff1","observation_id":"3518d52d-387a-4a8d-9541-f23ebcd8f2f9","resolution":{"observed_at":"2026-08-16T12:34:54.187530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21015","last_updated":"2025-02-07T23:27:07Z","snapshot_observed_at":"2026-08-16T13:47:20.570866Z","submitted_at":"2024-05-31T17:04:18Z","title":"The rising costs of training frontier AI models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21015","snapshot_observed_at":"2026-08-16T12:34:53.452722Z","title":"The rising costs of training frontier ai models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.452722Z"},"links":{"cited_paper":"/paper/2405.21015","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:bbe69cdca34e8247b709d05e2a97fe8e181edd3a96596e73861e11c7cf523b8f","observation_id":"252eac39-7388-4717-be9e-6a70a8dc6d8e","resolution":{"observed_at":"2026-08-16T12:34:53.452722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.174070Z","title":"Ai is a lot of work","venue":null,"work_id":"2f285beb-9ddf-447b-a002-be8887d3a7a9","year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.457066Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:f76c17022770657c43043c3e12667cdae8dc21277340980dbae1c6f1e1b2183b","observation_id":"cbefb914-e2ca-4d11-93c0-b8d709d75485","resolution":{"observed_at":"2026-08-16T12:34:54.177432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.163920Z","title":"Encyclopedia britannica 15th edition","venue":null,"work_id":"9ba8b00b-c648-4339-a1d5-74dd6cbf1a27","year":null},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.460931Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:2d46d03f9d0284902a786c3c56ca9b0a601833494ebcc74a7a288c710423271f","observation_id":"0b9777a9-53d8-4c17-988e-4a47343008d5","resolution":{"observed_at":"2026-08-16T12:34:54.167706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.154532Z","title":"Data on notable ai models, 2024","venue":null,"work_id":"9e71e9f5-7626-4f0f-b244-6bad6263a126","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.464492Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b75cc6a84d3d996926cf8ca3d0e205adf2a622bbf8145809befac05ef851df95","observation_id":"9ac7fb88-d47c-487b-9be8-f0936f3ab916","resolution":{"observed_at":"2026-08-16T12:34:54.157863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-08-16T15:37:17.617814Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-16T12:34:53.468171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.468171Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:e6ee44551355bb7113880b84ccc28cc9c2e440fbc3a65619413e7c13e6564216","observation_id":"c957d152-6d94-4247-b56b-21a7ecc89e37","resolution":{"observed_at":"2026-08-16T12:34:53.468171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-08-16T14:10:11.362149Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-16T12:34:53.471844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.471844Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:a95cc5518abd5a766912414108ad908744dd085ddbe94763674f8ad423fab7bb","observation_id":"01f09962-6c0c-46ab-a7ef-e7905f4ce083","resolution":{"observed_at":"2026-08-16T12:34:53.471844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02868","last_updated":"2019-06-10T08:10:40Z","snapshot_observed_at":"2026-08-14T16:51:23.660248Z","submitted_at":"2019-04-05T04:54:10Z","title":"Data Shapley: Equitable Valuation of Data for Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02868","snapshot_observed_at":"2026-08-16T12:34:53.475484Z","title":"and Zou, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.475484Z"},"links":{"cited_paper":"/paper/1904.02868","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:82d3a55aafa1b9415f4c61127a883b6e959042a52396debf497c9cf6c70e18bb","observation_id":"cba7a639-6920-48ad-a543-dbde1f5b53a7","resolution":{"observed_at":"2026-08-16T12:34:53.475484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04528","last_updated":"2021-03-22T22:15:53Z","snapshot_observed_at":"2026-08-16T21:43:34.304734Z","submitted_at":"2020-06-08T12:39:46Z","title":"Evaluation of Similarity-based Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04528","snapshot_observed_at":"2026-08-16T12:34:53.479173Z","title":"Evaluation of similarity-based explanations, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.479173Z"},"links":{"cited_paper":"/paper/2006.04528","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:5e977d7b53181eaab64dd56dd43a7783672a0784bca2ab48a6f7ac091075208c","observation_id":"03d72fee-497e-469b-a1cd-5e46266b1faa","resolution":{"observed_at":"2026-08-16T12:34:53.479173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T12:34:53.482888Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.482888Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:cbd05e2e0ca914bf2c209cfd1720a689e1a39bc7d7bc708d99bd7e4ec822bc83","observation_id":"95e6842e-d01d-40fb-95c2-875558897655","resolution":{"observed_at":"2026-08-16T12:34:53.482888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.144460Z","title":"Statistics on wages","venue":null,"work_id":"8fc8d8f5-c9dc-40e5-9796-009aac22786a","year":2025},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.487229Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:7c0fbcc87a658022aee70d67a7734c8d7444f9b1d91eca509bcc2153b3ed9683","observation_id":"e0e7818b-ac76-4f46-a3a7-5c125e939bf3","resolution":{"observed_at":"2026-08-16T12:34:54.147863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T12:34:53.490580Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.490580Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:205a0d3b639e40be97bd98e1c3426aa45b4d5fa8f35b2885129c69a4fe2e0d18","observation_id":"6bad627c-5881-4537-af10-2065619543c6","resolution":{"observed_at":"2026-08-16T12:34:53.490580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04730","last_updated":"2020-12-29T22:40:43Z","snapshot_observed_at":"2026-08-15T02:28:36.697260Z","submitted_at":"2017-03-14T21:07:01Z","title":"Understanding Black-box Predictions via Influence Functions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04730","snapshot_observed_at":"2026-08-16T12:34:53.494514Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.494514Z"},"links":{"cited_paper":"/paper/1703.04730","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:5a58d1a492876a2d95d9e9c7273404a5391d563bd1130b9f32874760cab86630","observation_id":"b779aefe-5e3e-4bf2-9355-d243a13effb7","resolution":{"observed_at":"2026-08-16T12:34:53.494514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-16T15:40:20.636325Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-16T12:34:53.498197Z","title":"M., Stanley, O., Nagyfi, R., ES, S., Suri, S., Glushkov, D., Dantuluri, A., Maguire, A., Schuhmann, C., Nguyen, H., and Mattick, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.498197Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:9f0ef6ceced7937fb2def3d7f08b335ab2ca7f05c350c0c5cac69dbed145d1fe","observation_id":"dc20d4d5-255e-42cc-80ea-f82e155d7c85","resolution":{"observed_at":"2026-08-16T12:34:53.498197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.134446Z","title":"Releasing Common Corpus: the largest public domain dataset for training LLMs","venue":null,"work_id":"cb619555-70cc-41e8-b667-71ca024f0a9e","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.501877Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:93682b1848d9563f134802c57901580d3b0a970e81b5d121cd63e2104f46ee53","observation_id":"2d526e30-7940-40ee-9d3b-5bf491476136","resolution":{"observed_at":"2026-08-16T12:34:54.138207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-16T12:34:53.505422Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.505422Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:80d529077c08dfb0771183234075187c05f39bd1a9291f887f8e5fa3935fec98","observation_id":"b173a557-7554-43ba-9c09-4b38c6b0d91f","resolution":{"observed_at":"2026-08-16T12:34:53.505422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14933","last_updated":"2024-07-24T16:52:51Z","snapshot_observed_at":"2026-08-16T13:32:27.834484Z","submitted_at":"2024-07-20T16:50:18Z","title":"Consent in Crisis: The Rapid Decline of the AI Data Commons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14933","snapshot_observed_at":"2026-08-16T12:34:53.509363Z","title":"M., Zhou, X., Li, Y., Xiong, C., Villa, L., Biderman, S., Li, H., Ippolito, D., Hooker, S., Kabbara, J., and Pentland, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.509363Z"},"links":{"cited_paper":"/paper/2407.14933","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:57645ed96cf441eaa37a436baf6df575dba951092aca01819e68891ad49371eb","observation_id":"589d0d14-d539-4794-a32c-62452bcf0ab2","resolution":{"observed_at":"2026-08-16T12:34:53.509363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04430","last_updated":"2024-07-31T02:15:31Z","snapshot_observed_at":"2026-08-16T15:09:53.447500Z","submitted_at":"2023-08-08T17:58:15Z","title":"SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04430","snapshot_observed_at":"2026-08-16T12:34:53.513176Z","title":"A., and Zettlemoyer, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.513176Z"},"links":{"cited_paper":"/paper/2308.04430","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b3676d22dc83dbfc8869f9c4beb01e4878fd2af0b618d57a4eb9bc3cba9d67ef","observation_id":"b9175506-313c-4a0e-88e3-645e166e0898","resolution":{"observed_at":"2026-08-16T12:34:53.513176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.124186Z","title":"AI models that cost \\ 1 billion to train are underway, \\ 100 billion models coming — largest current models take “only” \\ 100 million to train: Anthropic CEO","venue":null,"work_id":"4bee62a2-7d73-4e7b-948b-40bd4c83eba4","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.516963Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b3ef6033ab9adc67d58acb06628abd28fa19cac5abafcbb19f0b991d2955500c","observation_id":"50021800-f7b3-4840-8bfa-76e96383ddf3","resolution":{"observed_at":"2026-08-16T12:34:54.128186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-16T12:34:53.520465Z","title":"M., Barak, B., Scao, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.520465Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b599bfc314781376968e3adc2b40aa434ecddcf115c0d26d070503d153dce003","observation_id":"34d09960-edb5-43cd-87e2-dfe3162eaac7","resolution":{"observed_at":"2026-08-16T12:34:53.520465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.113923Z","title":"New york times v","venue":null,"work_id":"d5a87f02-0eb5-41ff-a3bb-b113bc33744a","year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.524159Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:1dd602b462eaf58a3331b225a4a92fb759b212cdfdaafcd0455ff13dd9689b0f","observation_id":"51e8f85b-56e4-42ca-806b-f3d77227f000","resolution":{"observed_at":"2026-08-16T12:34:54.117493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14186","last_updated":"2023-04-03T17:37:50Z","snapshot_observed_at":"2026-08-16T15:45:33.214205Z","submitted_at":"2023-03-24T17:56:22Z","title":"TRAK: Attributing Model Behavior at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14186","snapshot_observed_at":"2026-08-16T12:34:53.527627Z","title":"M., Georgiev, K., Ilyas, A., Leclerc, G., and Madry, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.527627Z"},"links":{"cited_paper":"/paper/2303.14186","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b1cec388942c2f081690798bd99c04f9f5a06a3fff297b90b844cab092170535","observation_id":"42b77bc3-054d-4116-bc9e-b719feca545f","resolution":{"observed_at":"2026-08-16T12:34:53.527627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.103776Z","title":null,"venue":null,"work_id":"169c8a65-70cd-4c87-a93b-acb9263016c6","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.531585Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:8320d0ac37203b253743c9fddb2db592c414680020f86c715de1e034b6ac2d85","observation_id":"1c16cddf-21d2-4a9b-abad-7c7caead9e09","resolution":{"observed_at":"2026-08-16T12:34:54.107235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.093397Z","title":"Multiple ai companies bypassing web standard to scrape publisher sites, licensing firm says","venue":null,"work_id":"4bec0907-c3d6-4e11-80fd-2fd32b0eb574","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.535354Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:d1fccd0dbf2c75deb19974593e79019c62d3ac11a1025944cbbd3f40b4c9f30d","observation_id":"4e90d540-21fa-4d3f-a022-c765ce57d782","resolution":{"observed_at":"2026-08-16T12:34:54.096999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-16T12:34:53.538809Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.538809Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:94d61810b8ffbd4d82be928be55a1d32c683262da6338031678fff44c86db760","observation_id":"6bc0e423-6cf3-4234-9b54-9de913a1b9e9","resolution":{"observed_at":"2026-08-16T12:34:53.538809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08484","last_updated":"2020-11-14T18:47:35Z","snapshot_observed_at":"2026-08-17T13:05:26.793779Z","submitted_at":"2020-02-19T22:40:32Z","title":"Estimating Training Data Influence by Tracing Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08484","snapshot_observed_at":"2026-08-16T12:34:53.542296Z","title":"Estimating training data influence by tracing gradient descent, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.542296Z"},"links":{"cited_paper":"/paper/2002.08484","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:574022a713d096a26879eb58e5e0c23fefb505b77a1cd143961d55df8819e313","observation_id":"117ed8c8-2b11-4ca1-9282-57fa9ad774a7","resolution":{"observed_at":"2026-08-16T12:34:53.542296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.082929Z","title":"Reddit and openai build partnership","venue":null,"work_id":"5598288d-e3c6-4d17-b021-6f542cac5c51","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.546327Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:062295eddb0d9bba8daab094df7c012e8dedd008d682017c62476772ffb6b4a1","observation_id":"8f50bfd0-16cd-479b-85d2-b1164801cce4","resolution":{"observed_at":"2026-08-16T12:34:54.086656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.072100Z","title":"Thomson reuters' adjusted eps beats expectations, ai boosts results","venue":null,"work_id":"c27b428c-e163-4a46-981d-77ec29a9d38d","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.549780Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:af55abc064033044bab8382418cb013d0a078bfebc67eb371f6d71b695230046","observation_id":"a27c7275-92b1-4929-a0ce-de699e929c1d","resolution":{"observed_at":"2026-08-16T12:34:54.075904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.060305Z","title":"Shutterstock expands partnership with openai, signs new six-year agreement to provide high-quality training data","venue":null,"work_id":"eb9f672f-24f1-47a2-b391-48b23b26ba41","year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.553071Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:c51375be51f1a8dc561c03347498e5f103d889251f4f2e466d10a9d057d0d513","observation_id":"22b3cdde-bdef-4cd2-b62d-524a157ec2fd","resolution":{"observed_at":"2026-08-16T12:34:54.064402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-16T14:22:43.864879Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-16T12:34:53.556356Z","title":"H., Kumar, S., Lucy, L., Lyu, X., Lambert, N., Magnusson, I., Morrison, J., Muennighoff, N., Naik, A., Nam, C., Peters, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.556356Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:ce86df829f2a2b6d1b68ecd2135c6ba5e15731648b6bab99d2988389273d2201","observation_id":"56e88207-67cb-4cda-b630-7c7928ad4f1e","resolution":{"observed_at":"2026-08-16T12:34:53.556356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.049085Z","title":"The atlantic announces product and content partnership with openai","venue":null,"work_id":"09a563fd-b68f-4bae-89b8-1c56166cb898","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.560435Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:faceff4e2d3242f9f7ca3d581c4e545b591dbb6aeb07c68f42c5034f77a2c112","observation_id":"5c5e27f6-786f-482f-8476-120d83c243b4","resolution":{"observed_at":"2026-08-16T12:34:54.052727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T12:34:53.563650Z","title":"Llama: Open and efficient foundation language models, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.563650Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:43df59ad028668affdd950cfc44afec7e90b8a9153e22902a104c09f2b028222","observation_id":"02da8847-5bea-46ec-90e4-ab9716fc5df4","resolution":{"observed_at":"2026-08-16T12:34:53.563650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:34:53.567083Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.567083Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:a6f1c1f0e6165a7d3ae732d0b62355ee246d287f59179dcec180cb153a2aabff","observation_id":"dde8342c-841c-44e7-9816-8d01bed89acc","resolution":{"observed_at":"2026-08-16T12:34:53.567083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-16T16:21:07.910455Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-16T12:34:53.570304Z","title":"Will we run out of data? limits of llm scaling based on human-generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.570304Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:b688f7c9199a6babaf81879aa85fdb4633fcd54aac649a0c377972e08987d490","observation_id":"cbf0bcf5-7040-43f4-ae36-73e83a968d80","resolution":{"observed_at":"2026-08-16T12:34:53.570304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.038130Z","title":"Vox media and openai form strategic content and product partnership","venue":null,"work_id":"1ee694f8-bc1e-45b7-a9fa-eadbe9339fd7","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.573730Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:4de61c33d5d6138ddba948fdba65b5984dec02d440537793771aa94fd923f48f","observation_id":"d74ac334-eff0-41e9-a858-6d7d0eb6f15b","resolution":{"observed_at":"2026-08-16T12:34:54.042052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.027229Z","title":"Html standard","venue":null,"work_id":"1ecfef5a-41f8-4eba-8f64-8d60e66d07c6","year":2025},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.576828Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:8d28b7bd43cf945b75d9b73a2538e07b0e181f93546e7c7fe082d2b3c546a7a1","observation_id":"3b58b3df-6705-40f0-bd7c-321f26fd55e5","resolution":{"observed_at":"2026-08-16T12:34:54.030794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11796","last_updated":"2023-01-27T15:52:50Z","snapshot_observed_at":"2026-08-16T15:59:41.015785Z","submitted_at":"2023-01-27T15:52:50Z","title":"Call for Papers -- The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11796","snapshot_observed_at":"2026-08-16T12:34:53.580062Z","title":"Call for papers -- the babylm challenge: Sample-efficient pretraining on a developmentally plausible corpus, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.580062Z"},"links":{"cited_paper":"/paper/2301.11796","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:4e8257e19fad66fb4d8f25a8e3a4dfddeb329426f720e6cce1f144e170fd99cf","observation_id":"78226ba2-210d-4061-9217-5374472983b3","resolution":{"observed_at":"2026-08-16T12:34:53.580062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.014907Z","title":"Breaking down emerging segments in the ai content licensing landscape","venue":null,"work_id":"8a4cd740-fd3d-4d9e-8869-79dd1dd70577","year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.583589Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:80bda6c0ba01f4d11f6ee39ec20ac039cd1f0194daf5e51b04635a5d4865a940","observation_id":"d9761ef1-9d90-41fb-b3ac-18d1a352da19","resolution":{"observed_at":"2026-08-16T12:34:54.019864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:54.003826Z","title":"Articulating value from data","venue":null,"work_id":"1838830e-268b-4cbf-8412-99dea5986cc8","year":2021},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.586790Z"},"links":{"citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:871199af915a0c11e20787c4bedf0a6067301dd4639b255cf8651e58a13ca196","observation_id":"e321c3e6-f2cd-44a7-b3d7-749b33eb06b1","resolution":{"observed_at":"2026-08-16T12:34:54.007464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01470","last_updated":"2024-05-02T17:00:02Z","snapshot_observed_at":"2026-08-17T00:12:52.305769Z","submitted_at":"2024-05-02T17:00:02Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01470","snapshot_observed_at":"2026-08-16T12:34:53.589828Z","title":"Wildchat: 1m chatgpt interaction logs in the wild, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:34:53.589828Z"},"links":{"cited_paper":"/paper/2405.01470","citing_paper":"/paper/2504.12427"},"observation_digest":"sha256:458903437671e09af904f619f9500fd58445c9e06ccc4c4c692e66374f4a4dd5","observation_id":"d301cb7b-75c5-43ff-bab2-da3c74223efc","resolution":{"observed_at":"2026-08-16T12:34:53.589828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12427","last_updated":"2025-04-16T18:56:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T14:17:32.398259Z","submitted_at":"2025-04-16T18:56:14Z","title":"Position: The Most Expensive Part of an LLM should be its Training Data"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 5 inbound Pith citation observations for arXiv:2504.12427."}