{"as_of":"2026-08-09T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c40eb8a65ef788af88257d263ba678104b1dde7903ea5846d3e4e4de25ef856e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:43.774684Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T04:32:34.075914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2502.02970","last_updated":"2026-04-02T13:28:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T08:11:23Z","title":"Distributional Statistics Restore Training Data Auditability in One-step Distilled Diffusion Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:27:59.317818Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2502.02970"},"observation_digest":"sha256:c722b922811fb932d8a323ee4f5701e72bf7adeb183cb7d2f5dd94407d35b6df","observation_id":"0f976c4b-981b-4d12-80a9-d981826a6eb3","resolution":{"observed_at":"2026-05-23T04:32:34.080255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T15:27:43.774684Z","title":"Datasets for large language models: A comprehensive survey.arXiv preprint arXiv:2402.18041, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15859","last_updated":"2025-05-21T04:32:35Z","snapshot_observed_at":"2026-08-07T15:21:59.167327Z","submitted_at":"2025-05-21T04:32:35Z","title":"AutoData: A Multi-Agent System for Open Web Data Collection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:43.774684Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2505.15859"},"observation_digest":"sha256:aeb31f3d8242451787d02fb0daa12d8a57d8189cd0619055902f6dd8e5f3c27c","observation_id":"fb1b238b-7c38-4c83-a1be-ad3ad378718b","resolution":{"observed_at":"2026-08-07T15:27:43.774684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T12:25:31.066357Z","title":"Datasets for large language models: A comprehensive survey.arXiv preprint arXiv:2402.18041, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24539","last_updated":"2026-07-28T16:02:36Z","snapshot_observed_at":"2026-08-07T14:30:36.260777Z","submitted_at":"2025-05-30T12:46:44Z","title":"Localizing Persona Representations in LLMs","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:31.066357Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2505.24539"},"observation_digest":"sha256:ebd2321b9c2b7e2e7cb7154ec63adeff77ce0ddff9c2d673a4e66c6f0b668f21","observation_id":"cb92fe2c-4ac6-40ad-bdab-9b7a0f4eabff","resolution":{"observed_at":"2026-08-07T12:25:31.066357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T12:11:04.838038Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00309","last_updated":"2025-06-28T05:54:45Z","snapshot_observed_at":"2026-08-07T23:21:38.558900Z","submitted_at":"2025-05-30T23:37:37Z","title":"Evaluation of LLMs for mathematical problem solving","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:04.838038Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.00309"},"observation_digest":"sha256:c09eb8abc0d245aa13f290e1cf03381bdbd9540281894f59bc2c6b83b3551487","observation_id":"d0fe05dd-d75b-4337-905d-ca5461442db7","resolution":{"observed_at":"2026-08-07T12:11:04.838038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T05:33:55.977344Z","title":"Datasets for Large Language Models: A Comprehensive Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07647","last_updated":"2025-06-09T11:12:02Z","snapshot_observed_at":"2026-08-09T01:43:01.712948Z","submitted_at":"2025-06-09T11:12:02Z","title":"Foundation Model Empowered Synesthesia of Machines (SoM): AI-native Intelligent Multi-Modal Sensing-Communication Integration","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:55.977344Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.07647"},"observation_digest":"sha256:2d6be58ee2634c857cec9b5b6876faa551684e543d108fba7d8d4c871b4293cc","observation_id":"375a210b-b22c-46b5-8869-9ae8426d6592","resolution":{"observed_at":"2026-08-07T05:33:55.977344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-07T04:55:42.760418Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09433","last_updated":"2025-06-11T06:30:28Z","snapshot_observed_at":"2026-08-09T05:55:16.389343Z","submitted_at":"2025-06-11T06:30:28Z","title":"Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:55:42.760418Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.09433"},"observation_digest":"sha256:3fffa094ff048a1822d2070d06e31f94164dd631a8dc298637e1142f0be91547","observation_id":"67619092-df70-44c0-b895-3063f98c542f","resolution":{"observed_at":"2026-08-07T04:55:42.760418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T23:25:49.043762Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:49.043762Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:f3293a3d51d10056302fac394d3a9f0ee3d62c327978b70e68bd2515ac175025","observation_id":"77577b03-da1b-45f3-806a-ebeccf02e3a6","resolution":{"observed_at":"2026-08-06T23:25:49.043762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T23:21:49.646197Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18424","last_updated":"2025-06-23T09:03:58Z","snapshot_observed_at":"2026-08-06T23:13:41.192741Z","submitted_at":"2025-06-23T09:03:58Z","title":"A Large Language Model-based Multi-Agent Framework for Analog Circuits' Sizing Relationships Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:21:49.646197Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.18424"},"observation_digest":"sha256:cb1c72b33244c637763233aa141f2ce4315e6877c8cabbaaf956082b1b0207f9","observation_id":"b0584a03-dbc9-4e19-8ecd-92da544a51d2","resolution":{"observed_at":"2026-08-06T23:21:49.646197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T21:36:39.625714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":229,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:39.625714Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:eba1840a58b809d53a35b96214e60bb24f129360274f5d501d643d96dc5eaa0d","observation_id":"23baa925-f007-469d-8a7b-8759085cd13c","resolution":{"observed_at":"2026-08-06T21:36:39.625714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T19:25:23.494844Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05716","last_updated":"2025-07-08T06:59:58Z","snapshot_observed_at":"2026-08-06T19:17:24.335490Z","submitted_at":"2025-07-08T06:59:58Z","title":"Divergent Realities: A Comparative Analysis of Human Expert vs. Artificial Intelligence Based Generation and Evaluation of Treatment Plans in Dermatology","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:23.494844Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2507.05716"},"observation_digest":"sha256:c8ba2f719e0b6b8450abb4ad4eb823f68f5f9f723ec8fd35d90ebddab7cf6dd1","observation_id":"26501f17-f403-4565-861e-e1f530ac2be2","resolution":{"observed_at":"2026-08-06T19:25:23.494844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T15:15:20.243366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16414","last_updated":"2025-07-22T10:05:30Z","snapshot_observed_at":"2026-08-08T15:54:04.046664Z","submitted_at":"2025-07-22T10:05:30Z","title":"Identifying Pre-training Data in LLMs: A Neuron Activation-Based Detection Framework","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:15:20.243366Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2507.16414"},"observation_digest":"sha256:f968369f4a29e9c969e9750341b2cc7df15b08d13d838ae8c58551e15ec42ed0","observation_id":"ad3912c7-80c3-47f6-90b1-1d3898063494","resolution":{"observed_at":"2026-08-06T15:15:20.243366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-04T05:55:44.707849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05637","last_updated":"2026-08-03T15:19:02Z","snapshot_observed_at":"2026-08-07T17:01:33.563160Z","submitted_at":"2026-03-05T19:47:26Z","title":"Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T05:55:44.707849Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2603.05637"},"observation_digest":"sha256:ab0ca91d9b45ed39c920533a33796314c93ce0b1b493df64686d9aadc3428035","observation_id":"33ce7cc0-72a5-41a7-867e-2bc3bb6b47e1","resolution":{"observed_at":"2026-08-04T05:55:44.707849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2604.19438","last_updated":"2026-04-21T13:12:42Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T13:12:42Z","title":"Malicious ML Model Detection by Learning Dynamic Behaviors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:55.161515Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2604.19438"},"observation_digest":"sha256:4d586847b50a959296006086f097f7083c5982db30ea169e6adc096eac2f06aa","observation_id":"b393873d-4cd6-40de-a4b4-4de49dc2909b","resolution":{"observed_at":"2026-05-11T12:51:03.363201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:f3dbe211c040e5762bd75c3c355335a47271bd949a8a5975698a383843508f14","observation_id":"bdea102a-4aa4-4a5e-acf9-e1b399d8214e","resolution":{"observed_at":"2026-05-11T22:01:10.987371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:698402147b16d506c798af2c358777c073e8c944f7ea373f49ea7aff2cb91013","observation_id":"86d40402-f96a-48bd-abc2-34c39d8544e4","resolution":{"observed_at":"2026-05-11T17:26:04.548339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2402.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":"16060ca6-3459-45ee-90fe-9ceadb748e8f","year":2024},"citing_paper":{"arxiv_id":"2605.06423","last_updated":"2026-05-07T15:29:10Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:29:10Z","title":"Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T09:14:12.034025Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2605.06423"},"observation_digest":"sha256:60958ef593ba00a5493e2347f6b523ce241782c5a929f6cef9843578c69120a0","observation_id":"08d6aad8-1c08-43e9-a6c2-f493cdb13f70","resolution":{"observed_at":"2026-05-11T20:26:09.080186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-01T07:28:29.454905Z","title":"arXiv preprint arXiv:2402.18041 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:29.454905Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:557aaede73332fee551fa7c766aed201682fa3353b0218916111e691269b19c7","observation_id":"e248ba49-07ae-47db-b062-3552b36a2e01","resolution":{"observed_at":"2026-08-01T07:28:29.454905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T00:40:13.871444Z","title":"Datasets for large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00932","last_updated":"2026-08-02T02:17:10Z","snapshot_observed_at":"2026-08-07T03:44:17.791751Z","submitted_at":"2026-08-02T02:17:10Z","title":"Gaokerena: A Small Persian Medical Language Model Family","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:13.871444Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2608.00932"},"observation_digest":"sha256:f9dabb57959c6a4f526d71c1c6c6bea6048b36a8efd1603c398225768682404b","observation_id":"f8b5e71b-1dc6-42ee-9796-81902c30e167","resolution":{"observed_at":"2026-08-06T00:40:13.871444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-06T14:54:47.881669Z","title":"Datasets for large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04854","last_updated":"2026-08-05T13:47:59Z","snapshot_observed_at":"2026-08-08T23:13:18.685740Z","submitted_at":"2026-08-05T13:47:59Z","title":"Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:47.881669Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2608.04854"},"observation_digest":"sha256:14498958718aac38e85d7dd41af8fd6b33e275f7522cd458743c3540beb7e67b","observation_id":"62a5a337-ebd3-4d5c-93d6-aabf8366a5b3","resolution":{"observed_at":"2026-08-06T14:54:47.881669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.18041/citation-record","integrity":"/paper/2402.18041/integrity","json":"/paper/2402.18041/citation-record.json","paper":"/paper/2402.18041"},"outbound":[],"paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:36:36.437597Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2402.18041."}