{"as_of":"2026-08-18T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3ed639bbd5eff80425d1b53f5658706593dc2f8f52047a71a624c66bcdea644","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:24:32.703946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:19:57.839963Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.16802","last_updated":"2025-08-08T12:38:49Z","snapshot_observed_at":"2026-08-18T23:05:47.950528Z","submitted_at":"2025-02-24T03:25:56Z","title":"Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16802","snapshot_observed_at":"2026-08-15T20:24:32.703946Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13034","last_updated":"2025-05-19T12:19:01Z","snapshot_observed_at":"2026-08-17T23:37:06.670526Z","submitted_at":"2025-05-19T12:19:01Z","title":"topicwizard -- a Modern, Model-agnostic Framework for Topic Model Visualization and Interpretation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:24:32.703946Z"},"links":{"cited_paper":"/paper/2502.16802","citing_paper":"/paper/2505.13034"},"observation_digest":"sha256:1ac62794bcbc5dca8cf6c92d4623c96eba8197c9c20faf470545b019dbf8e720","observation_id":"bb878ec9-056f-435b-960b-7e6e3f4fcc50","resolution":{"observed_at":"2026-08-15T20:24:32.703946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16802","last_updated":"2025-08-08T12:38:49Z","snapshot_observed_at":"2026-08-18T23:05:47.950528Z","submitted_at":"2025-02-24T03:25:56Z","title":"Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training","version":3},"cited_work":{"arxiv_id":"2502.16802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16802","snapshot_observed_at":"2026-07-04T16:19:57.839963Z","title":"Unsupervised topic models are data mixers for pre-training language models","venue":null,"work_id":"f96fcae2-cf70-476f-9163-e02e4bf85d4a","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-15T22:16:01.152280Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2502.16802","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:84942628c9303ae55ae608e232776438ed6ffe6b0612189e6dabe77e4b029505","observation_id":"513113da-ca73-4b5b-a506-0462607657c3","resolution":{"observed_at":"2026-05-15T00:58:25.736038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16802","last_updated":"2025-08-08T12:38:49Z","snapshot_observed_at":"2026-08-18T23:05:47.950528Z","submitted_at":"2025-02-24T03:25:56Z","title":"Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training","version":3},"cited_work":{"arxiv_id":"2502.16802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16802","snapshot_observed_at":"2026-07-04T16:19:57.839963Z","title":"Unsupervised topic models are data mixers for pre-training language models","venue":null,"work_id":"f96fcae2-cf70-476f-9163-e02e4bf85d4a","year":2025},"citing_paper":{"arxiv_id":"2606.24133","last_updated":"2026-06-23T04:32:46Z","snapshot_observed_at":"2026-08-16T09:38:12.780987Z","submitted_at":"2026-06-23T04:32:46Z","title":"Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:13.587037Z"},"links":{"cited_paper":"/paper/2502.16802","citing_paper":"/paper/2606.24133"},"observation_digest":"sha256:fa98c88aef7804d437e0366c2a73f03c9ba5e99ac48ae711c5e6b4bea3e6f6c2","observation_id":"23d6ee1a-93c1-45ad-a85c-27da42b11b5c","resolution":{"observed_at":"2026-07-04T16:19:57.841414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16802","last_updated":"2025-08-08T12:38:49Z","snapshot_observed_at":"2026-08-18T23:05:47.950528Z","submitted_at":"2025-02-24T03:25:56Z","title":"Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training","version":3},"cited_work":{"arxiv_id":"2502.16802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16802","snapshot_observed_at":"2026-07-04T16:19:57.839963Z","title":"Unsupervised topic models are data mixers for pre-training language models","venue":null,"work_id":"f96fcae2-cf70-476f-9163-e02e4bf85d4a","year":2025},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-08T15:31:37.930459Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2502.16802","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:96af26c4af2ee3efd4b264c7d1244b8963f363725dde7d7f415a599718116235","observation_id":"cd6a4d94-5e23-48d9-a620-d40481e19f98","resolution":{"observed_at":"2026-07-03T16:48:39.453307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.16802/citation-record","integrity":"/paper/2502.16802/integrity","json":"/paper/2502.16802/citation-record.json","paper":"/paper/2502.16802"},"outbound":[],"paper":{"arxiv_id":"2502.16802","last_updated":"2025-08-08T12:38:49Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T23:05:47.950528Z","submitted_at":"2025-02-24T03:25:56Z","title":"Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2502.16802."}