{"as_of":"2026-08-18T15:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d644b0cb6865611ead3a89c9fe218fd52d79d35722aaaf22e6cede29faf2287d","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:40:21.640422Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T04:46:33.641714Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:49:02.953758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"cited_work":{"arxiv_id":"2504.17562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nitish Shirish Keskar, Bryan McCann, Lav R","venue":null,"work_id":"9448d1a2-91c1-4ab7-a6d6-88c1abd83a5b","year":null},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-14T09:49:16.350511Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2504.17562","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:af196f3857b17663752fc55111fd1ed1845fb65acdd551999d912c98c7211bb4","observation_id":"3d3eda9a-55b6-4fcf-8478-9f2759dde147","resolution":{"observed_at":"2026-05-17T04:49:02.956416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17562/citation-record","integrity":"/paper/2504.17562/integrity","json":"/paper/2504.17562/citation-record.json","paper":"/paper/2504.17562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.06955","last_updated":"2021-07-14T19:39:31Z","snapshot_observed_at":"2026-08-17T16:51:30.846612Z","submitted_at":"2021-07-14T19:39:31Z","title":"HTLM: Hyper-Text Pre-Training and Prompting of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06955","snapshot_observed_at":"2026-08-16T10:40:21.569567Z","title":"Htlm: Hyper-text pre-training and prompting of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.569567Z"},"links":{"cited_paper":"/paper/2107.06955","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:7990beccfd5b7447415a2f4508a1e892f41d6baa52f3d3e4d56d98f6c44d7f45","observation_id":"5f6a8e5f-4826-437a-bd56-fb07154f952c","resolution":{"observed_at":"2026-08-16T10:40:21.569567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02164","last_updated":"2020-03-03T05:33:49Z","snapshot_observed_at":"2026-08-13T14:14:59.271697Z","submitted_at":"2019-12-04T18:32:15Z","title":"Plug and Play Language Models: A Simple Approach to Controlled Text Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02164","snapshot_observed_at":"2026-08-16T10:40:21.597843Z","title":"Sumanth Dathathri, Andrea Madotto, Janice Lan, Jane Hung, Eric Frank, Piero Molino, Jason Yosinski, and Rosanne Liu","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.597843Z"},"links":{"cited_paper":"/paper/1912.02164","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:548d4d517daeda40a29be34919a10b0e5399e70c6c11da98901937ce5b416c20","observation_id":"5ca024e4-4918-47e3-bf12-a9e51078cda4","resolution":{"observed_at":"2026-08-16T10:40:21.597843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-16T15:48:17.798712Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-16T10:40:21.607260Z","title":"Michael Hahn and Navin Goyal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.607260Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:ebb3041ca155feefc99d792041b45742a3b985e46df87f383c068241fe76b125","observation_id":"29d8bd5e-f1ac-48ef-b137-78c7c3bb4333","resolution":{"observed_at":"2026-08-16T10:40:21.607260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-16T10:40:21.611507Z","title":"Ctrl: A conditional transformer language model for controllable generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.611507Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:18f165b1a99a49b4b37943f0cba6090569c2b2823d18fac9d86ed8d0836891a8","observation_id":"5da20810-687a-4991-a0a4-8bb7687e7b92","resolution":{"observed_at":"2026-08-16T10:40:21.611507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01019","last_updated":"2024-08-13T03:55:35Z","snapshot_observed_at":"2026-08-16T22:22:51.693730Z","submitted_at":"2024-04-01T09:39:38Z","title":"Source-Aware Training Enables Knowledge Attribution in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01019","snapshot_observed_at":"2026-08-16T10:40:21.615899Z","title":"Source-aware training enables knowledge attribution in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.615899Z"},"links":{"cited_paper":"/paper/2404.01019","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:e6bbc49c7d512e81ee8e8807a37201a361578b1ef3214446726cc36b04cb2f4a","observation_id":"5e9c4b23-e569-4400-9b61-08e4f262930b","resolution":{"observed_at":"2026-08-16T10:40:21.615899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15047","last_updated":"2024-07-12T18:03:25Z","snapshot_observed_at":"2026-08-16T14:49:41.945174Z","submitted_at":"2023-10-23T15:50:08Z","title":"Implicit meta-learning may lead language models to trust more reliable sources","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15047","snapshot_observed_at":"2026-08-16T10:40:21.620137Z","title":"Implicit meta-learning may lead language models to trust more reliable sources","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.620137Z"},"links":{"cited_paper":"/paper/2310.15047","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:086f765c502be2fbde27e787d7899af6e7aa95391b8ef4e94521afee12eee041","observation_id":"0c8d3eb8-84ea-472b-a12a-d0bfcf67ede1","resolution":{"observed_at":"2026-08-16T10:40:21.620137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.624364Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth´ee Lacroix, Baptiste Rozi `ere, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.624364Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:4b6c5285c84b2c1007261f86675145815dd843c85a0699edf04d0892a5a1785a","observation_id":"fad96e55-2756-4869-9d56-10ff2f9de7b7","resolution":{"observed_at":"2026-08-16T10:40:21.624364Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01976","last_updated":"2024-06-04T05:22:24Z","snapshot_observed_at":"2026-08-16T13:46:26.782316Z","submitted_at":"2024-06-04T05:22:24Z","title":"Conditional Language Learning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01976","snapshot_observed_at":"2026-08-16T10:40:21.628207Z","title":"Xiao Zhang, Miao Li, and Ji Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.628207Z"},"links":{"cited_paper":"/paper/2406.01976","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:b4224adadab8ebf658a07a9f72fa40b4cc2017724d3fc4f886302c7039870390","observation_id":"59c8a36f-fe50-424f-a446-ae69a9dcffd0","resolution":{"observed_at":"2026-08-16T10:40:21.628207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.915636Z","title":"Deciphering the impact of pretraining data on large language models through machine unlearning","venue":null,"work_id":"7d636389-a6f4-4802-aa33-780811cc60c7","year":2024},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.632162Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:cb3cd962640b5622601ee1587e72b03511b9a9b1247668ae54d6423c2793c3e1","observation_id":"196d73a5-9b48-4591-8ac3-6c4af658c168","resolution":{"observed_at":"2026-08-16T10:40:21.919692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.903465Z","title":"12 Published as a conference paper at COLM 2025 A More Details of the Experimental Setting Training Setting","venue":null,"work_id":"ee15c853-2be6-42ee-a0a8-fbf08bf07876","year":2023},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.636242Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:aee68f3404abe415f5810cfe4c4203e01b8eccf7cac9bee48040f0de1541daea","observation_id":"a849e908-be1c-4485-8680-ec13837d9ccb","resolution":{"observed_at":"2026-08-16T10:40:21.907550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.888619Z","title":"B The loss of next-token prediction for various token positions","venue":null,"work_id":"bbd19cd0-dd37-4045-9d57-bfe07901dfa2","year":2021},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.640422Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:307b2ca115bbe9ec4b27953b5385efb14f51cf352d18da3ce2fd502312f7a077","observation_id":"cbefdf3e-f022-4134-8587-64e57b6af8f0","resolution":{"observed_at":"2026-08-16T10:40:21.895155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.592365Z","title":"URL https: //aclanthology.org/P18-1198/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.592365Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:d9db4419a4566f668175003c40da4cd1fd7829606051613bc332c75bc71e490e","observation_id":"88cdee63-919e-4970-a1ce-fae8ab7d020f","resolution":{"observed_at":"2026-08-16T10:40:21.592365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T10:40:21.602496Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.602496Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:1ec27c351dec2dc9828d808d2a39e6cfe76ba5318d6aa54a1f47104507e31aa8","observation_id":"e3d15d29-0f1d-41c5-811b-1d81e8edf486","resolution":{"observed_at":"2026-08-16T10:40:21.602496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03535","last_updated":"2022-06-10T03:58:27Z","snapshot_observed_at":"2026-08-10T06:46:03.370194Z","submitted_at":"2020-06-05T16:15:46Z","title":"CoCon: A Self-Supervised Approach for Controlled Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03535","snapshot_observed_at":"2026-08-16T10:40:21.587527Z","title":"URL https://aclanthology","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.587527Z"},"links":{"cited_paper":"/paper/2006.03535","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:45741a20b329dc26183a48877a66e57b9182c08cb9d73428ef987901afad50cb","observation_id":"804b2c0f-49a5-4f8b-bb7f-bceea1a77a75","resolution":{"observed_at":"2026-08-16T10:40:21.587527Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-16T14:02:46.982560Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-16T10:40:21.578676Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.578676Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:f9580da92ca19113569c5a6d68be7831c295e8dc070cdccbaaa4f8da615ecf38","observation_id":"705191bd-db36-43d6-966a-6c590f03ffbf","resolution":{"observed_at":"2026-08-16T10:40:21.578676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-08-16T22:55:19.544394Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-16T10:40:21.582670Z","title":"A theory for emergence of complex skills in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.582670Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:a5277e41c392165b31fa1b016d0ca2b34cf1bf552cefd4bda9ff0ac46e3bdf43","observation_id":"6c110442-d4c6-442d-8a5d-30f0951b371a","resolution":{"observed_at":"2026-08-16T10:40:21.582670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-16T15:30:48.952049Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-16T10:40:21.574336Z","title":"Zeyuan Allen-Zhu and Yuanzhi Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.574336Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:b7e929303088424747fbcdea865f05cb6b5e027cdc58ddf4ab9d9fd6b858b428","observation_id":"99c4e181-5b57-431c-97e9-36560abea958","resolution":{"observed_at":"2026-08-16T10:40:21.574336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T10:34:45.372281Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2504.17562."}