{"as_of":"2026-08-14T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ded7c2c3260df1819ae91f66bd2f5860fa5cbc19ca5c4c446f6d2ac9c47622e3","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:14.475409Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:48:04.570803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:55.894248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-08-06T18:48:04.570803Z","title":"Riechers, Henry R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07432","last_updated":"2025-07-13T00:23:45Z","snapshot_observed_at":"2026-08-10T04:53:59.287044Z","submitted_at":"2025-07-10T05:09:19Z","title":"Neural networks leverage nominally quantum and post-quantum representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:04.570803Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2507.07432"},"observation_digest":"sha256:b608613f913e678b929412cd76889166e2522d70ab933f09510a0393809bad24","observation_id":"0dd0ea06-82f7-4f61-83ad-f01dbb981ebb","resolution":{"observed_at":"2026-08-06T18:48:04.570803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2605.20382","last_updated":"2026-06-19T16:43:39Z","snapshot_observed_at":"2026-08-13T06:37:53.470164Z","submitted_at":"2026-05-19T18:32:20Z","title":"Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:30:27.297971Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2605.20382"},"observation_digest":"sha256:4f1bb4cad4fe1ce9f2b8dd769ad86c6f66e72b461752cb3495b1ac3789a489d2","observation_id":"a0f54fa9-dd2f-4e5f-a778-3ee3d1e27498","resolution":{"observed_at":"2026-05-21T07:34:02.835390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2605.20382","last_updated":"2026-06-19T16:43:39Z","snapshot_observed_at":"2026-08-13T06:37:53.470164Z","submitted_at":"2026-05-19T18:32:20Z","title":"Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:29.237972Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2605.20382"},"observation_digest":"sha256:e1b17ab43aa26f3caf42a181db4e32c29642c44028c252b83492fcf3b89ee66b","observation_id":"83c8668e-eafe-4dd7-8012-f1781be88702","resolution":{"observed_at":"2026-06-30T18:04:58.158650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"cited_work":{"arxiv_id":"2505.18373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18373","snapshot_observed_at":"2026-07-03T20:38:55.894248Z","title":"Mark Russinovich, Ahmed Salem, and Ronen Eldan","venue":null,"work_id":"54e89071-2a54-4bb4-abac-831d9d764d34","year":null},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.18373","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:ade4e676a4bcdc319dbcd3c3df620e2ed276b56cd19ada739f2ff7cf497fe838","observation_id":"4e4983ec-6615-4d8c-bcf8-36c90a25873a","resolution":{"observed_at":"2026-07-03T20:38:55.895992Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18373/citation-record","integrity":"/paper/2505.18373/integrity","json":"/paper/2505.18373/citation-record.json","paper":"/paper/2505.18373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.522624Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.522624Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:dae4f21223efad77225a610889c82bc0f864fd5353d33e5ecf8f6c9bd505a55a","observation_id":"23ae4b3f-7573-43f4-9194-b2a19cb84ae8","resolution":{"observed_at":"2026-08-07T14:39:10.522624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.659096Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.659096Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:41f5c6adba5551999e837fdbdb52cc20cf5fb362d303eab150a9afdce48d8cad","observation_id":"ba9a3316-9c80-450b-a6d0-83c35c5623aa","resolution":{"observed_at":"2026-08-07T14:39:10.659096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T14:39:10.779063Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.779063Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:9b04e1b10f97fd4258e2797ac45a42199139729549591cc564da8f322c1ccf32","observation_id":"a9d83373-353a-458a-9940-3d3bcfddc0bd","resolution":{"observed_at":"2026-08-07T14:39:10.779063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.466289Z","title":"An explanation of in-context learning as implicit Bayesian inference","venue":null,"work_id":"3c251c47-b507-493b-95c5-ec5c9737da45","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.934682Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:e2c126dd293848e358e6831e19e66e1f7b009168eadcee924b4f0a3ff906aef6","observation_id":"c507153a-c542-4234-ac4e-f98ee1bd41c2","resolution":{"observed_at":"2026-08-07T14:39:19.577650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.096101Z","title":"Bayesian scaling laws for in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.096101Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:e5a412ceb7dec7968c180be09bf6ad933b3a5bcb6f44041361bdd02e1dc55ca3","observation_id":"fbc26298-df18-4ff3-b6dd-cae2b8c3e7ad","resolution":{"observed_at":"2026-08-07T14:39:11.096101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.222971Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"c401d1cb-729b-4870-aba1-904c28d5ee64","year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.230099Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:21da40aae02c3fe2c51edc8c9ab6253e96a1c2c368678db53598d8511768d47b","observation_id":"a26ff039-52aa-4efb-9412-1b4c3e7297ce","resolution":{"observed_at":"2026-08-07T14:39:19.353203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.016511Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"ae6c5a29-d419-4041-92a2-d187898e1115","year":2023},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.391441Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:f964990b0002eaecc19eb342763a65ef3b80f493f51137821cece0e5c042bb74","observation_id":"028fc5f7-63e8-4405-855a-2e1e1add81a0","resolution":{"observed_at":"2026-08-07T14:39:19.124364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-13T13:18:49.134404Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-07T14:39:11.525634Z","title":"The broader spectrum of in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.525634Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:458941b41629ae832e403d546a89fe9eee64e928f72b5c50acc030bbc8067000","observation_id":"5d07d308-4d84-4c26-a5f0-a56514518e23","resolution":{"observed_at":"2026-08-07T14:39:11.525634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.772670Z","title":"Transformers represent belief state geometry in their residual stream","venue":null,"work_id":"b5051eae-94da-4fd6-97bb-6bcbda838f77","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.658697Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:1956537f2c123becd320ffedaabe14cbe875e2bffd8917e136cca989ed8df398","observation_id":"3c10f9de-1942-4986-aa0e-002c0df277b7","resolution":{"observed_at":"2026-08-07T14:39:18.880580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.521892Z","title":"Constrained belief updates explain geometric structures in transformer representations","venue":null,"work_id":"f571c10e-b4d3-4de0-9fae-ea1e96bde786","year":2025},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.794402Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:f703b4bb9de8f06098218dd04d0d892a9fcd88679b049d9501d510d0d93cfb96","observation_id":"94e3ab11-b2b9-4ac3-90d2-d155b3a412d3","resolution":{"observed_at":"2026-08-07T14:39:18.624548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.299240Z","title":"RNNs represent belief state geometry in their hidden states","venue":null,"work_id":"60f8d4ea-8840-4ee8-a448-bbc1ed386279","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.956676Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:1d5ef304d39b21af487693da4d32a2178c29ad6b9b83c518fb998d14c0268184","observation_id":"f9a097d9-0a92-4919-a464-b9ddca1120c1","resolution":{"observed_at":"2026-08-07T14:39:18.434866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.100424Z","title":null,"venue":null,"work_id":"a606f218-72d2-4289-b7c1-fa7a0e49f0a6","year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.092474Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:810d678c7411187addb7e1c9cfd03e20119ea7338c97b95ee3cfbe22a8ea5171","observation_id":"eebf4abf-4b44-4e28-b6ed-320a478b4e62","resolution":{"observed_at":"2026-08-07T14:39:18.181859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.219137Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.219137Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:d0d4b4af466a5b56f8da9a251bc67f61b7473fd17a2da02ea2916535b3df5162","observation_id":"67abdc84-aad6-4dbc-8d3b-1aa29589e4c6","resolution":{"observed_at":"2026-08-07T14:39:12.219137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.822129Z","title":"In-context learning and induction heads","venue":null,"work_id":"a9677835-141b-46da-8b11-deb149b4acb6","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.470323Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:d15bdd50e6bb1fcbc319915d11b4cbce0d6857280abe8f2dac0b06c52cf49090","observation_id":"79ede063-cb47-4393-91b7-5192c1752cc5","resolution":{"observed_at":"2026-08-07T14:39:17.925148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.568871Z","title":null,"venue":null,"work_id":"627f5d8e-b9d3-49f3-9f47-349ef63cbc59","year":2018},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.590141Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:c872360ff26d7b6bf39afbfc128b02c4fbfbf331a1a142a18b5c3a1f6c0181d9","observation_id":"4c187814-8b65-4432-a3c0-0ded963ec18e","resolution":{"observed_at":"2026-08-07T14:39:17.687571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.373367Z","title":null,"venue":null,"work_id":"75d3a8be-1599-42dc-a755-af8133d24790","year":2018},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.698026Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:d817730e51fe7230bf541f1ed09aba4c94b3753169d7a348eb8fe6eb7add8e3c","observation_id":"98b9499e-0972-488e-a67c-74c62ef303bd","resolution":{"observed_at":"2026-08-07T14:39:17.461471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.119696Z","title":null,"venue":null,"work_id":"f7881d23-48c3-410b-a86e-4cff3e903cfe","year":1997},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.845266Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:ea3c333cca7cca981d5420af0c8432f10a359f3d70c17f14d77544f83091a3cf","observation_id":"44bccc95-5339-4f4c-8909-79aaabaac208","resolution":{"observed_at":"2026-08-07T14:39:17.270392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.936027Z","title":null,"venue":null,"work_id":"6a8e2b61-5d99-43be-b26f-d803272ed0d0","year":2012},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.940165Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:f2f4de938bbf1191c467b8f9fc82d988270e6771a35fa840d6fe20be5f7f95cb","observation_id":"00ef0ebd-df95-42aa-a817-2c2852e8e144","resolution":{"observed_at":"2026-08-07T14:39:17.033210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.773522Z","title":null,"venue":null,"work_id":"ca2c3f55-ad83-4e3b-a9f0-e3491517ccc6","year":2016},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.020770Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:04762d1c1fbd9c0cdb06286d9fac33dcd2f4039f986aa67d4537336ec49fdf26","observation_id":"c18aefdb-5d3e-4161-9e6f-9eaca7ef037e","resolution":{"observed_at":"2026-08-07T14:39:16.846055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.535361Z","title":"Shannon entropy rate of hidden markov processes","venue":null,"work_id":"2f0e1350-f097-443c-9ad0-e534be083a06","year":2021},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.151419Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:20a557258e5d930a9f08923eaf7e1ca639c41936cd180beccc5e916a03d3af7d","observation_id":"71ed24ca-59f9-4d66-9227-bf3f509cb586","resolution":{"observed_at":"2026-08-07T14:39:16.623887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.386246Z","title":"Critical behavior in physics and probabilistic formal languages","venue":null,"work_id":"a924acf7-c39e-493c-984d-115bda1b1a5e","year":2017},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.319546Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:61add731ec57536cce22132fded56f02912b8662ff9087f29742b98089bb3737","observation_id":"ce99a68f-39ac-40c2-a131-2b9680199ca9","resolution":{"observed_at":"2026-08-07T14:39:16.438303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00386","last_updated":"2015-04-01T20:55:10Z","snapshot_observed_at":"2026-07-06T04:13:51.950712Z","submitted_at":"2015-04-01T20:55:10Z","title":"Signatures of Infinity: Nonergodicity and Resource Scaling in Prediction, Complexity, and Learning","version":1},"cited_work":{"arxiv_id":"1504.00386","doi":null,"metadata_source":"pith","pith_arxiv_id":"1504.00386","snapshot_observed_at":"2026-08-07T14:39:14.894415Z","title":"Signatures of Infinity: Nonergodicity and Resource Scaling in Prediction, Complexity, and Learning","venue":"cond-mat.stat-mech","work_id":"657d3fd2-e823-4e89-aa17-67139f7fdb26","year":2015},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.406121Z"},"links":{"cited_paper":"/paper/1504.00386","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:8a6abba2d9ada2160368246de649ed27d9816554a3142aea48cded8ff91f068b","observation_id":"3e6274c1-974a-41bc-a5cc-dd49782f8ca3","resolution":{"observed_at":"2026-08-07T14:39:15.006118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.197778Z","title":"Language models model us","venue":null,"work_id":"5d075a34-6502-409a-bb77-72f8f66adfa6","year":2024},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.547887Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:0cfc4094770671f965889dc857948abf721089600015c4dbef6e0b6572c985a5","observation_id":"faca23d7-3995-42b3-83ed-3e9d6087a9e3","resolution":{"observed_at":"2026-08-07T14:39:16.289298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.975068Z","title":"Predictability, complexity, and learning","venue":null,"work_id":"5eb6359c-a0b6-4181-8e6d-6cd898de80b4","year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.687663Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:c1300f4218e13b21ffce6e361d84c6dc0dcf4bc05abee4251150f2c07ada4aa8","observation_id":"c6d3af4b-f423-487c-9ed5-275f884cd1fe","resolution":{"observed_at":"2026-08-07T14:39:16.060360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:39:13.843128Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.843128Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:1ff6b71c184cac731bc634ea4de9d9741bf31c743ba4149a8e917fab2eb461b7","observation_id":"17d4ec45-227b-4e82-b4db-11e613628f6c","resolution":{"observed_at":"2026-08-07T14:39:13.843128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03030","last_updated":"2019-07-18T18:09:19Z","snapshot_observed_at":"2026-08-08T14:27:24.165113Z","submitted_at":"2019-05-08T12:27:20Z","title":"Meta-learning of Sequential Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03030","snapshot_observed_at":"2026-08-07T14:39:13.913343Z","title":"Meta-learning of sequential strategies","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.913343Z"},"links":{"cited_paper":"/paper/1905.03030","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:8a82ad461283c7e3ec1b65e14e12fc6374335b87cfd360f96db6aa59786a9fdc","observation_id":"75612168-e09b-498c-9425-9c5decff3d6c","resolution":{"observed_at":"2026-08-07T14:39:13.913343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.736527Z","title":"Data distributional properties drive emer- gent in-context learning in transformers","venue":null,"work_id":"8ef98845-3f79-4e22-b2a2-948d6e84f8e8","year":2022},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.035992Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:dcd4e0c4de12b82624ed37051adc0a94b42f6702e8dba80b6fa372b5d7aec93d","observation_id":"8a8004f4-9cca-4b52-8a91-942848a9d1ce","resolution":{"observed_at":"2026-08-07T14:39:15.838207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"cond-mat/9902341","last_updated":"1999-02-25T14:55:35Z","snapshot_observed_at":"2026-08-11T14:54:44.494917Z","submitted_at":"1999-02-25T14:55:35Z","title":"Predictive Information","version":1},"cited_work":{"arxiv_id":"cond-mat/9902341","doi":null,"metadata_source":"pith","pith_arxiv_id":"cond-mat/9902341","snapshot_observed_at":"2026-08-07T14:39:14.653506Z","title":"Predictive Information","venue":"cond-mat.stat-mech","work_id":"f7b94d47-39be-4895-a676-717ee7335f28","year":1999},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.127973Z"},"links":{"cited_paper":"/paper/cond-mat/9902341","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:507b012e078f37b29d3ec7dea1b4974c495e96b97cc66f7a8ec193bb24737fc6","observation_id":"9d842ca5-de7e-4687-af69-6d32106a1f45","resolution":{"observed_at":"2026-08-07T14:39:14.717646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.560587Z","title":null,"venue":null,"work_id":"18c0cdfb-b5bc-4eb7-8353-72f6d743d50c","year":2003},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.238739Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:c83488d82e68c56f277b67a9ef26b6a04915d4e1bc8888d60dec4c159ebcbad8","observation_id":"3d6be4e3-f7d6-441b-8e7d-3783d4740593","resolution":{"observed_at":"2026-08-07T14:39:15.636570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.343247Z","title":"Grassberger","venue":null,"work_id":"1ca36c04-767d-4c2d-9a93-790c38a60ab1","year":1986},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.320112Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:7efed08656c03cbe7b717cf1bd41ac70fdce96e8240859fbe0a75d2335f6d905","observation_id":"edfaebd0-8a9c-4ee6-b832-e898203a04a5","resolution":{"observed_at":"2026-08-07T14:39:15.447962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:39:14.475409Z","title":"g(k + 1, ℓ− k) log k + 1 ℓ + 2 + g(k, ℓ+ 1− k) log ℓ + 1− k ℓ + 2 # (34) = − ℓX k=0 ℓ! k! (ℓ − k)!","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:14.475409Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:217a1596c6160d627ce4aa1133e400a6cd83c26ebceb0c2b1592ae34fddb3080","observation_id":"246e4b65-000e-4f5b-ac02-5b18fac886bc","resolution":{"observed_at":"2026-08-07T14:39:14.475409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.353085Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.353085Z"},"links":{"citing_paper":"/paper/2505.18373"},"observation_digest":"sha256:35c15f7e7c3f8ad9738c6da0080b630a1ac0cde9a9cc6140ae6036e690f6983a","observation_id":"cc8af376-9683-4c47-aaeb-21e9d0e95bf8","resolution":{"observed_at":"2026-08-07T14:39:12.353085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18373","last_updated":"2025-07-13T01:17:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T20:29:32.024752Z","submitted_at":"2025-05-23T21:00:18Z","title":"Next-token pretraining implies in-context learning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2505.18373."}