{"as_of":"2026-08-10T10:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dace85777cc04dd1180561ec27f144d2487aec78c7bebe70f32b235ad3619d1","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:11:18.777242Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11516/citation-record","integrity":"/paper/2506.11516/integrity","json":"/paper/2506.11516/citation-record.json","paper":"/paper/2506.11516"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:11:08.131180Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.131180Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:f8c14e5be202116c6b5df2ea4c214c734b617a98da6abb1c83eb400395cef31a","observation_id":"7e20ce3a-143f-4070-9190-7ac8ec8c42c0","resolution":{"observed_at":"2026-08-07T04:11:08.131180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.616309Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":"3529b2d8-febf-4b8c-bafa-84a5ea6e1625","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.222395Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5ef0391b7bf16550de3e6afd4f82ee65b275ab84c811b19308cad9f0b3942f60","observation_id":"a49d0843-2a9a-4897-be8b-93178dd62ffa","resolution":{"observed_at":"2026-08-07T04:11:19.620847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.601069Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":"412646e6-f893-45a3-a075-fb18208b9d82","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.317368Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:cb693ff4838e9f1ad07f6ac1ab30a4566509d2a2d9db52df72cc91e4ef3c72cd","observation_id":"00d31db9-5ef9-4a33-b25a-64734179d0c3","resolution":{"observed_at":"2026-08-07T04:11:19.605567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T04:11:08.418055Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.418055Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:828002e43d42fc2b081f2ee904efef62a8a50c4fae68b561182ca79fae363e34","observation_id":"1b54c1af-6f68-456a-b361-3077feba179e","resolution":{"observed_at":"2026-08-07T04:11:08.418055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.586759Z","title":"Dick, Hidenori Tanaka, and Tomer Ullman","venue":null,"work_id":"c999134b-1724-4a0a-bb1e-0dab2b2489bd","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.516792Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:cf68d82783b2e479a790727ab46a5ecf7c4c5f25cd6b8f9234fb0f2acf51573e","observation_id":"8d152ad0-29e8-485a-95ed-7f2276fbe3cf","resolution":{"observed_at":"2026-08-07T04:11:19.591332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.570904Z","title":"Rademacher and gaussian complexities: Risk bounds and structural results","venue":null,"work_id":"03826962-bdc6-4792-ae37-d6bde1dfc3ee","year":2002},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.617309Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b9461aeb4c2e349d5d27df01052b1745766e08464613cf483c8141c33fbfe4af","observation_id":"c6519246-02f4-4de4-a614-68583eb71c66","resolution":{"observed_at":"2026-08-07T04:11:19.576163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.686068Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.686068Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:c069743a92ce38ecc3a00296f0df518f4f76184d60893e36f4896ea16d4003e1","observation_id":"f1db7f6e-412e-4b5a-8ea5-81993197fd22","resolution":{"observed_at":"2026-08-07T04:11:08.686068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.806290Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.806290Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:c85fb328969bfae037ff39ae96062e4066f5f9f6e2877854e952433977ba8805","observation_id":"29f998c3-f124-4ba8-9d44-c697db23063e","resolution":{"observed_at":"2026-08-07T04:11:08.806290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.915331Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.915331Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:4533a17662b08d1d741e614de31414e864b9c79ead01e20ec83bcbb228ba9a32","observation_id":"97d7db0d-b8c7-47c5-aac6-8402deebbcd6","resolution":{"observed_at":"2026-08-07T04:11:08.915331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.524981Z","title":"A survey on in-context learning","venue":null,"work_id":"84fb7180-ff0f-46ed-a8a5-2b94b9a3170d","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.041338Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:394fd781733f2829fd63e13185712945fb98fffdb469593be783f3c227fcbc1e","observation_id":"9717daa1-7c68-4d94-9980-1f03eb836243","resolution":{"observed_at":"2026-08-07T04:11:19.529283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.510199Z","title":"In-context learning and gradient descent revisited","venue":null,"work_id":"237f30fd-2dd9-46e7-ad09-160e49d72db7","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.166762Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:61b9e85ae03ad3cfba78ae703d08497c160c856ea3ec43e67d41e4b8b389c25f","observation_id":"31b5ef24-ff58-4967-93d1-03b488e31361","resolution":{"observed_at":"2026-08-07T04:11:19.514584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.495524Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":"37afe67c-7b06-4869-b4e1-82635782a47d","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.273366Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:58992c1d816c16cefe0aff36f020d0c28f8ea41e3b72131016b1828e848cd1f2","observation_id":"843afbf3-62a7-4b8d-a347-cf2474acb9b2","resolution":{"observed_at":"2026-08-07T04:11:19.499829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.479546Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":"3751cc2f-02a7-4314-bf98-538babf7fe3f","year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.410778Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e2a9ab3331f9011722184efe99981cdd18579cca2b194c7d5ae3008c82764bad","observation_id":"086fecb0-8eac-4830-8bd2-3a26aca3d425","resolution":{"observed_at":"2026-08-07T04:11:19.484694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.462931Z","title":"The evolution of statistical induction heads: In-context learning markov chains","venue":null,"work_id":"26bc4719-dd9a-4a40-95ba-fcbec160c265","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.608380Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:40ddf2f8ab3d07cbfa0e820dd071fecdd0de80ccf04f230b582f1c7fdf9267c2","observation_id":"9ec82ccc-241a-4797-a208-45a42ab1e7d4","resolution":{"observed_at":"2026-08-07T04:11:19.467950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.447323Z","title":"Transformers learn to achieve second-order convergence rates for in-context linear regression","venue":null,"work_id":"46f0abb4-50e4-48e9-b437-fd0cccabe085","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.739775Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:1c4718cb4898fdb9dcd6e6cb736d9aed5a245dc1a895de66204125cfc9ed4bd5","observation_id":"ded6a17b-2510-4fb5-a74b-9255a39c1b8c","resolution":{"observed_at":"2026-08-07T04:11:19.452107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.431084Z","title":"How do transformers learn in-context beyond simple functions? a case study on learning with representations","venue":null,"work_id":"33308b33-c658-4f68-affa-b1dabb0bff39","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.893133Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:dfb42704e6b697bbdfadd2a25ebf97da5dd3b1258684dc9346b97949c9c8a51c","observation_id":"8a668840-8716-40c5-8304-024212eb36d5","resolution":{"observed_at":"2026-08-07T04:11:19.435960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.414834Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"3d5ba8fb-d4b8-48a5-96d1-6eb32a07b0cc","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.017243Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:a7020431cf3e274338b6e6a7e4bdc0dce44cea34625f048d536048f91d6155cf","observation_id":"50baad5d-2e06-4de8-beef-87736b807302","resolution":{"observed_at":"2026-08-07T04:11:19.419599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-06T13:04:22.551600Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-07T04:11:10.128035Z","title":"A theory of emergent in-context learning as implicit structure induction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.128035Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e404b75d1143e20b1454dbc1358840070930aaf822c973f5bb7a96e343d0d922","observation_id":"bc8900d1-5e2e-406d-b2bc-3f76530dd34d","resolution":{"observed_at":"2026-08-07T04:11:10.128035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T04:11:10.243581Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.243581Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b162e5da577d5ca67708577d44fc4f43946583bdb162d1e093f1313992e1a33a","observation_id":"10cb7cbd-6e5d-48ad-a607-e0db0796f179","resolution":{"observed_at":"2026-08-07T04:11:10.243581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.400128Z","title":"Lee, Qi Lei, and Benjamin Van Roy","venue":null,"work_id":"12e21b75-4147-48c3-8890-abbfa93441a5","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.408678Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:8e57d8457f11b2ff5f363e8484c65d9e980c0ec75738a37e01a3b6f294415965","observation_id":"a02e7793-c9c2-42b4-a639-3d29d675903a","resolution":{"observed_at":"2026-08-07T04:11:19.404830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:10.579815Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.579815Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:c6875ea142624d77d9f4ea9ed15819f389fbb2e39f2844ba98618258609832de","observation_id":"613baf00-1742-4a4a-85b3-8bcc79771a32","resolution":{"observed_at":"2026-08-07T04:11:10.579815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.373890Z","title":"Transformers as algorithms: Generalization and stability in in-context learning","venue":null,"work_id":"cdb6a249-596e-4ad8-842b-b1f0b55b1b6d","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.743114Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:628dc490afb6544fff3d644f45fd2073846598c160556e480ad64151a80429cb","observation_id":"18283e9f-f8b6-4bb9-b6f7-a604baec642b","resolution":{"observed_at":"2026-08-07T04:11:19.378586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.359074Z","title":"The closeness of in-context learning and weight shifting for softmax regression","venue":null,"work_id":"db013df8-3dd7-46ff-8979-90577439b90d","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.864607Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:de7b9933bcb5210ad6894bec05dad68153e4eb620b5984f074ad8fc167393bd2","observation_id":"3775dbb8-7237-403d-8a6e-4ba87a60d2fb","resolution":{"observed_at":"2026-08-07T04:11:19.364184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.344125Z","title":"Probability in Banach Spaces: isoperimetry and processes","venue":null,"work_id":"0b308627-40c1-4df5-a0cf-35f5b3c72aa8","year":2013},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.006528Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:50d01a0cad9875dd12ddd8d338b15fac94d2412751ff05d9564d753808a8a42c","observation_id":"56b3d146-20f0-485b-8338-1911ae6c77e7","resolution":{"observed_at":"2026-08-07T04:11:19.348816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14255","last_updated":"2025-02-20T04:42:06Z","snapshot_observed_at":"2026-08-07T18:03:02.767658Z","submitted_at":"2025-02-20T04:42:06Z","title":"Effects of Prompt Length on Domain-specific Tasks for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14255","snapshot_observed_at":"2026-08-07T04:11:11.163381Z","title":"Effects of prompt length on domain-specific tasks for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.163381Z"},"links":{"cited_paper":"/paper/2502.14255","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b8bf5561457c5c829a6febb761dd15693a191c598a285174da3cf97c28025dc4","observation_id":"d5026bfe-4438-49f3-9ca2-c463ebfe1142","resolution":{"observed_at":"2026-08-07T04:11:11.163381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.329133Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":"2b6598af-d8b1-46f4-8e27-be4de808ee03","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.311117Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:226c7d097ff688dba731c114e0af2629e33bf404acb9ef4dcb45c3d4fe65b97b","observation_id":"7d1fd9b7-a6bc-467f-9615-e5a4779f7af4","resolution":{"observed_at":"2026-08-07T04:11:19.333793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.313400Z","title":"On the method of bounded differences","venue":null,"work_id":"c9ffd70c-487b-4917-87df-8a5ba961f64b","year":1989},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.481238Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:d5c5f5129ffa331c61a82b149e3d5baf19c9726d008dc75741aa165c66bc8721","observation_id":"db737180-6b4d-412b-9a68-29e23ec8a6cf","resolution":{"observed_at":"2026-08-07T04:11:19.318734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.298042Z","title":null,"venue":null,"work_id":"51bfb97c-005b-4251-9bda-130891d9ff7f","year":1909},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.626840Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5027d5516101232e02f8fd5a0e00929bdd4a9da71eaee24122db76de05a4e9f9","observation_id":"f26acf8c-d5c6-4f91-9482-3cea6d56eaf1","resolution":{"observed_at":"2026-08-07T04:11:19.302114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.283350Z","title":null,"venue":null,"work_id":"100ced66-417a-47fa-9f6f-9031c35694a8","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.782948Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:13a46a5b2af3f5a782edd05ef086d6528a616d0f08a770cb87fea266a035b8d1","observation_id":"dcdd381b-5283-4b07-94ea-a5e441bd5ebf","resolution":{"observed_at":"2026-08-07T04:11:19.287685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.268343Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":"b2fbacb7-67af-480b-94ed-982ff653e5fe","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.886504Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:484d7f5b437b5b07eb356ea3a8e06b9602bc654c4efba0869070ea0442e713df","observation_id":"fc1cf7af-27b2-4f06-b8a8-9552f9973498","resolution":{"observed_at":"2026-08-07T04:11:19.273231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T04:11:11.969219Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.969219Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:948f40f00b417b6592d1c7985551fcd47b1a1f88c845eebfa51f458d605618ff","observation_id":"5e3aefdf-c761-4550-b1d1-723b6f79222c","resolution":{"observed_at":"2026-08-07T04:11:11.969219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.253034Z","title":"In-context learning through the bayesian prism","venue":null,"work_id":"71a24d00-b7c7-47ee-9497-60ae18cc3733","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.033911Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:4edfdef9de47adbc977b5e2d2c7be43216f7725071d4e4bd4b1130b2e511ad01","observation_id":"2ee1d2f2-cac2-4798-af12-ecafe84130c8","resolution":{"observed_at":"2026-08-07T04:11:19.257538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.237731Z","title":"Improving systematic generalization of linear transformer using normalization layers and orthogonality loss function","venue":null,"work_id":"e4bea6c2-f84b-4aa2-8097-6423206c4811","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.081239Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:26a1a870ff80e4e9fe8f1e525cf0af40379abf9e69b5013b095e4c5fae26133e","observation_id":"4d46b9f6-72d3-4b0e-918e-9c65a4fc62b3","resolution":{"observed_at":"2026-08-07T04:11:19.242326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:12.152810Z","title":"Fitnets: Hints for thin deep nets","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.152810Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:7484b44251bf782ab3974594bd3a09f3d03addbff6c411eaf56c957d22ff22fb","observation_id":"dc621124-ab68-461c-91b9-26dd27b92c31","resolution":{"observed_at":"2026-08-07T04:11:12.152810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.212679Z","title":"Towards understanding how transformers learn in-context through a representation learning lens","venue":null,"work_id":"156198c7-a377-4b31-8866-cd9a5537a91a","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.224403Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:439b980f519978429683a43f3026037311d64438d16b53963d801775decd4867","observation_id":"4d08960c-eef2-40b4-ad5b-b84126978d9a","resolution":{"observed_at":"2026-08-07T04:11:19.217028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.197840Z","title":"Prompt programming for large language models: Beyond the few-shot paradigm","venue":null,"work_id":"d6b99355-1c31-4d32-b797-62bac66954c3","year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.277380Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:34f5f5c279bb77c0ba0aa267ade339c27d474cc33697fcec5dcf444e3b3b2b25","observation_id":"f660e240-ba5e-456b-9cd6-29cd68a484ec","resolution":{"observed_at":"2026-08-07T04:11:19.202620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:12.350102Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.350102Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:0bf2e313c9afbf4bfdbecd3de239c77865b70f07a6fe9314b55674f207ea605d","observation_id":"687f623c-bb9b-4200-8f89-89cd07a20e54","resolution":{"observed_at":"2026-08-07T04:11:12.350102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.169993Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"da7bb6d9-4ef6-4321-baa6-8e93e47eec70","year":2020},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.434329Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:29f3ac7131052864b0ee21e26033ae8176eaf719ab1cc20f3aa8a1a92b58d385","observation_id":"a2c8bbe2-32cc-47c8-9cae-01e823c9d24b","resolution":{"observed_at":"2026-08-07T04:11:19.175566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.153656Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d8dbad7d-b5fa-4871-968e-7488853a9159","year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.541547Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:9258585059007b0c1503885d92e23be6b1054f80b2dfd400be4d7ed1f7c76822","observation_id":"d78fca5c-f2d5-4e1e-baab-5e1211e5934a","resolution":{"observed_at":"2026-08-07T04:11:19.158840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.138277Z","title":"Schema-learning and rebinding as mechanisms of in-context learning and emergence","venue":null,"work_id":"de2d1156-c01d-48f4-972c-96c11d071e3e","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.631289Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:bf5ad9b05a6b27929fd71c79dcb8c78b5231a5396fe9f5d90d1ffd816433eba7","observation_id":"08c738a3-6d9e-42ed-95b9-7a302c6372f5","resolution":{"observed_at":"2026-08-07T04:11:19.142860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.123603Z","title":"Position: Do pretrained transformers learn in-context by gradient descent? In Forty-first International Conference on Machine Learning , 2024","venue":null,"work_id":"bc15fc6a-3e04-429f-b519-eba75fd3841c","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.693668Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:75ad7cd61218ddf960725f7a9753b0e54fed9a183c28dd67a9f97f27c793a5a8","observation_id":"4ae758fc-6bce-428b-836e-739c637f3777","resolution":{"observed_at":"2026-08-07T04:11:19.128319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:11:12.792902Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.792902Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:dbf3fbadacd8236dd403c3b03b029dbcf2574e55ae03db39da9fb211a8333efd","observation_id":"d1bec487-d4ed-4971-beec-980492d94194","resolution":{"observed_at":"2026-08-07T04:11:12.792902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.108695Z","title":"Function vectors in large language models","venue":null,"work_id":"49d5d283-9b77-4097-945a-bfc826e8461b","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.900360Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:31492f7ccdbde4232d2dc23ef62864fb8e214e08c8476c5ba1693b5389ac7f72","observation_id":"7159fcd0-d5f8-4645-9c20-b72d19f8b0f1","resolution":{"observed_at":"2026-08-07T04:11:19.113534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.092694Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"36578c17-085e-4974-8cc1-8d901aaa91ba","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.000680Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e93278942957b505065d63411ae8537d728b7d0de4d9b78fcfae3ec9657ad105","observation_id":"9e52977c-4f7d-4066-b8a0-e66d87a5e193","resolution":{"observed_at":"2026-08-07T04:11:19.097438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05858","last_updated":"2024-10-15T13:43:50Z","snapshot_observed_at":"2026-07-06T16:17:11.839251Z","submitted_at":"2023-09-11T22:42:50Z","title":"Uncovering mesa-optimization algorithms in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05858","snapshot_observed_at":"2026-08-07T04:11:13.097520Z","title":"Uncovering mesa-optimization algorithms in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.097520Z"},"links":{"cited_paper":"/paper/2309.05858","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:0ba87175946d7bbcfc0651de83c66cfdb55505d3ea6f82c60dc79047df9d70ab","observation_id":"ff999589-2f12-448d-be26-ea9e35402d55","resolution":{"observed_at":"2026-08-07T04:11:13.097520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:13.240671Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.240671Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:93b2754085e858c49664f18b83fca6711c750df382679b816dbce53d74e30889","observation_id":"ab6248d9-c08a-4e7c-8918-f46da7599a2b","resolution":{"observed_at":"2026-08-07T04:11:13.240671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.066418Z","title":"The learnability of in-context learning","venue":null,"work_id":"ff7e9c80-d2fc-47a4-8a4e-b3f559483c44","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.404809Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e3aa3418ee4203db023d2389c0c5623acb633789b1fc0d9720183911e8ff8251","observation_id":"10db895f-5e79-44e4-9a56-0d46bd535aea","resolution":{"observed_at":"2026-08-07T04:11:19.071328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:13.532892Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.532892Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:00afc5f4d78c56ad2c8933231417afc8de52975ef83ba3c8f0e884b0806c0d06","observation_id":"fdc15707-2dde-4ff0-b23d-f27581ccdcd9","resolution":{"observed_at":"2026-08-07T04:11:13.532892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.038074Z","title":"Large language models are implicitly topic models: Explaining and finding good demonstrations for in-context learning","venue":null,"work_id":"a4d8e4e2-51d1-4218-b742-21f7eaee04cc","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.744840Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:037847663742e10253a3ab35ce8e0b49c304bff3da7fb36e7f5f7ebb749d5ada","observation_id":"ddc6d131-5651-481b-9555-984e5f39390b","resolution":{"observed_at":"2026-08-07T04:11:19.043900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.020584Z","title":"An explanation of in-context learning as implicit bayesian inference","venue":null,"work_id":"d2aef705-7d7c-41da-aee1-fb5ee67d419d","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.714226Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:abb61c2d6ab32c944b383fd57d3f83d425a7f36f4e7608b22cd0923b499fe819","observation_id":"5f0b6e90-0608-43ac-ad5b-46f5c81ed461","resolution":{"observed_at":"2026-08-07T04:11:19.025769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.005257Z","title":"Can we edit factual knowledge by in-context learning? In The 2023 Conference on Empirical Methods in Natural Language Processing , 2023","venue":null,"work_id":"626867eb-af71-41f2-8916-a3229f8622c8","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.761559Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:cc394363fc415c83d8aa3dee02e36c8a83d6a035c819216d2e91b3adc30f0a7b","observation_id":"a5004177-5489-4abf-8331-1c5b8c2f386c","resolution":{"observed_at":"2026-08-07T04:11:19.010308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.989847Z","title":"The mystery of in-context learning: A comprehensive survey on interpretation and analysis","venue":null,"work_id":"7fc99dce-07c9-47c1-ba21-1dcb8e606d45","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.767193Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:3d67126c45a40e40ee3f2314da0e3fe390c00eb1dcb24a6cac2cb1073e229bac","observation_id":"e217562a-024c-44dd-8105-99262f019864","resolution":{"observed_at":"2026-08-07T04:11:18.994479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.974065Z","title":"Root mean square layer normalization","venue":null,"work_id":"7de981f7-fa18-4d70-adb2-2f54d195356a","year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.772531Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:27f694dcb005aa557098e882df834c16529e25d302116ced0a7cb81efd805bca","observation_id":"e74cc311-0d99-4c4e-b3f9-11d9d39f4979","resolution":{"observed_at":"2026-08-07T04:11:18.978692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.955901Z","title":"What and how does in-context learning learn? bayesian model averaging, parameterization, and generalization","venue":null,"work_id":"a4cc0052-3f64-4678-ab26-7b2d5c480ac4","year":2025},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.777242Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:bdd9c204f9bf237842015e0b2304a261305af46557a451618ecfe4b733b8f51a","observation_id":"62cf1262-645e-45f4-8b12-931972bae5c7","resolution":{"observed_at":"2026-08-07T04:11:18.963408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:47:39.326746Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.11516."}