{"as_of":"2026-08-18T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:708d11854884b6e9b4dd82d007b17f199600d4715b134841254284acbbff6b83","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:06:05.127999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:29:50.967150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-08-14T05:01:21.886306Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:80b36f30d8637ff329f2ae42395b670141c50272bb265d6d108e78c9830ebb07","observation_id":"32247463-6fcb-4843-910b-dbbee5c8c1cb","resolution":{"observed_at":"2026-05-17T12:17:26.845013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:88db9d47762799780c55030382947570700b488d5e1fe256937052445ded7528","observation_id":"6f4b0280-b613-4a58-8e59-968a275442a1","resolution":{"observed_at":"2026-05-13T10:36:18.266138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-11T14:20:23.787636Z","title":"Transformers learn in-context by gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12276","last_updated":"2025-06-02T12:55:12Z","snapshot_observed_at":"2026-08-18T07:58:54.913059Z","submitted_at":"2024-12-16T19:00:18Z","title":"Emergence and Effectiveness of Task Vectors in In-Context Learning: An Encoder Decoder Perspective","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T14:20:23.787636Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2412.12276"},"observation_digest":"sha256:028be76928ef122b564312f04691afe4823676abee7fc1e6ff1bdf35152ffc13","observation_id":"cb185528-a245-4a6d-874a-9e9490c651b1","resolution":{"observed_at":"2026-08-11T14:20:23.787636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-11T13:18:09.773508Z","title":"Transformers learn in-context by gradient descent, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13299","last_updated":"2025-02-28T06:19:59Z","snapshot_observed_at":"2026-08-18T12:57:15.911456Z","submitted_at":"2024-12-17T19:59:08Z","title":"In-context learning for medical image segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T13:18:09.773508Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2412.13299"},"observation_digest":"sha256:c4a7d69c30509427627990dba471f55e3b696c71535491b9c1b9dbb6fc770628","observation_id":"8d5df9e5-15db-415a-b534-f6ba0ec63fa0","resolution":{"observed_at":"2026-08-11T13:18:09.773508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-10T20:15:28.417098Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09240","last_updated":"2025-01-16T01:54:23Z","snapshot_observed_at":"2026-08-16T00:59:15.570809Z","submitted_at":"2025-01-16T01:54:23Z","title":"Task Vectors in In-Context Learning: Emergence, Formation, and Benefit","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.417098Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2501.09240"},"observation_digest":"sha256:3d412c5153985e189fb0452f74dc3f63d15d866882cbebcbcfca3107b6b6e810","observation_id":"25c9cb9a-76ff-478a-af77-ef1deba04bb8","resolution":{"observed_at":"2026-08-10T20:15:28.417098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-16T12:06:05.127999Z","title":"v., Niklasson, E., Randazzo, E., Sacramento, J., Mordvintsev, A., Zhmoginov, A., and Vladymyrov, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13756","last_updated":"2025-04-18T15:45:30Z","snapshot_observed_at":"2026-08-17T18:19:11.612066Z","submitted_at":"2025-04-18T15:45:30Z","title":"Scaling sparse feature circuit finding for in-context learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:06:05.127999Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2504.13756"},"observation_digest":"sha256:98907f0269245c6e2d19e299aa0fa61e0962bf8c02ba901d220e755e683bbf64","observation_id":"40568d91-16b8-44a8-973a-598430fd89e7","resolution":{"observed_at":"2026-08-16T12:06:05.127999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-16T05:58:34.073164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19395","last_updated":"2025-08-27T01:37:05Z","snapshot_observed_at":"2026-08-18T02:56:38.370359Z","submitted_at":"2025-04-28T00:05:29Z","title":"ICL CIPHERS: Quantifying \"Learning\" in In-Context Learning via Substitution Ciphers","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T05:58:34.073164Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2504.19395"},"observation_digest":"sha256:3b6feb654f61c85957e24d0d5f41548d838abb56eb087ad6af567b1c2b460e32","observation_id":"3bbc278e-c836-42ff-85b2-191fca430072","resolution":{"observed_at":"2026-08-16T05:58:34.073164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-07T10:35:38.610485Z","title":"V on Oswald, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-16T04:39:11.654884Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:38.610485Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:686abff658d39fc9cf3b4675156fc49971d3d94667721f151417f6724b5986b1","observation_id":"609e8753-af36-4bf4-9a0c-47b8338a16eb","resolution":{"observed_at":"2026-08-07T10:35:38.610485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-07T06:10:20.795541Z","title":"Transformers learn in-context by gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-18T01:32:49.064700Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:20.795541Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:26d239cb2a6f860087a9aafeececcf12f61b118dc7728fdefc5c626f87746ed8","observation_id":"0f0c45dd-5f99-4090-af3d-5d32b5d20624","resolution":{"observed_at":"2026-08-07T06:10:20.795541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-15T18:42:34.508285Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19351","last_updated":"2025-06-24T06:33:00Z","snapshot_observed_at":"2026-08-15T18:30:48.887735Z","submitted_at":"2025-06-24T06:33:00Z","title":"In-Context Occam's Razor: How Transformers Prefer Simpler Hypotheses on the Fly","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T18:42:34.508285Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2506.19351"},"observation_digest":"sha256:bcd4b530abd19c54a70871c5923c9565b6c80e21c98a4830638fe63ba54c0292","observation_id":"3a58dcd2-8f83-4ea3-a2c8-9e9d3f0984ed","resolution":{"observed_at":"2026-08-15T18:42:34.508285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-06T21:38:16.278676Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00092","last_updated":"2025-06-30T09:53:41Z","snapshot_observed_at":"2026-08-08T10:51:41.279421Z","submitted_at":"2025-06-30T09:53:41Z","title":"Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:16.278676Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2507.00092"},"observation_digest":"sha256:b6f4bb9c823065b2c99d57c624bb40308b6bb249a11c4487d4bdbc854268e248","observation_id":"f01fd6a8-5cee-4206-817b-028894d7fec8","resolution":{"observed_at":"2026-08-06T21:38:16.278676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-03T20:57:12.669528Z","title":"Transformers learn in-context by gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-09T23:09:22.568411Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:12.669528Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:09481e77ba71a736b8ae326e89c79dd0e2b32c65c21c3223a5540eaf52666884","observation_id":"2bed3420-686e-41eb-bf14-6f62c9bffe54","resolution":{"observed_at":"2026-08-03T20:57:12.669528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2604.23371","last_updated":"2026-04-25T16:35:25Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T16:35:25Z","title":"When Context Sticks: Studying Interference in In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T08:31:14.231710Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2604.23371"},"observation_digest":"sha256:1f93ce3bb19d37d6f0446851b6f8176d934a1f1f002466d3536eb49d5c24bac6","observation_id":"5f09dc21-10d2-4352-9f20-797acd8af406","resolution":{"observed_at":"2026-05-11T20:36:09.553762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2605.06322","last_updated":"2026-05-27T19:46:02Z","snapshot_observed_at":"2026-08-13T19:38:43.488231Z","submitted_at":"2026-05-07T14:21:26Z","title":"SMolLM: Small Language Models Learn Small Molecular Grammar","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-08T12:57:47.721361Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2605.06322"},"observation_digest":"sha256:ccdcff6e1950804f5103e393b8969769dde8380807ac2098b644c1a101546a5d","observation_id":"585e48d1-f584-4eee-b9bb-fcb131af08d1","resolution":{"observed_at":"2026-05-11T19:01:16.906551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2605.09727","last_updated":"2026-05-10T19:52:29Z","snapshot_observed_at":"2026-08-16T18:57:20.494739Z","submitted_at":"2026-05-10T19:52:29Z","title":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:21.786972Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2605.09727"},"observation_digest":"sha256:40b39fc18f5b72dbdc7270ace214813fa1db8e17bfd0429105be3d6ab33f5922","observation_id":"64e90ae5-66f6-45ca-ab58-f592057636a1","resolution":{"observed_at":"2026-05-12T06:56:31.950075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2606.07623","last_updated":"2026-05-30T14:07:58Z","snapshot_observed_at":"2026-08-16T18:57:38.842848Z","submitted_at":"2026-05-30T14:07:58Z","title":"Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:07:54.236182Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2606.07623"},"observation_digest":"sha256:4031abc57ab588261760538ab3fe5d5f69ae4f4149942d952aa81d2daa3b4593","observation_id":"99d9c37f-1c2f-4824-b922-a66497b167a9","resolution":{"observed_at":"2026-06-28T19:12:34.778045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":"2212.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-04T13:29:50.967150Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"44f96cad-4d9b-4291-8f9f-0ae36e6ee5cf","year":2022},"citing_paper":{"arxiv_id":"2606.26749","last_updated":"2026-06-25T08:33:34Z","snapshot_observed_at":"2026-08-01T16:00:20.311664Z","submitted_at":"2026-06-25T08:33:34Z","title":"Structure Before Collapse: Transient semantic geometry in next-token prediction","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-26T05:14:07.208255Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2606.26749"},"observation_digest":"sha256:512d926a75b6788fde5008f7e6a9382779c5a2231ef2ac7121d323f27ff5b945","observation_id":"74199b95-59dc-4b8c-90ed-120a5b46db56","resolution":{"observed_at":"2026-07-04T13:29:50.968747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T23:43:11.269139Z","title":"2212.07677 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15277","last_updated":"2026-07-16T17:59:31Z","snapshot_observed_at":"2026-08-13T02:49:08.522823Z","submitted_at":"2026-07-16T17:59:31Z","title":"Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T23:43:11.269139Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.15277"},"observation_digest":"sha256:000e6806c11c495b9041daad16963573fab1613057f6100f3f477a12f1601476","observation_id":"91c15dc8-0d55-435c-86b5-a4519d575197","resolution":{"observed_at":"2026-08-01T23:43:11.269139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T22:19:54.206559Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15819","last_updated":"2026-07-17T10:28:27Z","snapshot_observed_at":"2026-08-18T02:43:41.371867Z","submitted_at":"2026-07-17T10:28:27Z","title":"In-context learning of closed form solution to simple linear regression task using transformer with linear self-attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T22:19:54.206559Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.15819"},"observation_digest":"sha256:b18899a4eb5faefe9698478ad75ea9514ce5d72831413f072b4d608b2af5f98a","observation_id":"937cce38-7c21-47f1-8935-1769e2e8f247","resolution":{"observed_at":"2026-08-01T22:19:54.206559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-02T09:19:02.240344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19379","last_updated":"2026-07-01T04:05:08Z","snapshot_observed_at":"2026-08-06T07:59:11.722617Z","submitted_at":"2026-07-01T04:05:08Z","title":"Bayesian Wind Tunnels for Model Selection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:19:02.240344Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.19379"},"observation_digest":"sha256:46fe8e41bca910c4626625238c716a5e595e0e8255dd51ad16b8e8ec17324e56","observation_id":"b6f33ba5-fc60-4e30-8f39-4d21678e2008","resolution":{"observed_at":"2026-08-02T09:19:02.240344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-07-31T23:53:01.264186Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23304","last_updated":"2026-07-25T17:33:35Z","snapshot_observed_at":"2026-08-18T09:06:31.639885Z","submitted_at":"2026-07-25T17:33:35Z","title":"Context-Adaptive Inference: A Unified Statistical and Foundation-Model View","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-07-31T23:53:01.264186Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.23304"},"observation_digest":"sha256:fcea485ce08c5326eddc44f2a5327cf8b4dc24f7814e73b1301be792e3db085a","observation_id":"fb9d9422-1de6-444c-adaa-25b1bd307e80","resolution":{"observed_at":"2026-07-31T23:53:01.264186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-01T02:16:27.017180Z","title":"mlr.press/v202/von-oswald23a.html","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25532","last_updated":"2026-07-28T10:17:59Z","snapshot_observed_at":"2026-08-12T12:07:37.443426Z","submitted_at":"2026-07-28T10:17:59Z","title":"Entangled by Design: Spurious Intra-Variable Signal Routing in Tabular In-Context Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:16:27.017180Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2607.25532"},"observation_digest":"sha256:17be1844ed299ae2eb444aa404e7452398d5461b729d334b41f61a3f87a07a9d","observation_id":"90560fd6-493c-48fc-92a2-bc098899d474","resolution":{"observed_at":"2026-08-01T02:16:27.017180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-14T12:25:20.524771Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-18T09:55:49.269753Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.524771Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:d9ca07cb4d2398e0adf5bc71ad7f505510bbe5243069a481018a948541ca34f5","observation_id":"daf18c9b-1bbb-450d-88d6-8fd8d53d52c1","resolution":{"observed_at":"2026-08-14T12:25:20.524771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.07677/citation-record","integrity":"/paper/2212.07677/integrity","json":"/paper/2212.07677/citation-record.json","paper":"/paper/2212.07677"},"outbound":[],"paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:08:30.136973Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2212.07677."}