{"as_of":"2026-08-18T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2c8654f3c6bf4a04d3022530d1d5e88d6e38666e44b05a321dcb4d56c7dbb49","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:28:00.513958Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.04994/citation-record","integrity":"/paper/2505.04994/integrity","json":"/paper/2505.04994/citation-record.json","paper":"/paper/2505.04994"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.02437","last_updated":"2022-12-05T17:25:15Z","snapshot_observed_at":"2026-08-16T16:10:53.222749Z","submitted_at":"2022-12-05T17:25:15Z","title":"In-context Examples Selection for Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02437","snapshot_observed_at":"2026-08-15T23:28:00.341042Z","title":"In-context examples selection for machine translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.341042Z"},"links":{"cited_paper":"/paper/2212.02437","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:f0b7abcacc13da046dd9b8dba1d746c2df7945af226cdb797d8a0ac988f119b7","observation_id":"f7a44d8e-e972-43dd-bd70-fb8a7fb0607a","resolution":{"observed_at":"2026-08-15T23:28:00.341042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.990661Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":"3f2b3b68-9237-4854-b56c-b40c3d484f87","year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.349413Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:8ee0fa4ead72b6a28ab3be63cbb87c1055094bfb8b3d338645e9c05a8ec13967","observation_id":"795d0f5d-f000-4300-b161-bbe5ea5a5a1c","resolution":{"observed_at":"2026-08-15T23:28:00.994807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04637","last_updated":"2023-07-06T16:55:36Z","snapshot_observed_at":"2026-08-16T15:25:44.387232Z","submitted_at":"2023-06-07T17:59:31Z","title":"Transformers as Statisticians: Provable In-Context Learning with In-Context Algorithm Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04637","snapshot_observed_at":"2026-08-15T23:28:00.353445Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.353445Z"},"links":{"cited_paper":"/paper/2306.04637","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:d2abf97b02ea9d5d23457ff2b605def14683d51bf64ad7f50e55e88d236e469b","observation_id":"ff0ad8af-438e-4cb1-a746-c69641bdf4b0","resolution":{"observed_at":"2026-08-15T23:28:00.353445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.357258Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.357258Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:af064501faedcdb61805b33da07a3859226a615605b32642f04fa3fc463a6f86","observation_id":"77ffba7b-778d-4702-8537-2ea2f0a366db","resolution":{"observed_at":"2026-08-15T23:28:00.357258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.972720Z","title":"On the sample complexity of learning under geometric stability","venue":null,"work_id":"e4dbf819-6399-49a3-82ae-76ff627b9f39","year":2021},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.360842Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:5e69801ab863930ea3e4c32cbcdf4fb231f6214063e342f34f8abf5096463b44","observation_id":"e4b74b68-2541-43a7-bf42-d6cb6f59476e","resolution":{"observed_at":"2026-08-15T23:28:00.976476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.364801Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow , March 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.364801Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:438a01b3ba22073475dfaa918f05cbc8cdffbf2070986be3c26bf0679c11ac00","observation_id":"f3322e31-adcd-4405-ab62-67643089e59c","resolution":{"observed_at":"2026-08-15T23:28:00.364801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.368323Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.368323Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:07b79edb15c1c06e1d87dc5e56ff1504f19c453dc9e2a1e71ca546ecb7b4dcbe","observation_id":"cca86f74-a25b-41c6-be85-f074b0e2b154","resolution":{"observed_at":"2026-08-15T23:28:00.368323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.953955Z","title":"Scaling in-context demonstrations with structured attention","venue":null,"work_id":"42143c43-4cc9-4ebf-b98d-4cfee1be4c35","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.371761Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:310af5a51af46baca9d5dcb6415d20a737eb6ad954d33f1b29d513f3319a63c2","observation_id":"7a7994c2-fb5c-4746-b600-8c0d79b1d235","resolution":{"observed_at":"2026-08-15T23:28:00.958617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07661","last_updated":"2024-01-27T08:07:34Z","snapshot_observed_at":"2026-08-16T16:32:08.308907Z","submitted_at":"2022-09-16T00:52:34Z","title":"On the Relation between Sensitivity and Accuracy in In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07661","snapshot_observed_at":"2026-08-15T23:28:00.375106Z","title":"On the relation between sensitivity and accuracy in in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.375106Z"},"links":{"cited_paper":"/paper/2209.07661","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:b7fe25b23bed440c9f70aab455659e280ea8267092e42fbf63397d67deb42deb","observation_id":"bd53c5b6-e005-4fe5-a995-1b0f0f55ed21","resolution":{"observed_at":"2026-08-15T23:28:00.375106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18194","last_updated":"2023-11-30T02:26:55Z","snapshot_observed_at":"2026-08-16T14:39:00.348534Z","submitted_at":"2023-11-30T02:26:55Z","title":"Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes","version":1},"cited_work":{"arxiv_id":"2311.18194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.18194","snapshot_observed_at":"2026-08-15T23:28:00.656803Z","title":"Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes","venue":"cs.LG","work_id":"a0fe1b61-9911-47f1-bfd3-482a48e33a85","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.379848Z"},"links":{"cited_paper":"/paper/2311.18194","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:0c4c2a05a7572d237350081ba9c44a0bff407bef1a84ce87fb7f809ee0d78eae","observation_id":"efc3ca4d-3d10-4702-b24f-434a1c424020","resolution":{"observed_at":"2026-08-15T23:28:00.660667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.384072Z","title":"Introduction to algorithms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.384072Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:6047d4b02924413bf6576fcc0d066235e6e7f7314182bd28938ee61476534383","observation_id":"41fb39e4-7c55-4f81-96e8-6d6a2eb59020","resolution":{"observed_at":"2026-08-15T23:28:00.384072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-16T16:47:10.413798Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-15T23:28:00.387633Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.387633Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:4bd67d5e6bd1d4791cbd635ea75677d257cfec52e1755cdd252319c1c195ebce","observation_id":"0a25691f-d57a-4ab3-b22b-2784ad7fa403","resolution":{"observed_at":"2026-08-15T23:28:00.387633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06912","last_updated":"2024-02-20T22:48:06Z","snapshot_observed_at":"2026-08-16T15:08:45.568857Z","submitted_at":"2023-08-14T03:14:38Z","title":"CausalLM is not optimal for in-context learning","version":3},"cited_work":{"arxiv_id":"2308.06912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06912","snapshot_observed_at":"2026-08-15T23:28:00.627971Z","title":"CausalLM is not optimal for in-context learning","venue":"cs.LG","work_id":"0a6328a6-8d48-477f-9422-256e3de18456","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.391683Z"},"links":{"cited_paper":"/paper/2308.06912","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:6bf6e3e500a49aad32aaf1b0cc15d52615b93d099536530d47259b2429f090bb","observation_id":"bcb69e0f-5d45-496d-bf27-911738d9f7c5","resolution":{"observed_at":"2026-08-15T23:28:00.633934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.936130Z","title":"Transformers learn higher-order optimization methods for in-context learning: A study with linear models","venue":null,"work_id":"8db98448-5ad3-4373-a3e8-0555c0f17183","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.395759Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:dddc7a2a907b5372cd8bf24de9252a16e34b364b82c6d0d33d5c56e1e704d7ee","observation_id":"b5751317-ef0f-4145-b9de-79db185dd133","resolution":{"observed_at":"2026-08-15T23:28:00.939838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.924833Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"631ccde1-8ddd-47d9-811b-7d0c35149ac2","year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.399517Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:ff771846458d78f23307db5963d31066ed0745cb3560d6854da4465654cd42f1","observation_id":"4d074603-ab4f-4ee2-9269-500d508dbb9b","resolution":{"observed_at":"2026-08-15T23:28:00.928662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12017","last_updated":"2023-01-30T05:25:59Z","snapshot_observed_at":"2026-08-02T23:44:31.455796Z","submitted_at":"2022-12-22T19:56:09Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12017","snapshot_observed_at":"2026-08-15T23:28:00.403259Z","title":"Opt-iml: Scaling language model instruction meta learning through the lens of generalization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.403259Z"},"links":{"cited_paper":"/paper/2212.12017","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:5a8621923ecb6e72504033667dddf31ea6ee502f48f5891cc1b96e9d0010e2b0","observation_id":"1dad8738-52bd-4b52-abb3-db512586b952","resolution":{"observed_at":"2026-08-15T23:28:00.403259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.913691Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":"40eea763-8af2-4c81-b1c4-46220811c366","year":2024},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.407162Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:960e61f1f9f3e2838e9fa7949eaf39e580eb49a0e197ddc1b9345d0669a0304a","observation_id":"821e9a9c-c4cf-492f-aedd-ad2a5d090281","resolution":{"observed_at":"2026-08-15T23:28:00.917459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.902609Z","title":"In-context learning learns label relationships but is not conventional learning","venue":null,"work_id":"5fc9f63d-50ec-4251-9c9d-8ece70ae791e","year":2024},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.410845Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:f65c50503034afcdff248848535d8a7ba675e69c486dbbcfe149f1dc997f2318","observation_id":"ec6a6a28-fc78-476e-a08d-d708b3274d94","resolution":{"observed_at":"2026-08-15T23:28:00.906423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.892145Z","title":null,"venue":null,"work_id":"45563916-c768-4793-888b-43ac1a601a68","year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.414634Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:25ccd13ac5289e7458b8526bd6e15aecd1ff09bd6e611f99d61f08d89f747f5d","observation_id":"590420cf-98a5-4982-9217-c1e7f2416b3b","resolution":{"observed_at":"2026-08-15T23:28:00.895737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.418144Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.418144Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:260e36544080ea337797c1a7037e13238e30160d5f08d27e696899334b9e810b","observation_id":"e8365bc9-d41f-4211-b8f1-fbd52fe85acd","resolution":{"observed_at":"2026-08-15T23:28:00.418144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.874519Z","title":"Noisy channel language model prompting for few-shot text classification","venue":null,"work_id":"bfd73294-c20e-4a3a-826a-0f55c22682ca","year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.421622Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:04339a44770b8ad15efcd9fad4f2363a3bca250e6c212f04b8515af3d8cca267","observation_id":"70bf9c7e-3f2a-47b5-b9ea-346a55d84482","resolution":{"observed_at":"2026-08-15T23:28:00.878656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.863723Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":"d4360fd7-a314-45c0-aec4-b7da61871ce0","year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.425285Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:6dfe6593b5c1b05554019e19ad66e7135ab0ccbd013a0e46615f3b499caf007d","observation_id":"d2a3951c-4e1e-4b0e-84c3-08ef43f69276","resolution":{"observed_at":"2026-08-15T23:28:00.867383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.428736Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.428736Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:f8b52c76fd2ec5f2d0b50a76198ed435e8d6beaf7ef06a53ab627f2c32352a44","observation_id":"0a35c9ee-9431-4b19-a02b-f81db30fb5fa","resolution":{"observed_at":"2026-08-15T23:28:00.428736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.846710Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"dc641d08-0606-42ce-98bc-427d9546a114","year":2019},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.432443Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:6bb0829fe0197fe66cb4db91d1559a49bc9bb14168a0d040be448f5310e7031a","observation_id":"d400d65f-3b7b-4d89-b45c-1f3f681b34bb","resolution":{"observed_at":"2026-08-15T23:28:00.850355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.436583Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.436583Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:66401a1bd4d576130cf78265c58aeeab751b5be0d3d7100e6387ff8ef1e60378","observation_id":"7ae1b5f8-d903-41da-ae12-4b1fad490240","resolution":{"observed_at":"2026-08-15T23:28:00.436583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10947","last_updated":"2023-08-01T16:48:47Z","snapshot_observed_at":"2026-08-16T16:07:00.034030Z","submitted_at":"2022-12-21T11:38:51Z","title":"Parallel Context Windows for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10947","snapshot_observed_at":"2026-08-15T23:28:00.440018Z","title":"Parallel context windows improve in-context learning of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.440018Z"},"links":{"cited_paper":"/paper/2212.10947","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:7cc8bf0a3288ae3d04462e167922becdfc8bee048e8ec95a2bd5485493f375a4","observation_id":"ad73a517-8080-4b40-bba5-ba3479ae6683","resolution":{"observed_at":"2026-08-15T23:28:00.440018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08540","last_updated":"2024-06-03T04:18:11Z","snapshot_observed_at":"2026-08-16T14:52:36.033424Z","submitted_at":"2023-10-12T17:32:09Z","title":"Do pretrained Transformers Learn In-Context by Gradient Descent?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08540","snapshot_observed_at":"2026-08-15T23:28:00.444643Z","title":"Do pretrained transformers really learn in-context by gradient descent? arXiv preprint arXiv:2310.08540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.444643Z"},"links":{"cited_paper":"/paper/2310.08540","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:17d6b5c442128e36f4a666c667e3cac190b8151b1ef6da23eb0dda869b540dbb","observation_id":"587ef7f1-ea5f-4514-8ff5-3ffc1576d725","resolution":{"observed_at":"2026-08-15T23:28:00.444643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.827883Z","title":"Giryes, G","venue":null,"work_id":"2efcca5d-9ccc-4959-9cf2-1024c474e97f","year":2016},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.448354Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:cce4ce9f5fd2e925160240fb227b55a4ace5b36cfb73569adcfd608be3201a4e","observation_id":"fe9a095c-b170-4dd7-ad8b-653cf6d4b071","resolution":{"observed_at":"2026-08-15T23:28:00.832466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.815984Z","title":"The exact sample complexity gain from invariances for kernel regression","venue":null,"work_id":"44fee0ae-0c66-4afe-a3e2-fee52e402836","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.451794Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:29f2c626a06f1e5d3a1ced5faa5f509c12ef7428d193eff8413c743f365a3c9b","observation_id":"a97d5010-dd75-4c34-8c8c-1b71dcaccaff","resolution":{"observed_at":"2026-08-15T23:28:00.819890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.455347Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.455347Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:152d852b9f3ea9ba41f4ee127934cd15d2116631394a691cfa658a51de46c0da","observation_id":"ebdcd352-5107-4741-bdff-3e03d8c54408","resolution":{"observed_at":"2026-08-15T23:28:00.455347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.797304Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"170a95bb-7354-4e4d-9e6b-b26633fa499f","year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.458738Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:0ab262b99c4914fdf8816bdd0543a332fde754fb42fe9f4b446a50113ad0c115","observation_id":"d2d9f32d-ff63-4897-b23a-d0822a552be6","resolution":{"observed_at":"2026-08-15T23:28:00.801160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05858","last_updated":"2024-10-15T13:43:50Z","snapshot_observed_at":"2026-08-16T15:01:33.675624Z","submitted_at":"2023-09-11T22:42:50Z","title":"Uncovering mesa-optimization algorithms in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05858","snapshot_observed_at":"2026-08-15T23:28:00.462114Z","title":"Uncovering mesa-optimization algorithms in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.462114Z"},"links":{"cited_paper":"/paper/2309.05858","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:ae7cdd26e4b0e2ae02d457f09909d0265ddc7fe41ef8c8f2df4082f0bbc7991f","observation_id":"a8323610-fdca-4c13-b549-20c9651538da","resolution":{"observed_at":"2026-08-15T23:28:00.462114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.785786Z","title":"Can in-context learning really generalize to out-of-distribution tasks? In ICLR, 2025","venue":null,"work_id":"9cc57e0b-2533-4844-abb9-262bd96ff1cc","year":2025},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.465829Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:87e1fdfc90189dfaacd1c11f6f146f4e2337bd6747f3558fc77aeb2ee8b91bbd","observation_id":"9a0c6fff-d434-4430-abd4-e6d18446cf4e","resolution":{"observed_at":"2026-08-15T23:28:00.789683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.469141Z","title":"A theoretical understanding of self-correction through in-context alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.469141Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:fc9657fc34c3b77ae45b0de8a8b9d1fe71fdd6f9906cf061c69857ffa9bafce9","observation_id":"e3256133-2fc4-4b91-a4d0-5d36a48b52cf","resolution":{"observed_at":"2026-08-15T23:28:00.469141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.767690Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":"5fa870c6-09cd-40b4-bb5f-8a81e9557a2c","year":2021},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.472571Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:13f700150b17e873963437af1cf8fb1368e9c737efe8e094d0b401700457fb93","observation_id":"9b7bfbfe-61b5-47b8-8f96-af5c37c0cab1","resolution":{"observed_at":"2026-08-15T23:28:00.771436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.476021Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.476021Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:b5f82fbe407e32291325f75b92608335ded418d421572ed8346322338fcc5c61","observation_id":"f3825555-f7b2-4fcd-83be-16bccd3c74ca","resolution":{"observed_at":"2026-08-15T23:28:00.476021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10375","last_updated":"2023-05-03T14:43:50Z","snapshot_observed_at":"2026-08-16T16:07:15.963608Z","submitted_at":"2022-12-20T15:55:21Z","title":"Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10375","snapshot_observed_at":"2026-08-15T23:28:00.479396Z","title":"Self-adaptive in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.479396Z"},"links":{"cited_paper":"/paper/2212.10375","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:85a6d3bc888a80273a4411fce2c4983062d4edd0c053fc0778fc83fa92b6ffe4","observation_id":"7771b929-cbda-47aa-b699-530ad5b3d32d","resolution":{"observed_at":"2026-08-15T23:28:00.479396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15637","last_updated":"2024-06-06T12:01:09Z","snapshot_observed_at":"2026-08-17T20:20:03.617697Z","submitted_at":"2024-02-23T22:39:12Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15637","snapshot_observed_at":"2026-08-15T23:28:00.483122Z","title":"Addressing order sensitivity of in-context demonstration examples in causal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.483122Z"},"links":{"cited_paper":"/paper/2402.15637","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:507fbadc6deecd72539cd5740b238502192babaa5d6f14dab0671d4b79e57d48","observation_id":"36c53537-ed1f-4309-8577-facd1534868b","resolution":{"observed_at":"2026-08-15T23:28:00.483122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.749872Z","title":"An explanation of in-context learning as implicit bayesian inference","venue":null,"work_id":"797c4810-9b8c-492a-b84d-d3e439a695b9","year":2021},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.486677Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:eeff1b088a28aaec84825cef0112359fa8d7efa078c87c53db61c76dc724e424","observation_id":"c26a0be6-e398-4909-a1b8-54855541a809","resolution":{"observed_at":"2026-08-15T23:28:00.753763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06469","last_updated":"2024-06-05T09:13:17Z","snapshot_observed_at":"2026-08-16T14:28:00.217974Z","submitted_at":"2024-01-12T09:31:17Z","title":"Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06469","snapshot_observed_at":"2026-08-15T23:28:00.489971Z","title":"Batch-icl: Effective, efficient, and order-agnostic in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.489971Z"},"links":{"cited_paper":"/paper/2401.06469","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:32a97cca97ca1b5cda8c8d1045270ed74498dc243bd117126d7430dd76e8b412","observation_id":"7ca55e77-6a04-4f05-89b0-634813d4ad4c","resolution":{"observed_at":"2026-08-15T23:28:00.489971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.493571Z","title":"Calibrate before use: Improving few-shot performance of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.493571Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:6b033585e0496c331640d5470f5b1f1c47494db987d319e2a0ec098967913444","observation_id":"b2ee7e0a-864f-437a-b312-9a217bb4cc2f","resolution":{"observed_at":"2026-08-15T23:28:00.493571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.731912Z","title":null,"venue":null,"work_id":"444b3f93-3b8e-495f-890c-f8776b1b761a","year":2018},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.497103Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:13e02584bdcd1e473cfa490b72c2654976e8d8378d51cae04a3754d1a2de3d43","observation_id":"c0e1047a-1a13-4bff-8b25-072ad005c440","resolution":{"observed_at":"2026-08-15T23:28:00.735565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.500782Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.500782Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:14b24f9eeeb61a9f1a63dc760ebb9b452eb65edcc81324ea3c6dffbe0e242c58","observation_id":"37f99092-5824-432c-b212-125352c36d2b","resolution":{"observed_at":"2026-08-15T23:28:00.500782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.505383Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.505383Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:de2a6800b32687e282e41ceb83bb261838f822464dcf93a942b4e11bcc4fd8f2","observation_id":"fee94fb7-a8d7-42ee-876b-e9aa1c280ef0","resolution":{"observed_at":"2026-08-15T23:28:00.505383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:28:00.509844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.509844Z"},"links":{"citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:379955a349eee2a9f1ceb58bd785360e970a3c02eb146a4480c11e01b32590f5","observation_id":"ac7283c5-8068-4b85-a14e-52c02b2eb70a","resolution":{"observed_at":"2026-08-15T23:28:00.509844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00297","last_updated":"2023-11-09T21:46:18Z","snapshot_observed_at":"2026-08-16T15:27:41.955031Z","submitted_at":"2023-06-01T02:35:57Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00297","snapshot_observed_at":"2026-08-15T23:28:00.513958Z","title":"Xing , booktitle = NeurIPS , year = 2018 , @inproceedings sokoli2016generalization, title = Generalization Error of Invariant Classifiers , author = Jure Sokolić and R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:28:00.513958Z"},"links":{"cited_paper":"/paper/2306.00297","citing_paper":"/paper/2505.04994"},"observation_digest":"sha256:0a060fbaa84a88ddd02d0c455680d6cd8a5c291e828c0ae97b32d747d2b17a1b","observation_id":"c08f4bea-5577-489d-8ec4-47b159f5f0b5","resolution":{"observed_at":"2026-08-15T23:28:00.513958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.04994","last_updated":"2025-05-08T06:59:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T11:42:55.601981Z","submitted_at":"2025-05-08T06:59:14Z","title":"Rethinking Invariance in In-context Learning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.04994."}