{"as_of":"2026-08-19T17:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a6cd98848017d5bce063f7888ad6e087339ca329f6b9309da2c3c34397840e3","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:50:23.244358Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:25:20.472516Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:33:58.600956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"cited_work":{"arxiv_id":"2509.22854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22854","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalizable implicit in-context learning with attention routing","venue":null,"work_id":"2c86b4a3-0f38-4573-9b7a-673f7f8d9840","year":2025},"citing_paper":{"arxiv_id":"2605.20730","last_updated":"2026-05-20T05:26:38Z","snapshot_observed_at":"2026-08-17T00:54:33.947872Z","submitted_at":"2026-05-20T05:26:38Z","title":"Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T05:32:01.059706Z"},"links":{"cited_paper":"/paper/2509.22854","citing_paper":"/paper/2605.20730"},"observation_digest":"sha256:26ef642a3e2852d79c2fccea8de2ccdb18c20bcc713338e5f83f75f0f8ca46f9","observation_id":"966e88eb-be64-4ced-9e10-ee70b5369dd1","resolution":{"observed_at":"2026-06-03T13:05:38.627651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22854","snapshot_observed_at":"2026-08-14T12:25:20.472516Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-18T09:55:49.269753Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.472516Z"},"links":{"cited_paper":"/paper/2509.22854","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:d04bf2b282d72217df25cc1e0ec264e2760c59dfa15213f36ad9be086617cf66","observation_id":"ea781fbe-d942-4f7f-9b39-d617e33c5649","resolution":{"observed_at":"2026-08-14T12:25:20.472516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.22854/citation-record","integrity":"/paper/2509.22854/integrity","json":"/paper/2509.22854/citation-record.json","paper":"/paper/2509.22854"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-16T14:14:00.817200Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-04T14:50:22.033438Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.033438Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:7544f99a8ca75ed8b9e98b1e217df066fe4a3c6a82f0dc975c332fa38924272d","observation_id":"c25d9971-bf1e-4d93-a035-a836d7cc835e","resolution":{"observed_at":"2026-08-04T14:50:22.033438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.239578Z","title":"More importantly, as the input length increases, the inference time of few-shot grows much faster than that of ICR","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.239578Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:cd462d01f170db5c7a2da427e499311b0fbf48f715ff9522afe1a4521963054a","observation_id":"9af70504-b30d-4139-af1c-afc375105dad","resolution":{"observed_at":"2026-08-04T14:50:23.239578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.244358Z","title":"cross-dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.244358Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:4fd5aa9dca74e4e2c34beba7e0189fa9610a0616309d8d322d79e87264792980","observation_id":"a5af7271-d133-4aca-b2d9-32e2bec09075","resolution":{"observed_at":"2026-08-04T14:50:23.244358Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T14:50:22.731921Z","title":"Qi Guo, Leiyu Wang, Yidong Wang, Wei Ye, and Shikun Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.731921Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:5faab3847cbe8b60220e4f36b552982eb43863ef3cd6689fbf63484d6f765743","observation_id":"82aa3593-2484-48e3-888a-c38ca0010efa","resolution":{"observed_at":"2026-08-04T14:50:22.731921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-17T03:03:22.868290Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-04T14:50:22.808650Z","title":"In-context learning creates task vectors.arXiv preprint arXiv:2310.15916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.808650Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:56b8d3b04a29c3223654e6bf347d4c20e7a2ae344db632ba53ec79369f4a5099","observation_id":"44a17e93-b972-45ac-9a3c-0beca0d9a932","resolution":{"observed_at":"2026-08-04T14:50:22.808650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16130","last_updated":"2024-04-03T16:27:31Z","snapshot_observed_at":"2026-08-16T15:29:40.993745Z","submitted_at":"2023-05-25T15:04:01Z","title":"Language Models Implement Simple Word2Vec-style Vector Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16130","snapshot_observed_at":"2026-08-04T14:50:23.166106Z","title":"Jack Merullo, Carsten Eickhoff, and Ellie Pavlick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.166106Z"},"links":{"cited_paper":"/paper/2305.16130","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:965a02a015cddf016d2db7076898c962cba0e5bb3abed39bd575bb12b8339546","observation_id":"0a9b24fd-0d51-4178-8f14-e357930dbe82","resolution":{"observed_at":"2026-08-04T14:50:23.166106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15943","last_updated":"2022-05-03T10:36:39Z","snapshot_observed_at":"2026-08-18T01:41:47.664997Z","submitted_at":"2021-10-29T17:42:08Z","title":"MetaICL: Learning to Learn In Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15943","snapshot_observed_at":"2026-08-04T14:50:23.170294Z","title":"Metaicl: Learning to learn in context.arXiv preprint arXiv:2110.15943,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.170294Z"},"links":{"cited_paper":"/paper/2110.15943","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:1d6e150d52f4936f75f975b99554a696e20a461f35a4c6976c4dcf17c771ea77","observation_id":"c3bce674-6557-48fd-b743-f82b92e071a9","resolution":{"observed_at":"2026-08-04T14:50:23.170294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-18T21:12:50.808922Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-04T14:50:23.174869Z","title":"Catherine Olsson, Nelson Elhage, Neel Nanda, Nicholas Joseph, Nova DasSarma, Tom Henighan, Ben Mann, Amanda Askell, Yuntao Bai, Anna Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.174869Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:d269064a0c6c76a14b101e62d52383dc1185a246f6f1341679038c046b3b3a87","observation_id":"f400c71f-1e22-4677-8f4e-747d308f8f76","resolution":{"observed_at":"2026-08-04T14:50:23.174869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.184071Z","title":"doi: 10.3115/1219840.1219855","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.184071Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:f473c4886667b2d4cf9dcc31c37b73e850255c1404d82e18574f0c38b5b3b198","observation_id":"4a7fe9d9-a096-4e72-9fd2-9f96448617ae","resolution":{"observed_at":"2026-08-04T14:50:23.184071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T14:50:23.192290Z","title":"Johannes V on Oswald, Eyvind Niklasson, Ettore Randazzo, Jo ˜ao Sacramento, Alexander Mordv- intsev, Andrey Zhmoginov, and Max Vladymyrov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.192290Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:0407c9d78165c155c6b80fc44600ca49159c8f7f58d96925245a87fda52b04c1","observation_id":"994a7e63-778f-4647-b355-323f51efd39b","resolution":{"observed_at":"2026-08-04T14:50:23.192290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09343","last_updated":"2025-02-26T06:41:43Z","snapshot_observed_at":"2026-08-16T13:10:07.876615Z","submitted_at":"2024-10-12T03:19:06Z","title":"ELICIT: LLM Augmentation via External In-Context Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09343","snapshot_observed_at":"2026-08-04T14:50:23.196943Z","title":"Elicit: Llm augmentation via external in- context capability.arXiv preprint arXiv:2410.09343, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.196943Z"},"links":{"cited_paper":"/paper/2410.09343","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:51f71b060db76f3bff2840acf1fd3d3cb4ce13a7c0fde43379ccd26ddf5941ee","observation_id":"05319dbf-edd4-4a00-a543-cd34d99d4e15","resolution":{"observed_at":"2026-08-04T14:50:23.196943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10375","last_updated":"2023-05-03T14:43:50Z","snapshot_observed_at":"2026-08-16T16:07:15.963608Z","submitted_at":"2022-12-20T15:55:21Z","title":"Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10375","snapshot_observed_at":"2026-08-04T14:50:23.201430Z","title":"Self-adaptive in-context learning: An information compression perspective for in-context example selection and ordering.arXiv preprint arXiv:2212.10375,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.201430Z"},"links":{"cited_paper":"/paper/2212.10375","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:193e320565503961a36a62816af248b0fec0f01ca83df7ebfa05c25a9811148b","observation_id":"bc499890-326d-4133-bc1a-28337bec954b","resolution":{"observed_at":"2026-08-04T14:50:23.201430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15637","last_updated":"2024-06-06T12:01:09Z","snapshot_observed_at":"2026-08-17T20:20:03.617697Z","submitted_at":"2024-02-23T22:39:12Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15637","snapshot_observed_at":"2026-08-04T14:50:23.206160Z","title":"Addressing order sensitivity of in-context demonstration examples in causal language models.arXiv preprint arXiv:2402.15637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.206160Z"},"links":{"cited_paper":"/paper/2402.15637","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:70f52bee7439e5b39d1820d90d47ad81ebe030a88f006f4462d29b34fbbaa880","observation_id":"d09bab47-963e-40f8-9968-d96c6e3338be","resolution":{"observed_at":"2026-08-04T14:50:23.206160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-04T14:50:23.211091Z","title":"An explanation of in-context learning as implicit bayesian inference.arXiv preprint arXiv:2111.02080,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.211091Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:6f8db82986c93be53d5a34c2a9226d1802e9b2ad9940a07d919bdb2533ea75c3","observation_id":"4cd13016-bd0e-4f67-9b63-926595056edc","resolution":{"observed_at":"2026-08-04T14:50:23.211091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00871","last_updated":"2023-11-01T21:41:08Z","snapshot_observed_at":"2026-08-16T14:46:43.704070Z","submitted_at":"2023-11-01T21:41:08Z","title":"Pretraining Data Mixtures Enable Narrow Model Selection Capabilities in Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00871","snapshot_observed_at":"2026-08-04T14:50:23.215388Z","title":"Pretraining data mixtures enable narrow model selection capabilities in transformer models.arXiv preprint arXiv:2311.00871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.215388Z"},"links":{"cited_paper":"/paper/2311.00871","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:66b8808cf38683367dd8d42b8d611d050b253a6916830b11eda2acc401252f5c","observation_id":"6d911264-1561-445f-a98e-36f6d29df409","resolution":{"observed_at":"2026-08-04T14:50:23.215388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T14:50:23.219645Z","title":"Kayo Yin and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.219645Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:2eabd62fccfb1dc2c6d93f23d9945f7e14fb2cb3a0e67f37336db683362f6b55","observation_id":"9d9ffb5d-df01-4b9c-b496-f5e54429b280","resolution":{"observed_at":"2026-08-04T14:50:23.219645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.224062Z","title":null,"venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.224062Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:b15b6f1ccd01f63c0f02626b97b2eaf4b46e20efb29477cc5920050f4fb87454","observation_id":"d4b2d54c-1f05-4460-88aa-b56786235d86","resolution":{"observed_at":"2026-08-04T14:50:23.224062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.229151Z","title":"An identical argument applies toU k","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.229151Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:bdd405d7db6084c9db566ebc92af48be493820aed3df7126ca355d0bf377329d","observation_id":"b7157842-139f-4c28-8750-e890e6040551","resolution":{"observed_at":"2026-08-04T14:50:23.229151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.234829Z","title":"For training, we use the same number of few-shot examples as those contained in an ICL prompt during the construction of ICL bases, drawn from five in-domain datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.234829Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:e65e9740eb1a8b7e8c2487fd61aaa66a46d046cab0596f21972fe7b7cadc4158","observation_id":"ca6c0cdf-c5b0-45e4-9c7a-f855583512b4","resolution":{"observed_at":"2026-08-04T14:50:23.234829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:22.552599Z","title":"URLhttps://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":1970,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.552599Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:9940b47d2f5d95c600fbf5de767d0fcd39e712148f87a6440925b382a50592ed","observation_id":"783df9d7-7fa4-4631-b747-30e336762a43","resolution":{"observed_at":"2026-08-04T14:50:22.552599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08049","last_updated":"2024-04-02T01:54:53Z","snapshot_observed_at":"2026-08-16T14:52:49.795804Z","submitted_at":"2023-10-12T05:43:06Z","title":"Is attention required for ICL? Exploring the Relationship Between Model Architecture and In-Context Learning Ability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08049","snapshot_observed_at":"2026-08-04T14:50:23.031609Z","title":"Is attention required for icl? exploring the relationship between model architecture and in-context learning ability.arXiv preprint arXiv:2310.08049,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.031609Z"},"links":{"cited_paper":"/paper/2310.08049","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:c74d51ed9cb728ace6e8a372419df8f24dfe7477711a8c5bdb0d5425bcb30b3d","observation_id":"add3b2d0-56e7-4ae6-9388-8f9344101000","resolution":{"observed_at":"2026-08-04T14:50:23.031609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.156936Z","title":"M2iv: Towards efficient and fine-grained multimodal in-context learning via representation engineering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.156936Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:f0c4ca96d9e4301e29a9cd067a07aab719c9689e0f8b35a89f6b52a6e6db525b","observation_id":"cba2eb2f-9aa9-493e-b8e0-c66fbeda1485","resolution":{"observed_at":"2026-08-04T14:50:23.156936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-04T14:50:22.627647Z","title":"A survey on in-context learning.arXiv preprint arXiv:2301.00234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.627647Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:2e2ed5d7d980f282086264edb0d1c092fe2fabc25656a4cf39f8341b7a33e946","observation_id":"32e6b99f-c986-4658-a64f-414c0e48b27f","resolution":{"observed_at":"2026-08-04T14:50:22.627647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-19T03:27:40.295531Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-04T14:50:22.436932Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers.arXiv preprint arXiv:2212.10559,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.436932Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:9acb84d8867a0dd82d8e0d080bc0ce837b9640873d088034f1059ee2085734bc","observation_id":"ba35a10a-481a-42e2-9508-fdf5e60b80a3","resolution":{"observed_at":"2026-08-04T14:50:22.436932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-19T06:08:25.062288Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-04T14:50:23.187923Z","title":"Function vectors in large language models.arXiv preprint arXiv:2310.15213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.187923Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:7f1021c27fba40dab5d52a73f65865ccf29b725ad1db23b0f0631d7fe132bdf0","observation_id":"16181b88-35f6-415c-9a9e-ef0583fae94f","resolution":{"observed_at":"2026-08-04T14:50:23.187923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:21.969963Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:21.969963Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:c82d7358c8105760a7700becd2038aaf4be4ccfea8dda587ca4fde3bd08c6d7d","observation_id":"3b1a1d2a-a493-4ba9-9c45-de2bea18e80b","resolution":{"observed_at":"2026-08-04T14:50:21.969963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06668","last_updated":"2024-02-13T22:37:39Z","snapshot_observed_at":"2026-08-16T14:44:06.517821Z","submitted_at":"2023-11-11T21:19:44Z","title":"In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06668","snapshot_observed_at":"2026-08-04T14:50:23.161687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.161687Z"},"links":{"cited_paper":"/paper/2311.06668","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:01afec652da72115da699ef6bc633274d0deda675a4e53dc6752286a5f11e55c","observation_id":"52ee78c3-2997-409b-9924-78f6d5982f6c","resolution":{"observed_at":"2026-08-04T14:50:23.161687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01653","last_updated":"2021-09-03T17:56:40Z","snapshot_observed_at":"2026-08-16T17:58:57.720290Z","submitted_at":"2021-09-03T17:56:40Z","title":"CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01653","snapshot_observed_at":"2026-08-04T14:50:23.179507Z","title":"Creak: A dataset for common- sense reasoning over entity knowledge.arXiv preprint arXiv:2109.01653,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.179507Z"},"links":{"cited_paper":"/paper/2109.01653","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:f46df4c563d07fea4a6256acb169a9815f8be2ae924114cd129aae85c669eb0f","observation_id":"092222b2-7b0b-421f-86fc-33828e0c044d","resolution":{"observed_at":"2026-08-04T14:50:23.179507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T14:50:22.913368Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.913368Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:d37389ab3609b4b1c47e61103bc0a62f3f4b908a23fa0e1f659f3d39f2e16390","observation_id":"a5a7667d-935e-4e89-9372-e419cd2f311a","resolution":{"observed_at":"2026-08-04T14:50:22.913368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07661","last_updated":"2024-01-27T08:07:34Z","snapshot_observed_at":"2026-08-16T16:32:08.308907Z","submitted_at":"2022-09-16T00:52:34Z","title":"On the Relation between Sensitivity and Accuracy in In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07661","snapshot_observed_at":"2026-08-04T14:50:22.163974Z","title":"On the relation between sensitivity and accuracy in in-context learning.arXiv preprint arXiv:2209.07661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.163974Z"},"links":{"cited_paper":"/paper/2209.07661","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:6bcadb9710989319c8141057cf5504fe82a8670bd12a884c7ac3edbd667c9267","observation_id":"c7acb8e5-97fb-4cb9-93c2-2060b522dffa","resolution":{"observed_at":"2026-08-04T14:50:22.163974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T14:50:22.311948Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.311948Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:f009adb768117809b9f5f69cc430200fa15d8c66511e69d8017a46129a2dd2df","observation_id":"096fbc21-f5ac-4cd6-bbd0-3a79b1fb0c85","resolution":{"observed_at":"2026-08-04T14:50:22.311948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T22:39:46.677652Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2509.22854."}