{"as_of":"2026-08-15T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f6b7a4cffab39e638d0b9503b993031f09a46411a922c33154c68f77284555b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:25:20.568189Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13385/citation-record","integrity":"/paper/2608.13385/integrity","json":"/paper/2608.13385/citation-record.json","paper":"/paper/2608.13385"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-14T12:25:20.392114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.392114Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:0d8fd22d62afafbf255200152742be14526a6ebb8c1486e9392252b46f123c1f","observation_id":"fc017263-2b7e-4fe4-93c7-c253e23ee134","resolution":{"observed_at":"2026-08-14T12:25:20.392114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-14T12:25:20.398327Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.398327Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:8f3fb3350cbc64ed630577ca8808f16a838fd9f8d9a7976fe1330430f5cbdc12","observation_id":"bcc7d6d6-f8cd-4873-928b-0406c42d5a51","resolution":{"observed_at":"2026-08-14T12:25:20.398327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:25:21.105945Z","title":null,"venue":null,"work_id":"8e3ec4ed-778d-4427-b0a1-9f8fd3fb0121","year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.404342Z"},"links":{"citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:6503c6ec18f98ebc943d0c510e92057787e088bc593cad5dc2d39e1614a31721","observation_id":"c8e11e3a-5d18-462f-bff5-ce47c2745a9b","resolution":{"observed_at":"2026-08-14T12:25:21.110026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-08-13T05:14:06.788703Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-14T12:25:20.408621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.408621Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:15adde1e25b1322dcb28944e7ce2c6ba7bb4de4056d52efab9800e897e77a01d","observation_id":"52e97647-f601-4bbc-a8ab-cd8b628a1c2a","resolution":{"observed_at":"2026-08-14T12:25:20.408621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-13T13:17:49.818952Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-14T12:25:20.413368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.413368Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:1096ac7ead78fb43d0fe736a85c81dfbc77e4162a90842a5b8a608f5b85cf53c","observation_id":"aba977d2-d585-44a4-b3fc-ef3e7e08c83d","resolution":{"observed_at":"2026-08-14T12:25:20.413368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12736","last_updated":"2024-07-17T08:13:02Z","snapshot_observed_at":"2026-08-15T03:37:28.582142Z","submitted_at":"2024-03-19T13:53:37Z","title":"Towards Multimodal In-Context Learning for Vision & Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12736","snapshot_observed_at":"2026-08-14T12:25:20.419246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.419246Z"},"links":{"cited_paper":"/paper/2403.12736","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:91144ec4881c7de7dc4a9b83933fa24e19c6d5b619b25d1e146c383c982dc426","observation_id":"2c95a73f-4b83-49f8-8fbd-c469f901babc","resolution":{"observed_at":"2026-08-14T12:25:20.419246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00837","last_updated":"2017-05-15T17:58:49Z","snapshot_observed_at":"2026-08-14T21:27:21.230596Z","submitted_at":"2016-12-02T20:57:07Z","title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00837","snapshot_observed_at":"2026-08-14T12:25:20.428086Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.428086Z"},"links":{"cited_paper":"/paper/1612.00837","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:1d08e365540fa7a63ec4647f3860fef7aef32f03308d7c7efbefb8c1bb172e0a","observation_id":"bbaafca0-6a2d-4307-b0b9-f085588084db","resolution":{"observed_at":"2026-08-14T12:25:20.428086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-13T05:42:05.425097Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-14T12:25:20.433188Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.433188Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:8c0ad5dbc17da19abfb367080a88d7757905083fface8be6a8e0c6be444de324","observation_id":"3d011afc-5792-4370-b720-190f88fc958f","resolution":{"observed_at":"2026-08-14T12:25:20.433188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-12T23:37:19.817513Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-14T12:25:20.439241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.439241Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:4eee38ad9bf196b90e302b2897318203529d48658e97ebf04fa3c45cbd793193","observation_id":"6f03b30b-636b-4216-abed-a42feae33873","resolution":{"observed_at":"2026-08-14T12:25:20.439241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20796","last_updated":"2026-05-26T14:33:44Z","snapshot_observed_at":"2026-08-10T08:10:09.932817Z","submitted_at":"2026-01-28T17:37:28Z","title":"Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20796","snapshot_observed_at":"2026-08-14T12:25:20.444342Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.444342Z"},"links":{"cited_paper":"/paper/2601.20796","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:e2b4d8c2dd39d28b83018bcc5c69a3d9581a730a146b77a70a1972f62c9f6c49","observation_id":"537b46df-ed04-42af-9955-4bd386dc975d","resolution":{"observed_at":"2026-08-14T12:25:20.444342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:25:20.450842Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.450842Z"},"links":{"citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:277774acf3fd243a734bbb764cc3f8be9da6402a3d1406819138a14f513ace6c","observation_id":"bab64fb7-04fb-414b-ba00-4fea119a867a","resolution":{"observed_at":"2026-08-14T12:25:20.450842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08851","last_updated":"2025-05-17T14:43:08Z","snapshot_observed_at":"2026-08-07T16:06:39.806990Z","submitted_at":"2025-04-11T03:37:59Z","title":"Mimic In-Context Learning for Multimodal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08851","snapshot_observed_at":"2026-08-14T12:25:20.456349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.456349Z"},"links":{"cited_paper":"/paper/2504.08851","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:6fbec85db8cacbd49286e95aba8c5fe1cfcc11c43913d92c682a1ec9631ad07b","observation_id":"d7a316ab-4e05-4b8d-a21a-67efc54b3ae6","resolution":{"observed_at":"2026-08-14T12:25:20.456349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-14T12:25:20.460988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.460988Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:a66e661c52df6a8d089c55d9795364f7414f504ec674b5fc46b9fda925dceba6","observation_id":"d2eacccb-6752-4d98-ba71-ae2b603cd968","resolution":{"observed_at":"2026-08-14T12:25:20.460988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20944","last_updated":"2025-08-28T16:04:39Z","snapshot_observed_at":"2026-08-15T05:16:54.294520Z","submitted_at":"2025-08-28T16:04:39Z","title":"STARE at the Structure: Steering ICL Exemplar Selection with Structural Alignment","version":1},"cited_work":{"arxiv_id":"2508.20944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.20944","snapshot_observed_at":"2026-08-14T12:25:20.919729Z","title":"STARE at the Structure: Steering ICL Exemplar Selection with Structural Alignment","venue":"cs.CL","work_id":"adf505b8-b5bf-407e-b2e5-1cca3b6e86e4","year":2025},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.467307Z"},"links":{"cited_paper":"/paper/2508.20944","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:23a474cf6f09d085f29e88b0ecb8e45d70892c4c952ea297862a6dc782104a83","observation_id":"26f14349-9cc1-4e46-a011-705cd973b0d0","resolution":{"observed_at":"2026-08-14T12:25:20.927913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22854","snapshot_observed_at":"2026-08-14T12:25:20.472516Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.472516Z"},"links":{"cited_paper":"/paper/2509.22854","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:60b5e59c9317854511d7d993c4028178878771a5f476331afc9455cc327116df","observation_id":"ea781fbe-d942-4f7f-9b39-d617e33c5649","resolution":{"observed_at":"2026-08-14T12:25:20.472516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:25:20.477568Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.477568Z"},"links":{"citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:faaa8ff8ae5c94d071e070bb8d954f9e1ddbc9456a84b3fc586616e740a3d19c","observation_id":"0f75de65-340c-4a1b-98e6-78db09d28c07","resolution":{"observed_at":"2026-08-14T12:25:20.477568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04633","last_updated":"2025-08-26T10:19:05Z","snapshot_observed_at":"2026-08-07T16:08:09.756091Z","submitted_at":"2025-04-06T22:02:21Z","title":"M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04633","snapshot_observed_at":"2026-08-14T12:25:20.485623Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.485623Z"},"links":{"cited_paper":"/paper/2504.04633","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:7524b83d5da97cb8b5d453e7a69ad0ea17bf337d054f2570dd5963e6f806144a","observation_id":"d09bbd4b-e638-4401-972c-b897c86dccb0","resolution":{"observed_at":"2026-08-14T12:25:20.485623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14660","last_updated":"2025-02-25T14:49:33Z","snapshot_observed_at":"2026-08-12T23:59:44.789068Z","submitted_at":"2024-05-23T14:57:52Z","title":"Implicit In-context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14660","snapshot_observed_at":"2026-08-14T12:25:20.491489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.491489Z"},"links":{"cited_paper":"/paper/2405.14660","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:6ba103b0138d442fc575fcad61e4d87d6e2e237c31ae0694a5ca64f3efc587ca","observation_id":"ae6b7285-7ab3-4029-9ffd-8267a5cb9212","resolution":{"observed_at":"2026-08-14T12:25:20.491489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-14T12:25:20.497916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.497916Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:0fb695a398fd745a399abe0ca08955cbf7bc50cea47e42246a9b26c82c2e9084","observation_id":"7846e799-ecc7-4547-a4f9-c8ec4728d78f","resolution":{"observed_at":"2026-08-14T12:25:20.497916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06668","last_updated":"2024-02-13T22:37:39Z","snapshot_observed_at":"2026-08-14T16:06:18.731069Z","submitted_at":"2023-11-11T21:19:44Z","title":"In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06668","snapshot_observed_at":"2026-08-14T12:25:20.507829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.507829Z"},"links":{"cited_paper":"/paper/2311.06668","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:b6062c3dbd0c8b767dad99952cef06c6793e7bdd53765480184bbf6de063f311","observation_id":"6a1adcf5-6235-4762-bb77-b65a4d00852a","resolution":{"observed_at":"2026-08-14T12:25:20.507829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00067","last_updated":"2019-09-04T10:43:20Z","snapshot_observed_at":"2026-08-14T16:22:47.713229Z","submitted_at":"2019-05-31T20:29:01Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00067","snapshot_observed_at":"2026-08-14T12:25:20.515072Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.515072Z"},"links":{"cited_paper":"/paper/1906.00067","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:24a41142930336c0630e8817eaa9d29729593ede2b52b2d20e03fd3ddcd7322c","observation_id":"39524009-c21d-46c3-87dd-5d5c22842be3","resolution":{"observed_at":"2026-08-14T12:25:20.515072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-14T12:25:20.519581Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.519581Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:22fad1e3e4c6542a302c90110789ae32d6afc19eedc37f7a623daa0ab7ea0eff","observation_id":"e344edda-438f-4548-81ef-49e5d3c7ce66","resolution":{"observed_at":"2026-08-14T12:25:20.519581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07677","last_updated":"2023-05-31T08:59:47Z","snapshot_observed_at":"2026-08-14T18:27:26.913026Z","submitted_at":"2022-12-15T09:21:21Z","title":"Transformers learn in-context by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07677","snapshot_observed_at":"2026-08-14T12:25:20.524771Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.524771Z"},"links":{"cited_paper":"/paper/2212.07677","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:1ea976e3d35e6fbc253141e1bf652d83a193bc058264dddbd439585f10ffe394","observation_id":"daf18c9b-1bbb-450d-88d6-8fd8d53d52c1","resolution":{"observed_at":"2026-08-14T12:25:20.524771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13185","last_updated":"2024-10-31T02:35:03Z","snapshot_observed_at":"2026-08-12T23:39:36.095239Z","submitted_at":"2024-06-19T03:33:45Z","title":"LIVE: Learnable In-Context Vector for Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13185","snapshot_observed_at":"2026-08-14T12:25:20.530439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.530439Z"},"links":{"cited_paper":"/paper/2406.13185","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:73863a97183edce3ea4bb69cdbd47abf710552411fb23916ed5733d8b32366e9","observation_id":"28ca7e54-5561-4bde-baa1-cc503637035f","resolution":{"observed_at":"2026-08-14T12:25:20.530439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-08-12T22:14:21.779675Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-14T12:25:20.535764Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.535764Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:154108244c4397f5c65cc206fbdd75a5af3e334d21b898b6b67e0719122621d3","observation_id":"22fa7297-7e1c-41fe-bdfc-d4b0bfee6443","resolution":{"observed_at":"2026-08-14T12:25:20.535764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-12T23:46:50.077288Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-14T12:25:20.540281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.540281Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:8397b16d4802f4cc2d80d188fbdec4b1508fcaadc5d5fbc8a99dddb7751ee118","observation_id":"f7681ec2-f2ad-47ef-8814-7fa80d1444a0","resolution":{"observed_at":"2026-08-14T12:25:20.540281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07129","last_updated":"2024-04-10T16:07:38Z","snapshot_observed_at":"2026-08-13T00:33:16.991894Z","submitted_at":"2024-04-10T16:07:38Z","title":"What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07129","snapshot_observed_at":"2026-08-14T12:25:20.546289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.546289Z"},"links":{"cited_paper":"/paper/2404.07129","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:0194f7efcc7d38b4a1d41549a6539b2a06d22ddcc12a26aa872d4b96e7490554","observation_id":"754e5f61-90a1-4e01-9a12-dd61ba3d9f87","resolution":{"observed_at":"2026-08-14T12:25:20.546289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-13T04:57:24.068800Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-14T12:25:20.550940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.550940Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:5fe74fa496fd699c65ec26f5d6008d61d0d7035c5c92606ec380a67c45926e7d","observation_id":"7021379d-49e2-442e-912b-daba235122a2","resolution":{"observed_at":"2026-08-14T12:25:20.550940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07891","last_updated":"2023-08-15T17:33:24Z","snapshot_observed_at":"2026-08-13T10:34:09.343292Z","submitted_at":"2023-08-15T17:33:24Z","title":"Link-Context Learning for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07891","snapshot_observed_at":"2026-08-14T12:25:20.557658Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.557658Z"},"links":{"cited_paper":"/paper/2308.07891","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:808f0de671f344ec0454e158dfaa6f64501ef4253273c3ee9460e7fb7744a960","observation_id":"a2c8165b-bd6f-4367-9fb7-a22a2fc4fe5d","resolution":{"observed_at":"2026-08-14T12:25:20.557658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-13T05:42:53.020730Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-14T12:25:20.562359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.562359Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:9838434a033fd42d5430bb906c9135ac53fac0e4d2a760fe2997b79054c905a5","observation_id":"6b5a5a94-d062-4fc1-83f6-48d27875411a","resolution":{"observed_at":"2026-08-14T12:25:20.562359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-14T12:25:20.568189Z","title":"Li Storyline 1.Why interesting? a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.568189Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:3d993f8a9b2444831130cbe51d360d6d80177a08cbd054e1bd53e6bdd6371e42","observation_id":"9af55475-d233-430c-8a2a-cd24eec435ac","resolution":{"observed_at":"2026-08-14T12:25:20.568189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T06:16:09.634792Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.13385."}