{"as_of":"2026-08-16T11:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ee8820753117b94add482b557b8817696f14dcde1f3324337271b3112253541","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:05:19.425102Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02830/citation-record","integrity":"/paper/2608.02830/integrity","json":"/paper/2608.02830/citation-record.json","paper":"/paper/2608.02830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.247822Z","title":"Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"de61eff9-441e-466e-906b-ca365d99bed1","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.178058Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:74e03e56a6935cf572caab44fbb88fb8b8ea46355e9412839f7550115b9be61b","observation_id":"f74844ff-3eb6-4ec1-ad49-3f41c5e6e154","resolution":{"observed_at":"2026-08-15T15:05:20.251879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T15:05:19.183255Z","title":"NeurIPS 2022 arXiv:2204.14198","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.183255Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:fec27e00750952b2b03862b1a59f0ee6d824472b47fd887bd9db36e9ffca3e1f","observation_id":"1ae0ff46-6ca4-41ae-8df0-0c00860dfcf3","resolution":{"observed_at":"2026-08-15T15:05:19.183255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00647","last_updated":"2022-09-01T17:59:33Z","snapshot_observed_at":"2026-08-15T08:28:27.744915Z","submitted_at":"2022-09-01T17:59:33Z","title":"Visual Prompting via Image Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00647","snapshot_observed_at":"2026-08-15T15:05:19.187888Z","title":"NeurIPS 2022 arXiv:2209.00647","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.187888Z"},"links":{"cited_paper":"/paper/2209.00647","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:75ff414f96956886de2ae2186c1f381d5a31832f985c8934f2c60d037eb33618","observation_id":"76be4683-5642-4e41-ab7e-25354952c26d","resolution":{"observed_at":"2026-08-15T15:05:19.187888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.236070Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"f92e08c4-fc92-4daa-aa09-850c282c80e2","year":2020},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.192879Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:37730d0d11b51dfc9c2736b593a8312752805fc393c6852a14e12375aa5334f0","observation_id":"c91a7ee2-a6c9-4aba-9815-f2c92fe582cf","resolution":{"observed_at":"2026-08-15T15:05:20.239969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07211","last_updated":"2020-10-22T14:00:23Z","snapshot_observed_at":"2026-08-15T17:05:42.828926Z","submitted_at":"2020-04-15T17:13:05Z","title":"Dark Experience for General Continual Learning: a Strong, Simple Baseline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07211","snapshot_observed_at":"2026-08-15T15:05:19.197206Z","title":"NeurIPS 2020 arXiv:2004.07211","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.197206Z"},"links":{"cited_paper":"/paper/2004.07211","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:3406b80143f8f9ca41111bd92ea4a2b202ce454cfa5412f6f30a92035672018f","observation_id":"6ecef90c-5666-4389-8654-a1c1814fede3","resolution":{"observed_at":"2026-08-15T15:05:19.197206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.17940","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.488862Z","title":"Journal of Artificial Intelligence Research 83","venue":null,"work_id":"de8484eb-51f9-4d3d-b89a-be758d663291","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.202052Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:cfa59d12f0cfe932817e999f470474cba3dd161583d27440171dca1efcde92b7","observation_id":"82f2879f-c12c-43f9-94d6-06b399106300","resolution":{"observed_at":"2026-08-15T15:05:19.493578Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15275","last_updated":"2024-01-27T03:03:30Z","snapshot_observed_at":"2026-08-16T04:11:11.935018Z","submitted_at":"2024-01-27T03:03:30Z","title":"Dynamic Transformer Architecture for Continual Learning of Multimodal Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15275","snapshot_observed_at":"2026-08-15T15:05:19.206333Z","title":"Neurocomputing https://doi.org/10.1016/j.neucom.2025","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.206333Z"},"links":{"cited_paper":"/paper/2401.15275","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:9bcd151b84b095cfe00d709584cc692d1c882252e52418de43e79383adae99b9","observation_id":"8bc23db6-8638-4009-b64d-d223cd56d6bb","resolution":{"observed_at":"2026-08-15T15:05:19.206333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.225326Z","title":"In: Findings of the Association for Computational Linguistics: EMNLP 2023","venue":null,"work_id":"6b77c0cf-8a6a-4ab7-bc1f-c2812eb8fc80","year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.211156Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:d8d4da8d7f23a1ddecaa482438abcf1b3c8708ece85e1b01dcce137c52b3415e","observation_id":"4c91a0bf-4c08-49e0-80b0-c3b1d403716c","resolution":{"observed_at":"2026-08-15T15:05:20.229022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00420","last_updated":"2019-01-09T11:11:47Z","snapshot_observed_at":"2026-08-15T06:05:04.839393Z","submitted_at":"2018-12-02T16:39:19Z","title":"Efficient Lifelong Learning with A-GEM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00420","snapshot_observed_at":"2026-08-15T15:05:19.215000Z","title":"ICLR 2019 arXiv:1812.00420","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.215000Z"},"links":{"cited_paper":"/paper/1812.00420","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:0037623144793dc22e1eedfc9cb65358a4599d87f0fb322e4a77fc79c6e7352d","observation_id":"95009d97-308c-4035-8562-4a5a777567cf","resolution":{"observed_at":"2026-08-15T15:05:19.215000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08350","last_updated":"2024-10-23T02:16:37Z","snapshot_observed_at":"2026-08-16T11:01:07.232462Z","submitted_at":"2024-03-13T08:54:31Z","title":"CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08350","snapshot_observed_at":"2026-08-15T15:05:19.219948Z","title":"NeurIPS 2024 arXiv:2403.08350","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.219948Z"},"links":{"cited_paper":"/paper/2403.08350","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:136caec832ed5d0b6419fb47a2b1662f4ec1e6256b7b1ee6ba26952209435ecd","observation_id":"02474b9f-7276-4ed0-9057-33179de12e1c","resolution":{"observed_at":"2026-08-15T15:05:19.219948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-15T15:05:19.224407Z","title":"CVPR 2024 arXiv:2312.14238","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.224407Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:8bf40e39f9950e39ff442c04ae542ac8509a4d7ec4e9ba67a20fb53d11c4cf5b","observation_id":"71f8a4f3-0c85-4ea4-9d42-20a71d325e3c","resolution":{"observed_at":"2026-08-15T15:05:19.224407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.228317Z","title":"arXiv 2024 arXiv:2412.14133","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.228317Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:93d67354c39463b38ed9c59c9318d891dc51d0fad4fc5fd052ca9bc33c56901d","observation_id":"bc47f6a0-a5fc-48f4-8ca2-83499c1f7a21","resolution":{"observed_at":"2026-08-15T15:05:19.228317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-15T15:05:19.232157Z","title":"NeurIPS 2023 arXiv:2305.06500","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.232157Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:9d2efecf915083e42f8601fa446240a69f159cd2c24468b5fb317d75f7768791","observation_id":"12fefd31-8a7d-416b-b172-c493c7cd75f2","resolution":{"observed_at":"2026-08-15T15:05:19.232157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.213257Z","title":"arXiv preprint arXiv:240721783","venue":null,"work_id":"170a1c7a-4872-4864-93b5-07464ca41fa8","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.236035Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:03e791e11ec436cf72a08d5d9628d56e4fe43e54b77cb53127ba9b8739d32776","observation_id":"071a472c-c60a-4c7a-a006-c603b5745abc","resolution":{"observed_at":"2026-08-15T15:05:20.217510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16320","last_updated":"2025-02-07T20:56:08Z","snapshot_observed_at":"2026-08-12T23:36:29.628366Z","submitted_at":"2024-06-24T05:13:19Z","title":"What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16320","snapshot_observed_at":"2026-08-15T15:05:19.239990Z","title":"NeurIPS 2024 arXiv:2406.16320","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.239990Z"},"links":{"cited_paper":"/paper/2406.16320","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2b85562fe835dd19ca33649fcb33cab597198b935cfe54165d3d9761b050ab14","observation_id":"c95a98e6-c24f-4e63-8bb4-ceb56c8ca4a6","resolution":{"observed_at":"2026-08-15T15:05:19.239990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-13T05:42:05.425097Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-15T15:05:19.244570Z","title":"EMNLP 2023 arXiv:2310.15916","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.244570Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:0d5ca1659f079af6615b04211ffe27ba50df5ddd30d5277ff0f4ec78a8dc95e0","observation_id":"47cbfc79-76cf-4e78-b84b-64cf24d85afa","resolution":{"observed_at":"2026-08-15T15:05:19.244570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T15:05:19.248324Z","title":"ICLR 2022 arXiv:2106.09685","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.248324Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:b10274714fc05bdd9bf6962c867703f20bdc021b8d9c41bc407324f3a6451539","observation_id":"f66645ce-bfcf-4610-adde-78c8fbac5805","resolution":{"observed_at":"2026-08-15T15:05:19.248324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08803","last_updated":"2025-05-10T22:42:29Z","snapshot_observed_at":"2026-08-15T22:31:16.482388Z","submitted_at":"2025-05-10T22:42:29Z","title":"Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08803","snapshot_observed_at":"2026-08-15T15:05:19.252415Z","title":"arXiv preprint arXiv:250508803 URL https://arxiv.org/abs/2505.08803","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.252415Z"},"links":{"cited_paper":"/paper/2505.08803","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:800bdefab3f7b716a94bfe928c8d1b115a986886bd1fe644703abeab419734be","observation_id":"81a55e4c-ed6b-4d49-8a37-69991462b877","resolution":{"observed_at":"2026-08-15T15:05:19.252415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-12T23:37:19.817513Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-15T15:05:19.256230Z","title":"NeurIPS 2024 arXiv:2406.15334","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.256230Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:01727744fdc69e10c465260e4a494a1ce53f03b08090bd9d52c6d063ccf4f832","observation_id":"76b08a8e-690f-4024-9cb9-390ca9ab9bd3","resolution":{"observed_at":"2026-08-15T15:05:19.256230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-15T04:47:39.586346Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-15T15:05:19.260230Z","title":"arXiv 2025 arXiv:2506.07936","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.260230Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:576763d799f0f26c4bb928cec65eed70404cec80eaf3cb1559e7750697cd50e8","observation_id":"79b16fc2-0d09-489b-b9a6-846b65495a2c","resolution":{"observed_at":"2026-08-15T15:05:19.260230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.199552Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) 43","venue":null,"work_id":"9e95188e-ea11-424f-987c-e06a1139854e","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.264258Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:ebb065ea92eedb74f9034f43a3473070ed07c263fd11b17cf3430e59f2e3f34e","observation_id":"52920aff-d188-439c-858f-fd317f8be273","resolution":{"observed_at":"2026-08-15T15:05:20.203784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-08-14T13:44:21.475363Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-15T15:05:19.268015Z","title":"arXiv 2024 arXiv:2405.09798","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.268015Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:aa9ae8a744e206ebf98747f64df2829b29bdd5131489f65b3be0152ca696cbaa","observation_id":"6b08c0e2-cb6d-4a25-a925-a9af27946d64","resolution":{"observed_at":"2026-08-15T15:05:19.268015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-15T17:04:51.149948Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-15T15:05:19.272138Z","title":"arXiv 2024 arXiv:2411.17491","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.272138Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:26e1be9802247b521a643d8d44cdb6f2b2981f94c0f978d32ff14987579befd2","observation_id":"f90f76b3-eed1-4a3b-a13a-947ff61d0e32","resolution":{"observed_at":"2026-08-15T15:05:19.272138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00796","last_updated":"2017-01-25T13:01:51Z","snapshot_observed_at":"2026-08-14T21:27:22.270542Z","submitted_at":"2016-12-02T19:18:37Z","title":"Overcoming catastrophic forgetting in neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00796","snapshot_observed_at":"2026-08-15T15:05:19.276334Z","title":"PNAS 2017 arXiv:1612.00796","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.276334Z"},"links":{"cited_paper":"/paper/1612.00796","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2be7681fd26ba0250db2b54047728b826b0c9a8858bd40e26e04cd42ab9701c6","observation_id":"9927410c-d1df-43e8-89b0-7c8d9e49388c","resolution":{"observed_at":"2026-08-15T15:05:19.276334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.280178Z","title":"Trends in Cognitive Sciences https://doi.org/10.1016/j.tics.2016.05.004","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.280178Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:e0fc5c52d008446035708725d773fd2962e6660e8d2afc1fa52f9a140401f8f9","observation_id":"dbf68df3-175f-4220-8b38-15c2a3151cc7","resolution":{"observed_at":"2026-08-15T15:05:19.280178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08383","last_updated":"2021-04-16T17:53:39Z","snapshot_observed_at":"2026-08-14T06:15:15.247174Z","submitted_at":"2019-09-18T12:07:36Z","title":"A continual learning survey: Defying forgetting in classification tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08383","snapshot_observed_at":"2026-08-15T15:05:19.285101Z","title":"TPAMI 2022 arXiv:1909.08383","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.285101Z"},"links":{"cited_paper":"/paper/1909.08383","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:cc4b4a758ccc38125e11a47191b88a9c18eed9fb9daa6a420e6fc33c90a04ca0","observation_id":"584b9f23-d215-4d3e-adae-9588235b265f","resolution":{"observed_at":"2026-08-15T15:05:19.285101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-15T15:05:19.289138Z","title":"arXiv 2023 arXiv:2305.03726","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.289138Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5cb449a011ed625344886c55bbf8187e36a7e423b046ea57824cc5c1c7ac8af3","observation_id":"aa76d43c-d326-456c-a518-e0061dcb18b9","resolution":{"observed_at":"2026-08-15T15:05:19.289138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T15:05:19.292993Z","title":"TMLR 2024 arXiv:2408.03326","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.292993Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5d35f63cbffa8b732562bdcd38b2aab8340740dc601b014974d2a518eab366ff","observation_id":"60052c5c-a8e0-4d7d-a0f5-94c80338b00d","resolution":{"observed_at":"2026-08-15T15:05:19.292993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T15:05:19.296654Z","title":"ICML 2023 arXiv:2301.12597","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.296654Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a9d8cefc36b2703aed817b32f389a8a6b8adfeeed99e92fdf372690ad386f4a5","observation_id":"3c3b5ae9-c88e-415e-bccc-4e5a9c3159a6","resolution":{"observed_at":"2026-08-15T15:05:19.296654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.301116Z","title":"arXiv 2025 arXiv:2505.17097","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.301116Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:bf3f6a6f3719b635cf7358b774135ab9f609d29a8a34fbc58aecc9c091bde039","observation_id":"b9ebb8ac-5054-4630-9e1a-78748b6c0c55","resolution":{"observed_at":"2026-08-15T15:05:19.301116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.09282","last_updated":"2017-02-14T22:32:30Z","snapshot_observed_at":"2026-08-14T21:50:32.277966Z","submitted_at":"2016-06-29T20:54:04Z","title":"Learning without Forgetting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.09282","snapshot_observed_at":"2026-08-15T15:05:19.305084Z","title":"TPAMI 2018 arXiv:1606.09282","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.305084Z"},"links":{"cited_paper":"/paper/1606.09282","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5a9efe32b3981e1edb097c3f4e729fc75445390b7692de3dd221773e94a4797c","observation_id":"369a27c6-6c77-463d-bbc2-b2323da27985","resolution":{"observed_at":"2026-08-15T15:05:19.305084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T15:05:19.309022Z","title":"NeurIPS 2023 arXiv:2304.08485","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.309022Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:bbc7653fe71cef0c74ca0cc84e34aa791b84d46ec35ffbd2c247b7df7bd68b15","observation_id":"b4bd3689-cf02-4616-a4bb-e66ca89bba0d","resolution":{"observed_at":"2026-08-15T15:05:19.309022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08840","last_updated":"2022-09-13T14:47:52Z","snapshot_observed_at":"2026-08-16T04:10:26.973507Z","submitted_at":"2017-06-26T14:53:34Z","title":"Gradient Episodic Memory for Continual Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08840","snapshot_observed_at":"2026-08-15T15:05:19.313510Z","title":"NeurIPS 2017 arXiv:1706.08840","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.313510Z"},"links":{"cited_paper":"/paper/1706.08840","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:700467a83717b8cfb2da4cbe033dc42054250c8e0c5c4299ad6bc84cb1a2c431","observation_id":"638ddf3a-f6b3-4d63-83cf-64e82b773808","resolution":{"observed_at":"2026-08-15T15:05:19.313510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.318421Z","title":"Psychological Review https://doi.org/10.1037/0033-295X.102.3.419","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.318421Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:9c89983e640f8ecfa6e468637f4399777b0fc72f69fbd3ce4ecad10a67990beb","observation_id":"a79ee736-072d-4e91-80f3-82333184b69a","resolution":{"observed_at":"2026-08-15T15:05:19.318421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-16T05:30:55.444482Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-15T15:05:19.322782Z","title":"arXiv 2024 arXiv:2410.07149","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.322782Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:18fef5e7ebeff35d737d84613531869f6935047652e47236725f59ab1e851509","observation_id":"50382040-ffb6-4c4d-abe3-c81d5e2e99b2","resolution":{"observed_at":"2026-08-15T15:05:19.322782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.187391Z","title":"Transformer Circuits Thread 44","venue":null,"work_id":"64270d14-4d52-476c-b703-8cf4611a94bd","year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.327235Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:08077d45b73ebb4761aac907f2f4dd02f7a1c5699ad27c90cd185a86d0b74f18","observation_id":"5dc28149-1802-4d98-8920-741b3fe64803","resolution":{"observed_at":"2026-08-15T15:05:20.191375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.331449Z","title":"Cognitive Science https://doi.org/10.1111/j.1551-6709.2011.01214","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.331449Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:27edd80b80bfa2a81a5c40a27063a7e71acdf17bbb8728a8fda207263792ada0","observation_id":"b806ccf2-72d2-40db-9327-15dbafb38dc8","resolution":{"observed_at":"2026-08-15T15:05:19.331449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14179","last_updated":"2023-08-27T18:46:47Z","snapshot_observed_at":"2026-08-13T10:26:51.536712Z","submitted_at":"2023-08-27T18:46:47Z","title":"Towards Vision-Language Mechanistic Interpretability: A Causal Tracing Tool for BLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14179","snapshot_observed_at":"2026-08-15T15:05:19.335656Z","title":"ICCV Workshop 2023 arXiv:2308.14179","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.335656Z"},"links":{"cited_paper":"/paper/2308.14179","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:833e273ef840d57511ceb03202fc6781217464cefd77be5cf3e776fc81ffd217","observation_id":"1b186def-d134-4e7f-8fd5-23b9b74b89a5","resolution":{"observed_at":"2026-08-15T15:05:19.335656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07725","last_updated":"2017-04-14T16:41:02Z","snapshot_observed_at":"2026-08-14T21:29:01.299545Z","submitted_at":"2016-11-23T10:24:11Z","title":"iCaRL: Incremental Classifier and Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07725","snapshot_observed_at":"2026-08-15T15:05:19.340166Z","title":"CVPR 2017 arXiv:1611.07725","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.340166Z"},"links":{"cited_paper":"/paper/1611.07725","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:932bcffc2fc7a8104e3ea3efcd2d186e5e1e0951e82294fdb7ade8a2133f1fbd","observation_id":"f2a6ed3f-4c3f-4bb6-b31c-7875a2a394fb","resolution":{"observed_at":"2026-08-15T15:05:19.340166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.174779Z","title":"In: Proceedings of the Thirty-Second International Joint Conference on Artificial Intelligence (IJCAI-23), pp 3058–3066, https://doi.org/10.24963/ ijcai.2023/341","venue":null,"work_id":"8495ae8d-0bd2-4566-bc7e-11899da4446b","year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.344231Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:73a4d3d90680a1eb94256afe8d63b812050d62556ee881b89bc31ccb436555fd","observation_id":"e5774569-3d49-4a78-b896-9ea02c2c86c9","resolution":{"observed_at":"2026-08-15T15:05:20.179311Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.2502194122","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.461888Z","title":"PNAS https://doi.org/ 10.1073/pnas.2502194122","venue":null,"work_id":"e205dadc-7a78-4998-a881-7edc1c1bc7d0","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.348266Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c37ad82c1d8cb8c92a2b86acb3201960c45f2cf088ab46434ede6656734a14c0","observation_id":"c3d3b701-149d-48ec-a4fe-471d21758fff","resolution":{"observed_at":"2026-08-15T15:05:19.466673Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08690","last_updated":"2017-12-12T02:14:21Z","snapshot_observed_at":"2026-08-14T20:58:31.577053Z","submitted_at":"2017-05-24T10:37:38Z","title":"Continual Learning with Deep Generative Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08690","snapshot_observed_at":"2026-08-15T15:05:19.352367Z","title":"NeurIPS 2017 arXiv:1705.08690","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.352367Z"},"links":{"cited_paper":"/paper/1705.08690","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5bc2056e21d5cc9ca4b76f7bd557aa6fcb3b3591d044d18897185c750050846d","observation_id":"492ee162-1ae2-417e-bc59-a92c25b8b532","resolution":{"observed_at":"2026-08-15T15:05:19.352367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09059","last_updated":"2022-11-24T21:40:45Z","snapshot_observed_at":"2026-08-15T13:18:49.633322Z","submitted_at":"2022-06-18T00:16:37Z","title":"CLiMB: A Continual Learning Benchmark for Vision-and-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09059","snapshot_observed_at":"2026-08-15T15:05:19.356578Z","title":"In: Advances in Neural Information Processing Systems, pp 29440–29453, URL https://arxiv.org/abs/2206.09059","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.356578Z"},"links":{"cited_paper":"/paper/2206.09059","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:eb88d8f7d0d19c7e8e3ab33fdded3ed9d8ac5c1e47d5a324c2cc09155bb84bc8","observation_id":"724ccdc1-0fc3-48d2-ade9-819970cae487","resolution":{"observed_at":"2026-08-15T15:05:19.356578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03329","last_updated":"2019-12-23T04:36:52Z","snapshot_observed_at":"2026-08-14T16:41:59.624463Z","submitted_at":"2019-09-07T20:17:34Z","title":"LAMOL: LAnguage MOdeling for Lifelong Language Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.03329","snapshot_observed_at":"2026-08-15T15:05:19.361167Z","title":"ICLR 2020 arXiv:1909.03329","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.361167Z"},"links":{"cited_paper":"/paper/1909.03329","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:ed560dab1bd4a87439266842ba689d0b6d455aa163fd4478b585d6bb658c82ec","observation_id":"1b159283-559a-40b4-8461-3a3cb68f730e","resolution":{"observed_at":"2026-08-15T15:05:19.361167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07891","last_updated":"2023-08-15T17:33:24Z","snapshot_observed_at":"2026-08-13T10:34:09.343292Z","submitted_at":"2023-08-15T17:33:24Z","title":"Link-Context Learning for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07891","snapshot_observed_at":"2026-08-15T15:05:19.364721Z","title":"CVPR 2024 arXiv:2308.07891","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.364721Z"},"links":{"cited_paper":"/paper/2308.07891","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:dfe610b1c09ff8742b3e6bcd3f7d47fcd7a867c629cb43caa4ab4bccc1d062fa","observation_id":"a1efc656-47c3-422e-b405-b3af7c242a2a","resolution":{"observed_at":"2026-08-15T15:05:19.364721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-13T05:42:53.020730Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-15T15:05:19.368465Z","title":"ICLR 2024 arXiv:2310.15213","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.368465Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:66394cb5d5dd282633cc7a3edb92e286c1026b778b7494ecaef283c42373cb7f","observation_id":"1d1724d7-c52b-46f7-afa6-2b410edc3460","resolution":{"observed_at":"2026-08-15T15:05:19.368465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13884","last_updated":"2021-07-03T10:04:41Z","snapshot_observed_at":"2026-08-15T15:12:43.971562Z","submitted_at":"2021-06-25T21:07:09Z","title":"Multimodal Few-Shot Learning with Frozen Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13884","snapshot_observed_at":"2026-08-15T15:05:19.372276Z","title":"NeurIPS 2021 arXiv:2106.13884","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.372276Z"},"links":{"cited_paper":"/paper/2106.13884","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:1b27bcd88c3d42e0900465770c35adf1ebebf70ba9b5b1ce4fbf0217bb3e032d","observation_id":"418b4464-2876-482f-803f-f471fada2715","resolution":{"observed_at":"2026-08-15T15:05:19.372276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.376053Z","title":"Nature Machine Intelligence https://doi.org/10.1038/s42256-022-00568-3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.376053Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5e8fbf362b15598eb3290ea83dbcd9a7e46a63fda5f5e2ebe7dfc11600f69a95","observation_id":"d768e64a-84ac-4b15-a3b5-14838c166ba8","resolution":{"observed_at":"2026-08-15T15:05:19.376053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T15:05:19.380105Z","title":"arXiv 2024 arXiv:2409.12191","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.380105Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:f03e9029e7058f424c080fd81a95ddbb8b8fc62d8e07a7e39f282a643a4fe0b9","observation_id":"1efa80e3-2e31-41d8-a17d-09d3b0a85b2e","resolution":{"observed_at":"2026-08-15T15:05:19.380105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02499","last_updated":"2023-03-24T07:10:47Z","snapshot_observed_at":"2026-08-13T13:27:54.563988Z","submitted_at":"2022-12-05T18:59:50Z","title":"Images Speak in Images: A Generalist Painter for In-Context Visual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02499","snapshot_observed_at":"2026-08-15T15:05:19.384316Z","title":"CVPR 2023 arXiv:2212.02499 45","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.384316Z"},"links":{"cited_paper":"/paper/2212.02499","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:dc106e1117b442097b3db3757643e87c4979d41f81dfa28b45f0420dd17f2fa9","observation_id":"f62b34ac-89e4-4bd2-9a3f-4b1ba6d66a16","resolution":{"observed_at":"2026-08-15T15:05:19.384316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14152","last_updated":"2023-10-22T02:23:44Z","snapshot_observed_at":"2026-08-13T18:59:18.024748Z","submitted_at":"2023-10-22T02:23:44Z","title":"Orthogonal Subspace Learning for Language Model Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14152","snapshot_observed_at":"2026-08-15T15:05:19.388456Z","title":"EMNLP 2023 arXiv:2310.14152","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.388456Z"},"links":{"cited_paper":"/paper/2310.14152","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:55a3c2eac930a6ed9e8b82b6fe18acaadfbf2c9005dd3555219192ae80812ffd","observation_id":"ed66c1cf-0541-4d8f-a9c0-f03302a03cbd","resolution":{"observed_at":"2026-08-15T15:05:19.388456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-14T16:33:52.281080Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-15T15:05:19.393016Z","title":"ICCV 2023 arXiv:2304.03284","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.393016Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:ee90bf87d86241e929f28772201b0a9c8c05806586c5286898dbec6ef688b559","observation_id":"cb23eb8b-acfa-4f7c-b8a1-017299a918b8","resolution":{"observed_at":"2026-08-15T15:05:19.393016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13949","last_updated":"2025-07-01T10:40:05Z","snapshot_observed_at":"2026-08-14T05:06:13.974017Z","submitted_at":"2024-11-21T09:00:15Z","title":"SMoLoRA: Exploring and Defying Dual Catastrophic Forgetting in Continual Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13949","snapshot_observed_at":"2026-08-15T15:05:19.396732Z","title":"arXiv 2024 arXiv:2411.13949","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.396732Z"},"links":{"cited_paper":"/paper/2411.13949","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:96d5646a7da35a783541820938533d7805fc82155aec1cbb7cb890a75c755342","observation_id":"6c8abf86-3680-4fbe-adea-4defd6c7ad1a","resolution":{"observed_at":"2026-08-15T15:05:19.396732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.162243Z","title":"arXiv preprint arXiv:251005024","venue":null,"work_id":"de6d9982-e4ef-4273-a168-02d3515a3ebc","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.400714Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:866c5dfebb82b1c6e2d0ae8b8f4b3a9c532f877a30d5299aa982402d931c939a","observation_id":"432ca3fd-3f46-45a3-af64-f4439bd51c12","resolution":{"observed_at":"2026-08-15T15:05:20.166930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05849","last_updated":"2025-08-25T05:25:26Z","snapshot_observed_at":"2026-08-12T22:28:22.934748Z","submitted_at":"2024-10-08T09:35:37Z","title":"ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05849","snapshot_observed_at":"2026-08-15T15:05:19.404199Z","title":"arXiv 2024 arXiv:2410.05849","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.404199Z"},"links":{"cited_paper":"/paper/2410.05849","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:249ce552f7591fbd142202de69a8fe7fb7f626b16fa6efb45bc9088c155d3987","observation_id":"fa74df9c-2c29-4388-9cff-676c57337ada","resolution":{"observed_at":"2026-08-15T15:05:19.404199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04200","last_updated":"2017-06-12T19:57:42Z","snapshot_observed_at":"2026-08-14T21:12:14.237470Z","submitted_at":"2017-03-13T00:02:48Z","title":"Continual Learning Through Synaptic Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04200","snapshot_observed_at":"2026-08-15T15:05:19.408318Z","title":"ICML 2017 arXiv:1703.04200","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.408318Z"},"links":{"cited_paper":"/paper/1703.04200","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:3dec536fe4130ac6381cdad134017849c1259a29061fb424ddf01700fba550cb","observation_id":"60142902-c718-4bed-89aa-85923076d2af","resolution":{"observed_at":"2026-08-15T15:05:19.408318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-13T14:29:50.623753Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-15T15:05:19.412336Z","title":"arXiv 2023 arXiv:2309.10313","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.412336Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:eacd32930356280a1039a6f47ec783b2ef528729f94e2a5120b91aa153de03bd","observation_id":"1fad8f4e-abe5-4a29-baa7-dd47759b8519","resolution":{"observed_at":"2026-08-15T15:05:19.412336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13670","last_updated":"2023-02-01T08:38:14Z","snapshot_observed_at":"2026-08-13T12:54:18.795571Z","submitted_at":"2023-01-31T14:40:05Z","title":"What Makes Good Examples for Visual In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13670","snapshot_observed_at":"2026-08-15T15:05:19.416727Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.416727Z"},"links":{"cited_paper":"/paper/2301.13670","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:97b733c232ba1caf2f777a9aa317f0f76513eb6db95b24fd6617eaf80f870bf5","observation_id":"f7107f3b-8393-4377-8b80-5e22068c8aeb","resolution":{"observed_at":"2026-08-15T15:05:19.416727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12048","last_updated":"2024-02-19T11:02:05Z","snapshot_observed_at":"2026-08-14T21:57:59.145824Z","submitted_at":"2024-02-19T11:02:05Z","title":"Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12048","snapshot_observed_at":"2026-08-15T15:05:19.421206Z","title":"ICML 2024 arXiv:2402.12048","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.421206Z"},"links":{"cited_paper":"/paper/2402.12048","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:971f0b350a589a7193ffbe213eb48a7424cd8a50030bad8701a16451d3c8312f","observation_id":"d6fceeff-5317-41b8-a511-74d77b603445","resolution":{"observed_at":"2026-08-15T15:05:19.421206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.148889Z","title":"In: International Conference on Learning Representations (ICLR) 46","venue":null,"work_id":"8c42e4ae-0ff6-4efe-97df-bae075af2051","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.425102Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2c4fbc09d20ef0bb79062c52e4074b04a14debb6724de6d7b055d95a6eb3f310","observation_id":"1cdba336-9c2b-4911-8a76-217d3b4bc1ff","resolution":{"observed_at":"2026-08-15T15:05:20.153010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:16:32.366569Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2608.02830."}