{"as_of":"2026-08-10T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6b3c498fa9d9688cbdd2f90a531fb0bd01d32c66251f163548e10da92f47b01","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:30.497174Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:43:16.986690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-06T15:43:16.986690Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15285","last_updated":"2025-07-21T06:35:46Z","snapshot_observed_at":"2026-08-08T20:20:51.804408Z","submitted_at":"2025-07-21T06:35:46Z","title":"In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:16.986690Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2507.15285"},"observation_digest":"sha256:56d7a72e66fdb1b53a87aa217818c1d64cf8bf3363a6c7b6e61851c8ec56cbe6","observation_id":"adec5307-bff3-4d51-9fa7-21126ac3a9bb","resolution":{"observed_at":"2026-08-06T15:43:16.986690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-06T15:29:34.173300Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-07T23:52:34.092202Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.173300Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:42ab7ab7f8960aa153b5fbeee9ee2dfba200d9bef00d6499217e8bd70744aea6","observation_id":"f5ca7f5c-4333-4f1f-ac79-bab58917cdb4","resolution":{"observed_at":"2026-08-06T15:29:34.173300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:82a38b211655e9332f271d57e3717308c3d27d6c164b84e71f86b259c88ccb29","observation_id":"84d6614a-312c-4db4-b403-35f50e49d566","resolution":{"observed_at":"2026-05-18T14:11:27.448460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2604.13403","last_updated":"2026-04-15T02:12:51Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:12:51Z","title":"Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T13:41:37.942145Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2604.13403"},"observation_digest":"sha256:42b8b0feadce1d16f5c87a23aaeaa2560717230ff49a351a0bf1b00ffac2100c","observation_id":"957de704-b9a9-4c56-983f-e25012054cec","resolution":{"observed_at":"2026-05-10T13:45:28.245354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2605.01333","last_updated":"2026-05-08T01:08:56Z","snapshot_observed_at":"2026-08-04T10:46:08.275509Z","submitted_at":"2026-05-02T09:08:33Z","title":"OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:50.055081Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2605.01333"},"observation_digest":"sha256:d4754b8a002ee0782f7eb6d5dc0fa41697f7c330ab03b8d7bcdb82929c95f664","observation_id":"1dae7721-237e-4948-8945-f6b27325da46","resolution":{"observed_at":"2026-05-11T01:05:50.173877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07936/citation-record","integrity":"/paper/2506.07936/integrity","json":"/paper/2506.07936/citation-record.json","paper":"/paper/2506.07936"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T05:25:30.326469Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.326469Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6fc150d5e61677e0332e0879baf678faf4c8880ee1bd91a1c491066982245021","observation_id":"b5eba608-dd3f-43d8-809a-2737621f1a43","resolution":{"observed_at":"2026-08-07T05:25:30.326469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:25:30.330578Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond, October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.330578Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:394e8ae2e2f7a47cf08dc60dc761d7d3e57f0dc9d4611a024f3699b8c127324c","observation_id":"6ac019dc-ebe7-4ccd-93b3-2005b827e975","resolution":{"observed_at":"2026-08-07T05:25:30.330578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:25:30.333944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.333944Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6ec1ee66e7febb6dec1b289dba308ff857a6dd529dff543369cd863fb2d584b0","observation_id":"0206e29a-924e-436e-8dc7-d959a0587dfe","resolution":{"observed_at":"2026-08-07T05:25:30.333944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.337467Z","title":"What makes multimodal in-context learning work? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 1539–1550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.337467Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d802b8addaac1aa17b161d225d00fac75a9540f79f6230638b9c0243c0745553","observation_id":"66e436cd-5e95-4931-ae50-c3bd46f26429","resolution":{"observed_at":"2026-08-07T05:25:30.337467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.340707Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.340707Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ecf6a037c00ddf5527c475385c21437da34fccd0f6a1ec3411e009a97c149067","observation_id":"1b60879c-f6ec-499a-a516-da1b4fdfefe6","resolution":{"observed_at":"2026-08-07T05:25:30.340707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:25:30.344139Z","title":"M 3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.344139Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f620878f5960d9cd11587103a2321e2af4e300822ba78578a35fa0b9b9683e68","observation_id":"5cfa213e-4e85-4600-8e5a-d68347522cd7","resolution":{"observed_at":"2026-08-07T05:25:30.344139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-07-06T16:54:37.940527Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-07T05:25:30.347857Z","title":"Can Multimodal Large Language Models Truly Perform Multi- modal In-Context Learning?, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.347857Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:1ab8c686c89c3b03bade2080bebf85b4329cbd89ed8e772591fc16e769c5d714","observation_id":"0a990664-95bc-4ed7-9107-548f6eb72e66","resolution":{"observed_at":"2026-08-07T05:25:30.347857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:25:30.352098Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.352098Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d091b1f0c86d76d287642dad6d954eb69beba287e555e19928277b2ff5cbe67d","observation_id":"d7134849-2ec4-4fe9-9076-ec3d3ab643e4","resolution":{"observed_at":"2026-08-07T05:25:30.352098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T05:25:30.355259Z","title":"A survey on in-context learning.arXiv preprint arXiv:2301.00234, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.355259Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0f8d55252946636bbc9f70d251696a8344004024dca394562bcba1fb7c1bb947","observation_id":"b3be597a-86b0-4857-a4ed-2e67d0c0c170","resolution":{"observed_at":"2026-08-07T05:25:30.355259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.358643Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.358643Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:1d60308573a95f6026713a630d0bf05093816f62f1fb2ef9ad3692e114fbef9b","observation_id":"3124b6bc-7b85-49ed-8d4a-6cc563b1ffcb","resolution":{"observed_at":"2026-08-07T05:25:30.358643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-08-09T15:43:19.295971Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19488","snapshot_observed_at":"2026-08-07T05:25:30.361398Z","title":"Interleaved-Modal Chain-of-Thought, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.361398Z"},"links":{"cited_paper":"/paper/2411.19488","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:66113fef32e77071e9b0f311e187dd5b56c4460d8e566121e0dc6592c5064a4a","observation_id":"79eb36fa-ddc5-4e7c-9127-09243a67138f","resolution":{"observed_at":"2026-08-07T05:25:30.361398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19602","last_updated":"2025-03-25T12:37:22Z","snapshot_observed_at":"2026-08-07T16:38:32.727220Z","submitted_at":"2025-03-25T12:37:22Z","title":"Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19602","snapshot_observed_at":"2026-08-07T05:25:30.364635Z","title":"Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.364635Z"},"links":{"cited_paper":"/paper/2503.19602","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:cb922ad28f5db2e10819ec54da6897142870eeb634a27afc9b7c58a12835ae63","observation_id":"caf709a0-2700-4a83-a67d-e1ac8b44295c","resolution":{"observed_at":"2026-08-07T05:25:30.364635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:25:30.367946Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced Multi- Modal ReAsoning Benchmark, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.367946Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f93c4211c576c74d47bc658ba52ef750c949cfbdfc76d9fe8582488af555a176","observation_id":"58541b15-d921-4064-b89d-6dee79b1e6b8","resolution":{"observed_at":"2026-08-07T05:25:30.367946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-09T00:23:29.329507Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T05:25:30.371674Z","title":"MME- CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.371674Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:1ecb946b3c7958db5b0433fe49377cc0ab7aea58580e0efee7522bcc1d12dc5b","observation_id":"cac6d4c7-64c9-4415-9f84-4ca332bb8d68","resolution":{"observed_at":"2026-08-07T05:25:30.371674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14024","last_updated":"2023-01-23T17:00:01Z","snapshot_observed_at":"2026-08-06T22:47:15.172350Z","submitted_at":"2022-12-28T18:52:44Z","title":"Demonstrate-Search-Predict: Composing retrieval and language models for knowledge-intensive NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14024","snapshot_observed_at":"2026-08-07T05:25:30.375814Z","title":"Demonstrate-Search-Predict: Composing retrieval and language models for knowledge-intensive NLP, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.375814Z"},"links":{"cited_paper":"/paper/2212.14024","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:4cefeefdd113ec3542661ead2d29de10b1f5389f8872ea75601636cc4c87dda4","observation_id":"725bc155-8341-46d3-a66d-1a6395d71782","resolution":{"observed_at":"2026-08-07T05:25:30.375814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T05:25:30.379020Z","title":"What matters when building vision-language models?arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.379020Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:a2b3d704def3fbb94a9ee8e533624a550942af765ac18fbeeca465b178f2db4f","observation_id":"be9d5f8a-08dc-47bc-a483-72007514d435","resolution":{"observed_at":"2026-08-07T05:25:30.379020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T05:25:30.381931Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.381931Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e80abd096af148f7c08adb41dd2d08ddfc0d62bde5d033fe999a8fe3c38fd742","observation_id":"a003c4e3-e160-4134-952d-a5187c342958","resolution":{"observed_at":"2026-08-07T05:25:30.381931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:25:30.385062Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.385062Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:666feba89d90633f1852999deca12c45346c19389976c99004396e9047d6a99b","observation_id":"c9adec86-6858-4838-8f48-a51fcd794183","resolution":{"observed_at":"2026-08-07T05:25:30.385062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08786","last_updated":"2022-03-03T12:10:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T09:29:16Z","title":"Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08786","snapshot_observed_at":"2026-08-07T05:25:30.388110Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity.arXiv preprint arXiv:2104.08786, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.388110Z"},"links":{"cited_paper":"/paper/2104.08786","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:854a5da34f32c38ec6a0d740e4eb8e15bb7eda60bac3cf0a23c7746224994eff","observation_id":"ee0fcb41-a038-4742-940b-4121a9091338","resolution":{"observed_at":"2026-08-07T05:25:30.388110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.045764Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.https: //ai.meta.com/blog/llama-3-2-connect-2024-vision-edge-mobile-devices/ , 2024","venue":null,"work_id":"e17fe615-7d31-4829-8601-9af29e60d992","year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.391394Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:7aded9317487da37130e171148b0c0a07de853e12d33a371025d7d607b7c89cf","observation_id":"6903f7b2-2961-4c17-8107-a935e8baa3e8","resolution":{"observed_at":"2026-08-07T05:25:31.049043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16938","last_updated":"2023-05-30T08:34:49Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T13:55:17Z","title":"Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16938","snapshot_observed_at":"2026-08-07T05:25:30.394417Z","title":"Few- shot fine-tuning vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.394417Z"},"links":{"cited_paper":"/paper/2305.16938","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e007fc50bf7c00669ed2834d039e540922f278afea86044f3105dcef0526b6bf","observation_id":"1a023700-31db-4bd3-be62-7c1147e17792","resolution":{"observed_at":"2026-08-07T05:25:30.394417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14799","last_updated":"2023-10-23T10:56:03Z","snapshot_observed_at":"2026-07-06T16:37:07.197221Z","submitted_at":"2023-10-23T10:56:03Z","title":"Cross-lingual Prompting: Improving Zero-shot Chain-of-Thought Reasoning across Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14799","snapshot_observed_at":"2026-08-07T05:25:30.397479Z","title":"Cross-lingual prompting: Improving zero-shot chain-of-thought reasoning across languages.arXiv preprint arXiv:2310.14799, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.397479Z"},"links":{"cited_paper":"/paper/2310.14799","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:b367d1c2e0af3d5de11e5a41447baf1229c2f54437f417ef408398617dcc4e6a","observation_id":"f8ae2fe6-4446-47d9-9941-f825c3bfb4e9","resolution":{"observed_at":"2026-08-07T05:25:30.397479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-07-06T19:40:21.797132Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-07T05:25:30.400396Z","title":"What factors affect multi-modal in-context learning? an in-depth exploration.arXiv preprint arXiv:2410.20482, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.400396Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d7b0f3bbb74eb4c85935d8919861836283ad9277fa82b0020355a3fc887b0784","observation_id":"9d60bd3c-8794-4bbd-9635-e66877b7d1e4","resolution":{"observed_at":"2026-08-07T05:25:30.400396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.403345Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.403345Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f91cc15a5f093ab4471551f693b9e2704abc4aac02e66bb98a971d688ff2529e","observation_id":"0d358e1e-a868-4533-be8e-b2a645030683","resolution":{"observed_at":"2026-08-07T05:25:30.403345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-07-06T13:17:15.959025Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-07T05:25:30.406334Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.406334Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:685bb7730fb95951af4c1623bf8790e8baa5becc068bbdc61ada732025b0cf8c","observation_id":"cdd8f034-939e-43fc-bb23-0587c90b662e","resolution":{"observed_at":"2026-08-07T05:25:30.406334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T05:25:30.409388Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.409388Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e9f9554e08c9fa91276d9f1ee193bf65a1d2c6d29733696218ef9f07156f9e59","observation_id":"905500d6-2fba-4677-9eb9-ce6a287ce378","resolution":{"observed_at":"2026-08-07T05:25:30.409388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.036819Z","title":"Towards vqa models that can read","venue":null,"work_id":"e1a87b05-5bd1-4fff-90a5-acb1d42ea11b","year":2019},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.412385Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:323ee5fa98cc1a06de231c33196f67e452a5ac91eb224bd52e9eb7dbf9fa9e3d","observation_id":"c79db2fd-71d1-418f-af04-e7c53c07e56f","resolution":{"observed_at":"2026-08-07T05:25:31.040011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:25:30.415272Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.415272Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:5352266087980073dcdf44960b32d6be4ba878589aee1faf5348644117d44530","observation_id":"51a84144-6660-4ddd-8a42-896548d3a749","resolution":{"observed_at":"2026-08-07T05:25:30.415272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T05:25:30.418218Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.418218Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:064dd6921696cd7a4b0cc9c74546c744024a3a5e62d3dbec30714129815c5481","observation_id":"9fef8f3e-b170-4db1-9add-e81f420a39da","resolution":{"observed_at":"2026-08-07T05:25:30.418218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T05:25:30.421112Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.421112Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:2c186ddffe9e0dc288eb7c01283c9272708cc36d17cc8aa514732c14aa7220d1","observation_id":"ed83cb5c-4e55-47a7-a25b-9fdef8c40abb","resolution":{"observed_at":"2026-08-07T05:25:30.421112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T05:25:30.424057Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.424057Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:21be95619e6ee79f2d6cbf4f3069a4110eecf4b4a955ad50f81025e6a46eded6","observation_id":"269f6903-dc82-4e4e-b990-fe6d1046415c","resolution":{"observed_at":"2026-08-07T05:25:30.424057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T05:25:30.427120Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.427120Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:079290053e90f51709cf45b07d02a6cafef9c0dbe4f71bf9fbf770cd0b50536c","observation_id":"0db51feb-290f-4c93-b4ca-b6f292731f52","resolution":{"observed_at":"2026-08-07T05:25:30.427120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10375","last_updated":"2023-05-03T14:43:50Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T15:55:21Z","title":"Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10375","snapshot_observed_at":"2026-08-07T05:25:30.430572Z","title":"Self-adaptive in-context learning: An information compression perspective for in-context example selection and ordering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.430572Z"},"links":{"cited_paper":"/paper/2212.10375","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:cbeae865d4f819670ece5fbaf027e22a51d2ec281697da61c7cbe23e0db1b99a","observation_id":"0aad04a6-6109-44b6-be93-8f56153d5371","resolution":{"observed_at":"2026-08-07T05:25:30.430572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15637","last_updated":"2024-06-06T12:01:09Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:39:12Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","version":2},"cited_work":{"arxiv_id":"2402.15637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15637","snapshot_observed_at":"2026-08-07T05:25:30.642640Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","venue":"cs.CL","work_id":"59222e3e-4284-445d-bb4b-67770412eb42","year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.433663Z"},"links":{"cited_paper":"/paper/2402.15637","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:8001896aa71759570c8e3208b73535fa6d3a1054bee9a4a445dbb53730ae3a45","observation_id":"736cf377-7b4e-4e2b-8d0a-bb9eff84a94c","resolution":{"observed_at":"2026-08-07T05:25:30.646131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T05:25:30.436700Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.436700Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:08a2858ca1489ded561d7df2895c4c7dc8438018846d7b07681e701b8e65bad2","observation_id":"0a3eec10-ee2b-4186-89bb-5b762e7a11a6","resolution":{"observed_at":"2026-08-07T05:25:30.436700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00902","last_updated":"2025-02-07T02:29:02Z","snapshot_observed_at":"2026-08-09T20:23:10.775547Z","submitted_at":"2024-07-01T01:57:21Z","title":"From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00902","snapshot_observed_at":"2026-08-07T05:25:30.439676Z","title":"From introspection to best practices: Principled analysis of demonstrations in multimodal in-context learning.arXiv preprint arXiv:2407.00902, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.439676Z"},"links":{"cited_paper":"/paper/2407.00902","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d74f4bf94a966963fddb555e114531cced29ca92df3e68f38b609ea46a7f4351","observation_id":"ef44611e-ed1c-4af7-8c56-8c74eb41f55c","resolution":{"observed_at":"2026-08-07T05:25:30.439676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16075","last_updated":"2024-12-20T17:19:24Z","snapshot_observed_at":"2026-08-08T19:38:30.741786Z","submitted_at":"2024-12-20T17:19:24Z","title":"Formal Mathematical Reasoning: A New Frontier in AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16075","snapshot_observed_at":"2026-08-07T05:25:30.442609Z","title":"Formal Mathematical Reasoning: A New Frontier in AI, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.442609Z"},"links":{"cited_paper":"/paper/2412.16075","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:bbb1e8d4d41b3b32503a04598f030cf1527bff9993b5c00799615829a5ab401a","observation_id":"56d2d879-eda2-45fa-a7d1-d766326c8e85","resolution":{"observed_at":"2026-08-07T05:25:30.442609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.028008Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":"16812329-09f1-4c09-94a0-05aaaa385abb","year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.445696Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:523af9d6cb5785a06bd65429419cc7fa63c22ff35708b5b39377c6ddf5fe18a2","observation_id":"35657318-eab6-4585-a89d-41f3582b7ffb","resolution":{"observed_at":"2026-08-07T05:25:31.031434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T05:25:30.448415Z","title":"Automatic chain of thought prompting in large language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.448415Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:83a813f704b35b0ffd1e6a74242dda7b3cdb77001a919d26000b71f94c0b4010","observation_id":"3d2ce3f7-cb96-49b9-a637-0ebc28f48b68","resolution":{"observed_at":"2026-08-07T05:25:30.448415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.451593Z","title":"Wong, and Simon See","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.451593Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:36536c7a770089a3641a2ddfa9e0b288bd1ffae0a148ed3155b878e7c13e1d29","observation_id":"cf7df1ba-8ce8-49cd-91ef-48a135e90ccb","resolution":{"observed_at":"2026-08-07T05:25:30.451593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T05:25:30.454384Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models, April 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.454384Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:24057aca066a3e782c9932a2f185ec9f1f3398f66d84b2242f106a111cd05099","observation_id":"ae870c12-76c4-4867-99aa-71454747ca65","resolution":{"observed_at":"2026-08-07T05:25:30.454384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-08-08T00:23:49.655888Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-08-07T05:25:30.457496Z","title":"Vl-icl bench: The devil in the details of benchmarking multimodal in-context learning.arXiv preprint arXiv:2403.13164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.457496Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:18b71524016f783e8f7c704b3c398201e1f3ddff0fa02bc5bafb6f4c3f6b19b6","observation_id":"964eca0e-c530-40d4-8056-76e070db338b","resolution":{"observed_at":"2026-08-07T05:25:30.457496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01692","last_updated":"2023-07-19T06:48:35Z","snapshot_observed_at":"2026-07-06T14:26:29.296405Z","submitted_at":"2022-12-03T21:14:32Z","title":"Can In-context Learners Learn a Reasoning Concept from Demonstrations?","version":4},"cited_work":{"arxiv_id":"2212.01692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.01692","snapshot_observed_at":"2026-08-07T05:25:30.522043Z","title":"Can In-context Learners Learn a Reasoning Concept from Demonstrations?","venue":"cs.CL","work_id":"e576e0b7-e4b3-4b2e-91dc-070c9ed6748c","year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.460503Z"},"links":{"cited_paper":"/paper/2212.01692","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f439ce0a9e7117c9a068f5678639c9ac601295760946475cb951839ff862bc8f","observation_id":"bd652441-f733-40b4-bdb2-c4b0485883a4","resolution":{"observed_at":"2026-08-07T05:25:30.527381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.019677Z","title":"Density is calculated as mass/volume","venue":null,"work_id":"3629c94f-115e-4229-964d-8de0a486e4ae","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.464287Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:1799327581a19d8cf00091fd1917776527730b9913b443ddfa7108c9dd0e4a06","observation_id":"4a36758c-10e8-4e96-bdba-3a2e18ee3d68","resolution":{"observed_at":"2026-08-07T05:25:31.022770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.011025Z","title":null,"venue":null,"work_id":"f98bc677-fb9a-4ded-8731-d00130164177","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.467233Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:53f016742b00bfd25af51867b110b9de8fcbf97a2a3b44e7ec3d27fbf392d39d","observation_id":"574fe031-2fd9-4b20-aa9b-b76a3abdb119","resolution":{"observed_at":"2026-08-07T05:25:31.014289Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.002429Z","title":null,"venue":null,"work_id":"d584978b-2cb3-449d-9589-0c1178048a3c","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.470376Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:09a46ce60fe53f8623185e73c6acb2a06b391db47277c4c7cbbecf02750ec9b5","observation_id":"d43821c7-b720-4112-ab66-d3ff04106176","resolution":{"observed_at":"2026-08-07T05:25:31.005482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.993838Z","title":"Final answer:","venue":null,"work_id":"655a949a-3baa-439b-8834-5da377b027b3","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.473371Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:592babb8ca489117514f0db295d1f69dd74ed0bbb53159d59e4f2445c00991d4","observation_id":"084a3b22-a8ff-479f-9e4c-88a6f6bbcafa","resolution":{"observed_at":"2026-08-07T05:25:30.996962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.984545Z","title":"In the graphs, we need to compare the export value (top graph) with the import value (bottom graph) for each country in the year 2020","venue":null,"work_id":"84f42c03-3d35-4da3-97d8-5a9e1fd46e23","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.476297Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e1239696fd4f9db342be3e3addeb96db7256945a46c6af8cb46462dadcf6c6ec","observation_id":"a5b37fc7-91ce-4e09-860f-d97eaaba693e","resolution":{"observed_at":"2026-08-07T05:25:30.988293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.974762Z","title":"Export > Import, so Country 3 has a surplus","venue":null,"work_id":"00a6eaee-b70a-48c1-adb8-25674a66fcee","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.479128Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:5dd0804eae673a47cf103ad5ad0ac8f37a03dc72982ccd7a3d8f9975e7fe2945","observation_id":"99a3edf5-38dd-49e6-afcf-e42e0a996b9b","resolution":{"observed_at":"2026-08-07T05:25:30.978120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.966365Z","title":null,"venue":null,"work_id":"4e2cb220-8bac-4ed3-8517-ce4453274ec5","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.482045Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:269152891eeeefb9c8e3e0ff41be0d4a67fd8fe814757502ba3badc1c3b5d305","observation_id":"dcf0a135-2d0a-411b-b19e-a5c855ae7879","resolution":{"observed_at":"2026-08-07T05:25:30.969273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.956412Z","title":"Final answer:","venue":null,"work_id":"b23966f3-98ae-41bc-895b-5b1efb1cd529","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.484729Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e9e2af9c27642a87ad6ccc8c618ea62d43ed3db37689eadbaea66e31c2154008","observation_id":"2a9c27f2-c4f4-41c8-9844-8a492ad6ffd2","resolution":{"observed_at":"2026-08-07T05:25:30.959723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.946935Z","title":"a² varies inversely with b³","venue":null,"work_id":"8335d65b-b461-4370-84f6-424bc12a111d","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.487895Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:fb30a9962f67aa1bbb18d4d6902047f556510bd41f56f30f099027ecaf850692","observation_id":"4c6fbc48-6bfe-4c30-bba2-6546a303e330","resolution":{"observed_at":"2026-08-07T05:25:30.949945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.938236Z","title":"Therefore, a² = 7² = 49","venue":null,"work_id":"8afc3815-95e3-425e-bc2e-8dcfcad44fd0","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.491118Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:67d82c9bae0ac9a1ad7f2062b188a13d8bf34cda09ca1b5d67207c810269c1e9","observation_id":"3e46e54a-673e-47f6-a7ba-0ae533126ade","resolution":{"observed_at":"2026-08-07T05:25:30.941221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.928999Z","title":"When b = 6, a² = 1323 / 6³ = 1323 / 216 = 6.125","venue":null,"work_id":"bf0be17c-28be-4d26-b424-a21c375648bb","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.494019Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d89a749af3bf4ca95ca288b9ad16538877c023cdc9b3baaad89defd140a6c008","observation_id":"e64c6f14-4372-42e7-b695-b4ca36a8aab3","resolution":{"observed_at":"2026-08-07T05:25:30.932322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.920436Z","title":null,"venue":null,"work_id":"30543e0a-a8ec-40a0-8959-e537a2218420","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.497174Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ed2351314b5c3e64d50f6c932abbfea8d70c03deeae87b7d42b811fe9ba3b624","observation_id":"54bdac12-e0f8-42b8-92ef-2625aef72dec","resolution":{"observed_at":"2026-08-07T05:25:30.923432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 5 inbound Pith citation observations for arXiv:2506.07936."}