{"as_of":"2026-08-14T14:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:461830d58377be04f5b7512214a653909144d572ad62ef2d108b247ea484cf54","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:35.934009Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T07:15:11.031811Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:47:22.870706Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15807","snapshot_observed_at":"2026-08-03T07:15:11.031811Z","title":"Can multimodal large language models truly perform multimodal in-context learning? In 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20796","last_updated":"2026-05-26T14:33:44Z","snapshot_observed_at":"2026-08-10T08:10:09.932817Z","submitted_at":"2026-01-28T17:37:28Z","title":"Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T07:15:11.031811Z"},"links":{"cited_paper":"/paper/2507.15807","citing_paper":"/paper/2601.20796"},"observation_digest":"sha256:a350cf43c256e0ee2f8018e3931e9105bd12777beace4bc87921e2f3c9816e1d","observation_id":"228ec975-998a-422c-89b7-0bb4354606c1","resolution":{"observed_at":"2026-08-03T07:15:11.031811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"cited_work":{"arxiv_id":"2507.15807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15807","snapshot_observed_at":"2026-07-02T20:47:22.870706Z","title":"True multimodal in-context learning needs attention to the visual context","venue":null,"work_id":"71607bba-b401-443f-956b-c6937cf95467","year":2025},"citing_paper":{"arxiv_id":"2604.13403","last_updated":"2026-04-15T02:12:51Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:12:51Z","title":"Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T13:41:37.942145Z"},"links":{"cited_paper":"/paper/2507.15807","citing_paper":"/paper/2604.13403"},"observation_digest":"sha256:20d65eddaeadde0d547acd33c2bfa9fa931d93044728e6a12fd30bad17de20fd","observation_id":"49fda585-c582-4230-9647-634ebf07c115","resolution":{"observed_at":"2026-05-10T13:45:28.210983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"cited_work":{"arxiv_id":"2507.15807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15807","snapshot_observed_at":"2026-07-02T20:47:22.870706Z","title":"True multimodal in-context learning needs attention to the visual context","venue":null,"work_id":"71607bba-b401-443f-956b-c6937cf95467","year":2025},"citing_paper":{"arxiv_id":"2605.02378","last_updated":"2026-05-04T09:18:19Z","snapshot_observed_at":"2026-08-12T17:20:44.773767Z","submitted_at":"2026-05-04T09:18:19Z","title":"Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T19:21:30.235583Z"},"links":{"cited_paper":"/paper/2507.15807","citing_paper":"/paper/2605.02378"},"observation_digest":"sha256:11151852a1423ff1a0d81746278b62a52f939e1491619c499e64b68e0063ab6a","observation_id":"694c1bcf-b7dd-4af0-bf36-3dc8c2ea6832","resolution":{"observed_at":"2026-05-09T05:55:31.182673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"cited_work":{"arxiv_id":"2507.15807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15807","snapshot_observed_at":"2026-07-02T20:47:22.870706Z","title":"True multimodal in-context learning needs attention to the visual context","venue":null,"work_id":"71607bba-b401-443f-956b-c6937cf95467","year":2025},"citing_paper":{"arxiv_id":"2606.08034","last_updated":"2026-06-06T07:51:52Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:51:52Z","title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T20:11:02.445626Z"},"links":{"cited_paper":"/paper/2507.15807","citing_paper":"/paper/2606.08034"},"observation_digest":"sha256:d8ff2088d7d4989e2a7a631254a7fb47f018c6ef80e2480451f1e6668024dbe4","observation_id":"f3145f01-dd25-4afc-8ca7-d6629c2f08fe","resolution":{"observed_at":"2026-07-02T20:47:22.872136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15807/citation-record","integrity":"/paper/2507.15807/integrity","json":"/paper/2507.15807/citation-record.json","paper":"/paper/2507.15807"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T15:29:33.466845Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.466845Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:793fa3e944b3de6cba773d952cb8ca42888a8b512cbd16d213597d1ff06bec3c","observation_id":"e30b601e-a2b9-431a-aed0-d4e28defce69","resolution":{"observed_at":"2026-08-06T15:29:33.466845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:36.676107Z","title":"Each task is designed with adjustable difficulty levels, such as more diverse con- cepts in novel concept binding, more complex visual patterns in pattern interpretation, etc","venue":null,"work_id":"10ce8aac-6915-4e72-afd1-bd6dabe7176c","year":2024},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.671431Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:b49e090fa90c1abb4b57ddba8c21efbed8f6b37101b37d30e2aec1bcb54e6f0b","observation_id":"e4777390-faa6-4602-84eb-a7e7ce3d8d9f","resolution":{"observed_at":"2026-08-06T15:29:36.680644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-06T15:29:33.727729Z","title":"A survey for in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.727729Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:5d4020037105e90540ecf9462669dcd173975a6c20451f68182687072432f3c6","observation_id":"a5ea653a-54bd-4e0a-b88c-e7c1f2c6168f","resolution":{"observed_at":"2026-08-06T15:29:33.727729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07407","last_updated":"2024-03-12T08:34:34Z","snapshot_observed_at":"2026-08-14T04:56:03.267883Z","submitted_at":"2024-03-12T08:34:34Z","title":"In-context learning enables multimodal large language models to classify cancer pathology images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07407","snapshot_observed_at":"2026-08-06T15:29:33.873679Z","title":"Wiest, Marta Ligero, Srividhya Sainath, Narmin Ghaffari Laleh, Omar S.M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.873679Z"},"links":{"cited_paper":"/paper/2403.07407","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:84d70715ed9ae8050ecf2d732ff8477618b7346f6e80bddc72d2fa0f31a1a49e","observation_id":"efe63c4b-2f37-4df8-80bc-62a459a46624","resolution":{"observed_at":"2026-08-06T15:29:33.873679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07407","last_updated":"2024-03-12T08:34:34Z","snapshot_observed_at":"2026-08-14T04:56:03.267883Z","submitted_at":"2024-03-12T08:34:34Z","title":"In-context learning enables multimodal large language models to classify cancer pathology images","version":1},"cited_work":{"arxiv_id":"2403.07407","doi":"10.48550/arxiv.2403.07407","metadata_source":"pith","pith_arxiv_id":"2403.07407","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"In-context learning enables multimodal large language models to classify cancer pathology images","venue":"cs.CV","work_id":"bc933b1a-2747-41e5-8647-941d5d5872a5","year":2024},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.947604Z"},"links":{"cited_paper":"/paper/2403.07407","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:fbc84271485335d7c0c26bf97cf94069460e6539595caf18437158923d7e0459","observation_id":"7e94f6ba-10e7-4fbf-a878-8bbf6543c081","resolution":{"observed_at":"2026-08-06T15:29:36.196407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-08-14T13:44:21.475363Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-06T15:29:34.320527Z","title":"Chen, and Andrew Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.320527Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:51e098f0ddbdd82dcc1baeab28d2987a68e5974d5aad43cfaea8e2a6f8eac9c3","observation_id":"81541ab2-1b20-4b79-8230-ef2d6bf3d74c","resolution":{"observed_at":"2026-08-06T15:29:34.320527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-08-14T13:44:21.475363Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-06T15:29:34.377976Z","title":"2405.09798","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.377976Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:e644825c1d6261c347b94339414ce654141f9a5183dfdc456e8711ef25c20ff1","observation_id":"f949f0e5-46a8-445c-be4f-4a7c575cc8a6","resolution":{"observed_at":"2026-08-06T15:29:34.377976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15272","last_updated":"2024-10-08T07:18:21Z","snapshot_observed_at":"2026-08-13T05:48:33.624484Z","submitted_at":"2024-07-21T21:22:58Z","title":"MIBench: Evaluating Multimodal Large Language Models over Multiple Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15272","snapshot_observed_at":"2026-08-06T15:29:34.466045Z","title":"Mibench: Evaluating multimodal large language models over multiple images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.466045Z"},"links":{"cited_paper":"/paper/2407.15272","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:71681d2bda39faa8137577cf7fce72a828f00b0e333e1b257d615d471365378c","observation_id":"3148e369-a2de-4a8f-aab3-1ace73c11c2d","resolution":{"observed_at":"2026-08-06T15:29:34.466045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:36.706048Z","title":"A survey on lora of large language models","venue":null,"work_id":"6b701d09-7478-4bf4-bf88-1b8186d1e8d8","year":2025},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.538808Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:0b457a8b1d62d7d8ca28abc85f1589c938bcf04c6533eb347e1fb07d8abea382","observation_id":"dc9c221e-66ce-4533-8436-62b57fed643d","resolution":{"observed_at":"2026-08-06T15:29:36.710394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T15:29:34.609047Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, and et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.609047Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:cb89c3dad5c45a652d4aca90c782c75a75d040c145dc0f2e663f87b2da60dafa","observation_id":"97e71c88-e3a7-4d53-8d52-d14e98fc31ea","resolution":{"observed_at":"2026-08-06T15:29:34.609047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T15:29:34.684005Z","title":"Cov- ers architecture, multimodal input/output capabilities, and safety evaluations of GPT-4o","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.684005Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:5a2cacf60a8eea0a12180bb6c8910d2338a8ba3c86dc1b006603bd8bfea58c3e","observation_id":"c9e5bc96-48c3-4d02-83a9-7a99df77082b","resolution":{"observed_at":"2026-08-06T15:29:34.684005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-08-12T22:14:21.779675Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-06T15:29:34.782618Z","title":"doi: 10.18653/v1/2023.findings-acl.527","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.782618Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:9a147a8969be89a1eeaf13f5f2e45c65f158ee26ecf70ed197bcaa97e9234dca","observation_id":"9f34ef8a-b5f5-4b23-88f1-b4bde65a90f3","resolution":{"observed_at":"2026-08-06T15:29:34.782618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-05T17:55:26.008016Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-06T15:29:34.853072Z","title":"A systematic survey of prompt engineering in large language models: Techniques and applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.853072Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:536aefeac2f6992f30f49bb335196649f305039ad20d571c7fc2ef6a6a1d1a66","observation_id":"4bb3b7ee-5dff-4e22-abba-519bf33b5195","resolution":{"observed_at":"2026-08-06T15:29:34.853072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-05T17:55:26.008016Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-06T15:29:34.925120Z","title":"12 pages, 2 figures; provides taxonomy, strengths/limitations, datasets and models for prompt engineering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.925120Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:c97750944ffa27ec96d368d341380f98a6ccae39e7594c854acad02ffb1b4e9f","observation_id":"cf365a9e-c200-4616-a198-f5ed12c00cd5","resolution":{"observed_at":"2026-08-06T15:29:34.925120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07164","last_updated":"2024-01-26T07:04:02Z","snapshot_observed_at":"2026-08-13T10:55:41.544744Z","submitted_at":"2023-07-14T05:23:08Z","title":"Learning to Retrieve In-Context Examples for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07164","snapshot_observed_at":"2026-08-06T15:29:35.040526Z","title":"Accepted by EACL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.040526Z"},"links":{"cited_paper":"/paper/2307.07164","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:a7751633132e7568ecbbb2e77fa3250ef010ea6bacdec7e61336f8dd575faa0b","observation_id":"7128cb3a-d652-462f-9b52-9734428ecd8b","resolution":{"observed_at":"2026-08-06T15:29:35.040526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T15:29:35.096401Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.096401Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:8c7e10b21f53e5297488348ede799c711f8c714bc6341538d9344ce62c7b2e25","observation_id":"535cdd76-764d-4c93-90c2-c5102b1a572a","resolution":{"observed_at":"2026-08-06T15:29:35.096401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:35.167322Z","title":"Low-rank adaptation for foundation models: A comprehensive review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.167322Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:1eb246ba39d36757ffcaecdc93568489e908d5138e20281bec24c94a9970f3d8","observation_id":"8d74c232-7be3-496e-8ba4-d34d5a0e7702","resolution":{"observed_at":"2026-08-06T15:29:35.167322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00397","last_updated":"2024-08-01T09:07:32Z","snapshot_observed_at":"2026-08-14T01:02:55.367931Z","submitted_at":"2024-08-01T09:07:32Z","title":"In-Context Example Selection via Similarity Search Improves Low-Resource Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00397","snapshot_observed_at":"2026-08-06T15:29:35.243089Z","title":"In-context example selection via similarity search improves low-resource machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.243089Z"},"links":{"cited_paper":"/paper/2408.00397","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:2bbd2cac6b2b56ecd66c5374e983f14a7fbc1386c9b90d42163470bfabc4507d","observation_id":"6cec880b-4fb4-4243-b9f4-8972be25ee3b","resolution":{"observed_at":"2026-08-06T15:29:35.243089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00397","last_updated":"2024-08-01T09:07:32Z","snapshot_observed_at":"2026-08-14T01:02:55.367931Z","submitted_at":"2024-08-01T09:07:32Z","title":"In-Context Example Selection via Similarity Search Improves Low-Resource Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00397","snapshot_observed_at":"2026-08-06T15:29:35.291674Z","title":"13 Published as a conference paper at COLM 2025 Haowei Zhang, Jianzhe Liu, Zhen Han, Shuo Chen, Bailan He, Volker Tresp, Zhiqiang Xu, and Jindong Gu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.291674Z"},"links":{"cited_paper":"/paper/2408.00397","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:ab4f09029e4d924ad103d0acc17ce7955400e0cf81298b596b50babd3e459fc9","observation_id":"cf00b6b2-469d-4226-94e6-843f3fb610e1","resolution":{"observed_at":"2026-08-06T15:29:35.291674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-08-14T05:35:40.487992Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T15:29:35.387308Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.387308Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:c35948d0ed214b49d58e7a88ff766cdc184f31586e7d1fde3bc6ae524d218c5b","observation_id":"f304a5c6-2cb3-4968-9053-1d34374fe6bb","resolution":{"observed_at":"2026-08-06T15:29:35.387308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-08-13T00:49:57.484753Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-08-06T15:29:35.474334Z","title":"Vl-icl bench: The devil in the details of benchmarking multimodal in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.474334Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:c0279e7d9622dc57951451a061892d8b3069aa24fea28b0894db0ffeea8ad6ee","observation_id":"993d4abe-3f16-40b6-9fbd-24509c847c6e","resolution":{"observed_at":"2026-08-06T15:29:35.474334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:36.691365Z","title":"Suppose we introduce an attention reallocation factor to the softmax operation by defining F := diag(f) ∈ RL×L, where f ∈ RL is a vector of learnable factors","venue":null,"work_id":"d50709ff-597d-4e79-8b76-bc61e27b3156","year":2025},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.565985Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:be9e11db2a1d7a96369df7ff1d35a9216e5fdced7f112682569fd7308c9df4e8","observation_id":"72745e32-46c3-46c6-a753-4f3062bbbf79","resolution":{"observed_at":"2026-08-06T15:29:36.695880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:36.661746Z","title":null,"venue":null,"work_id":"b971a984-4d3f-4877-8b32-ec116f88e163","year":2025},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.793693Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:d85707e06d8ae4df8dad15ae164bfeb24b9b3b2cd3fcd4ad1c39afb858fc6631","observation_id":"76b1a58c-90ab-4a17-9672-254d8e38bfed","resolution":{"observed_at":"2026-08-06T15:29:36.665811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:36.647537Z","title":"As shown in the figure, within the range of a few hundred parameters, different configurations have no significant difference in the impact on the final performance","venue":null,"work_id":"098b921a-4af7-4262-b4da-664305994e3b","year":2025},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.934009Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:dd0e81a18ddfae858d33041310540a47a35d50451bda043d3d1a87d584392373","observation_id":"bee96674-cf52-4d2f-ad4a-a0b00a25105c","resolution":{"observed_at":"2026-08-06T15:29:36.652176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T15:29:33.523551Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.523551Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:6cd8e8f1cfd80d51fe2c0e70928a727d92a0c5ac46968038ba9a26404a5c96d7","observation_id":"97a50230-23ed-4cd0-a526-df69a1fde58d","resolution":{"observed_at":"2026-08-06T15:29:33.523551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15306","last_updated":"2024-06-13T08:32:24Z","snapshot_observed_at":"2026-08-12T23:43:49.271711Z","submitted_at":"2024-06-13T08:32:24Z","title":"Advanced Multimodal Deep Learning Architecture for Image-Text Matching","version":1},"cited_work":{"arxiv_id":"2406.15306","doi":"10.48550/arxiv.2406.15306","metadata_source":"pith","pith_arxiv_id":"2406.15306","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Advanced Multimodal Deep Learning Architecture for Image-Text Matching","venue":"cs.LG","work_id":"ffcfae64-06d1-44c2-a885-6f96d1c49178","year":2024},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.962587Z"},"links":{"cited_paper":"/paper/2406.15306","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:062e1e671b49207604995c22d2e3dd992bfe165a844ff48f6396a11a25af50b9","observation_id":"84e408d6-aba9-4656-aff9-84ee0bb82e34","resolution":{"observed_at":"2026-08-06T15:29:36.122777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11909","last_updated":"2024-11-22T03:34:15Z","snapshot_observed_at":"2026-08-12T23:07:05.883005Z","submitted_at":"2024-11-17T08:29:14Z","title":"SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11909","snapshot_observed_at":"2026-08-06T15:29:34.240882Z","title":"Symdpo: Boosting in-context learning of large multi- modal models with symbol demonstration direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.240882Z"},"links":{"cited_paper":"/paper/2411.11909","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:7de8627715b1b824a35ca0f09bc6d3e1cd050333087d5c1ccdcb9656d7e9603d","observation_id":"712a4f79-f2dc-43e6-ab4e-2a170e58783a","resolution":{"observed_at":"2026-08-06T15:29:34.240882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-08-13T05:14:06.788703Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-06T15:29:33.637147Z","title":"Benchmarking robustness of adaptation methods on pre-trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.637147Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:f5a6986475bd56ac774083d64295d9c4f754594896381bdac6c04964ddf38954","observation_id":"d0efde7c-62a4-4f48-934c-376553f6b27a","resolution":{"observed_at":"2026-08-06T15:29:33.637147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-13T23:34:41.809938Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-06T15:29:34.173300Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.173300Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:3ee98cdd0b6f534b227cb56996a705a688af73a05076822863562d58bb5b8b98","observation_id":"f5ca7f5c-4333-4f1f-ac79-bab58917cdb4","resolution":{"observed_at":"2026-08-06T15:29:34.173300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12736","last_updated":"2024-07-17T08:13:02Z","snapshot_observed_at":"2026-08-14T13:44:20.528486Z","submitted_at":"2024-03-19T13:53:37Z","title":"Towards Multimodal In-Context Learning for Vision & Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12736","snapshot_observed_at":"2026-08-06T15:29:33.800157Z","title":"Towards multimodal in-context learning for vision & language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.800157Z"},"links":{"cited_paper":"/paper/2403.12736","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:f8c672df13f3c3e1e742dd81af1311c2c9a5606cf111933154cb769232be438f","observation_id":"da1fab29-7ff0-4d7d-800c-e27fe95aa35b","resolution":{"observed_at":"2026-08-06T15:29:33.800157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T15:29:34.121756Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.121756Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:83d6b9ea8ea49d15e0ce2c4eee8cce15439a5333f4f97c348f1d295b31c07863","observation_id":"6621e578-bf53-499a-ad72-264555676780","resolution":{"observed_at":"2026-08-06T15:29:34.121756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:33.589687Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:33.589687Z"},"links":{"citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:c77ae8a3be3d4a794bb69af7b379bd8a1bc0ae8e26453fa066b34024cff79755","observation_id":"95b3e3fd-2f3f-4d75-a503-2094b83ceb13","resolution":{"observed_at":"2026-08-06T15:29:33.589687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12980","last_updated":"2023-07-24T17:58:06Z","snapshot_observed_at":"2026-08-14T02:16:30.667750Z","submitted_at":"2023-07-24T17:58:06Z","title":"A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12980","snapshot_observed_at":"2026-08-06T15:29:34.010676Z","title":"A systematic survey of prompt engineering on vision-language foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.010676Z"},"links":{"cited_paper":"/paper/2307.12980","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:4e89a03584c426d360229edc427245b1e5fa22e99cb0eb083e3f03956006a50f","observation_id":"56635091-ef64-4704-98cf-59e530b62c46","resolution":{"observed_at":"2026-08-06T15:29:34.010676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 4 inbound Pith citation observations for arXiv:2507.15807."}