{"as_of":"2026-08-08T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:063edf33c71436356aea55f4e8dadb711fc77ded4e3eeef727c97da57d8d50b7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:25.419580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T04:25:19.781518Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-08T21:28:23.195012Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:f831a533122a0b6809dda4925bc55e082461837e38c8047016050243d3a3ac89","observation_id":"8689c888-24a6-4676-8f49-0fd6649775e0","resolution":{"observed_at":"2026-05-17T01:09:30.475892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:25b575bb9e84e6de5ae57701ef50487d39637ce382cf2f2498e28e7eafcafd2e","observation_id":"c324eeda-50c0-4d0a-a6d4-63947787e77b","resolution":{"observed_at":"2026-05-11T06:01:53.841270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-07T10:45:25.419580Z","title":"Chen, and Andrew Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04579","last_updated":"2025-06-05T02:57:05Z","snapshot_observed_at":"2026-08-07T10:36:19.800465Z","submitted_at":"2025-06-05T02:57:05Z","title":"Selecting Demonstrations for Many-Shot In-Context Learning via Gradient Matching","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:25.419580Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2506.04579"},"observation_digest":"sha256:414390266e4fb1763cae29d8f0dd3f55d40cdaccdf3cd38d19aa3ab7483189b9","observation_id":"41d89f27-34a1-4bbc-9c4f-63c89b39b4f0","resolution":{"observed_at":"2026-08-07T10:45:25.419580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:5f16f6410985e703bbda56e4097b4fd7f262b96c0cb2c5a4b370cb15eb77bc06","observation_id":"973035ca-77dd-43cd-8391-1e740949f05d","resolution":{"observed_at":"2026-05-19T05:57:08.083275Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-06T15:29:34.320527Z","title":"Chen, and Andrew Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-07T23:52:34.092202Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.320527Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:361091f2101b4502bf4b5e6c587f8c2eca95d46259706e85cd2841fdf22177f4","observation_id":"81541ab2-1b20-4b79-8230-ef2d6bf3d74c","resolution":{"observed_at":"2026-08-06T15:29:34.320527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-06T15:29:34.377976Z","title":"2405.09798","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-07T23:52:34.092202Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.377976Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:1e7b8a2e85c187516dda76e490a83ca117e6f0138da9567c59bfce85e86a8886","observation_id":"f949f0e5-46a8-445c-be4f-4a7c575cc8a6","resolution":{"observed_at":"2026-08-06T15:29:34.377976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-06T15:20:38.661092Z","title":"Many-shot in-context learning in multimodal foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16217","last_updated":"2025-08-29T18:45:22Z","snapshot_observed_at":"2026-08-08T13:31:49.745762Z","submitted_at":"2025-07-22T04:21:03Z","title":"Towards Compute-Optimal Many-Shot In-Context Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:20:38.661092Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2507.16217"},"observation_digest":"sha256:ba6fb1e5e185c795885d116902434b09dde825859c66eb08f27d69efc1fb728f","observation_id":"95eb9f2f-dd60-4303-995a-fb97ec87b6d8","resolution":{"observed_at":"2026-08-06T15:20:38.661092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-03T17:20:52.476377Z","title":"Many-shot in-context learning in multimodal founda- tion models.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.476377Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:6cb0593e60e3504c35b6bac3f18069400c7f5db7fefa5c462ab77232bf612f81","observation_id":"a01c224e-b043-443d-9d2f-17963259643c","resolution":{"observed_at":"2026-08-03T17:20:52.476377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2605.10936","last_updated":"2026-05-11T17:59:17Z","snapshot_observed_at":"2026-08-02T15:59:41.195828Z","submitted_at":"2026-05-11T17:59:17Z","title":"Personal Visual Context Learning in Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:42:15.402131Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2605.10936"},"observation_digest":"sha256:50be2efa5d0aabe9b9ea915447844febd9ab5b8508f49e91c6e206c3e09091c2","observation_id":"c6c0965f-1f6e-458e-9f0e-fd5d4f94c0b7","resolution":{"observed_at":"2026-05-12T07:06:37.577186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2605.23598","last_updated":"2026-05-22T13:06:46Z","snapshot_observed_at":"2026-08-05T16:03:21.062446Z","submitted_at":"2026-05-22T13:06:46Z","title":"When Youth Enter the Algorithmic Wild: Discovering and Understanding Potentially Harmful Teen Videos on Douyin and Kwai","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T04:20:27.456558Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2605.23598"},"observation_digest":"sha256:cb4ea4b1cb5537fdc7814e6326567b33c1cc62f24eedf79d917c5b2da309283e","observation_id":"c5992951-048a-4136-8f99-84469c93f655","resolution":{"observed_at":"2026-05-25T04:25:19.783887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-01T14:15:59.840877Z","title":"Many-shot in-context learning in multimodal foundation models.arXiv preprint arXiv:2405.09798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18819","last_updated":"2026-07-21T07:55:07Z","snapshot_observed_at":"2026-08-06T23:55:01.270909Z","submitted_at":"2026-07-21T07:55:07Z","title":"In-Context Learning for Wound Classification with Small Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:15:59.840877Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2607.18819"},"observation_digest":"sha256:a59868ba84b52d74618f3f050122a9fec0ef19131f1ee358bd83794e9b0bd31c","observation_id":"610dae7e-06c2-4739-9085-c936289a3846","resolution":{"observed_at":"2026-08-01T14:15:59.840877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-01T05:38:56.492179Z","title":"Chen, and An- drew Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27564","last_updated":"2026-07-30T01:16:32Z","snapshot_observed_at":"2026-08-07T07:40:18.643570Z","submitted_at":"2026-07-30T01:16:32Z","title":"Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T05:38:56.492179Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2607.27564"},"observation_digest":"sha256:4f1e05f9d727455955f701b42ca9c629d4bc37c1c963db8f2a3a34157810800b","observation_id":"081ba260-c89f-4407-88bd-80a52c4d203e","resolution":{"observed_at":"2026-08-01T05:38:56.492179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.09798/citation-record","integrity":"/paper/2405.09798/integrity","json":"/paper/2405.09798/citation-record.json","paper":"/paper/2405.09798"},"outbound":[],"paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2405.09798."}