{"as_of":"2026-08-09T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f2450adfbdc0947ad439cbf6aaea9c109977456175ef8e4ca9c193f1ac0391b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:24:46.417390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:b66e13e0af54ba5b899192da54940680b7a5d7ee1fd653ea7b27219cc59ae4b0","observation_id":"ae3d4092-7407-449d-8aa4-9e8916771767","resolution":{"observed_at":"2026-05-15T15:46:06.530109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:aa269b00145be445692cfad07dda32db3fdc94072b56ab49af0af0cb1461fda0","observation_id":"6825f400-1343-4766-84a6-68c9cac61b92","resolution":{"observed_at":"2026-05-15T05:37:41.625490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:79678325c4ef794357d8204a908659c144873a0352ed9e0a628a1fc27f87128b","observation_id":"b0911ed6-c864-4058-885a-60fdd5a49a52","resolution":{"observed_at":"2026-05-16T04:09:36.258789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:5979dd9f23a9f87eeca9b0e102f3bd256c1862a4a670031b606bd10188d6aa77","observation_id":"a979d1ca-2f30-44fb-abeb-5bd5a1198235","resolution":{"observed_at":"2026-05-17T07:44:47.444102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:c54f96ee7d38cbafc49316b8c2a027803cda08ece91a96c2859971acbb7c4793","observation_id":"c634f635-b37b-4346-92e7-85eb92dcf127","resolution":{"observed_at":"2026-05-15T22:48:36.198403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-08T21:28:23.195012Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:458f270137024502299112060c0c9a8e40b4aa83f9b675a73dcb28be9afab0c2","observation_id":"9a5d5d9d-7d52-4730-b776-94eaa623f032","resolution":{"observed_at":"2026-05-17T01:09:30.412895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:fd8e2e85f32b21dcd5c918d42cb8e698c145f0c31a096d571998447b67a32352","observation_id":"61279890-74ee-4548-bfe9-d7e7817849f0","resolution":{"observed_at":"2026-05-11T13:10:20.569913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:26ea1cb1a95ead78f2d58ab3798e37324a63b358862edaf3d4121887aa2dac24","observation_id":"e6da27c2-5c8e-4e1b-a7ba-711c96c4e96b","resolution":{"observed_at":"2026-05-11T21:03:33.563332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T15:24:46.417390Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.417390Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c912432a39d34662204b39d81c2633ea251c253fd550e2a342d0c7299e7c49da","observation_id":"110289f0-5ca2-4927-8b8a-e23636be0980","resolution":{"observed_at":"2026-08-08T15:24:46.417390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T14:25:55.834228Z","title":"Generative multi- modal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.834228Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:fd2308d687b8ceae9fc17716936b828c8b784d91c51f92e11b764dedaed250bc","observation_id":"93fee7ad-4953-479f-a040-2b380c6b26f9","resolution":{"observed_at":"2026-08-08T14:25:55.834228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:b74743fe597acf6d81e53274b146577c2528e6e8dc29ff71ccbd2d067bdc6af6","observation_id":"ec11eb0b-6777-46b3-b61b-780cc315fee6","resolution":{"observed_at":"2026-05-15T14:50:59.902495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T12:48:55.005689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.005689Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d53e0897cba28e1a005ac45e447f2e4d9d833b421ced8b0709c1a880488ef899","observation_id":"c2c0e2d7-3117-4f63-9400-0e3e1d0fe880","resolution":{"observed_at":"2026-08-07T12:48:55.005689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T10:27:36.829877Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05182","last_updated":"2025-08-20T20:52:35Z","snapshot_observed_at":"2026-08-08T14:59:33.448999Z","submitted_at":"2025-06-05T15:52:44Z","title":"On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:27:36.829877Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2506.05182"},"observation_digest":"sha256:ba54160f65f28f5f32a0921b6c2bf5047b6768707c9fdb7fd8004ff72c8aeca6","observation_id":"6e9ff967-d6ae-49d2-9586-7c1815053cbd","resolution":{"observed_at":"2026-08-07T10:27:36.829877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-07-30T11:23:08.233438Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:79dc7ae3c661cfe71a9425e257f360e488231ef97fcbde852a5fe7d755689f74","observation_id":"4da437f8-b144-4448-a08b-69ee1b9052b8","resolution":{"observed_at":"2026-05-16T23:31:21.916857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-02T19:58:25.979720Z","title":"Generative multi- modal models are in-context learners.arXiv preprint arXiv:2312.13286, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:25.979720Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:8ab4b4cf6e30da15deba97243ed9d191f49b851bb72442b5e2cf484c2051213c","observation_id":"7e283520-1b01-40ee-84a0-82bf6d97e28f","resolution":{"observed_at":"2026-08-02T19:58:25.979720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":245,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:8249fa9c3c51533a83dfd0279e1d1d5884fcbd5fc98732e188cf331528306a52","observation_id":"756d0efe-bc9d-4e89-99d9-89e0a93114cc","resolution":{"observed_at":"2026-07-04T06:39:37.521811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv preprint arXiv:2312.13286 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:c335ad2ad4bc2f2f8a630cd28f59a325bd4ded56446069fea41135c14bc58d72","observation_id":"d96f5082-d825-49ea-9723-2d8cf0e31c10","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.13286/citation-record","integrity":"/paper/2312.13286/integrity","json":"/paper/2312.13286/citation-record.json","paper":"/paper/2312.13286"},"outbound":[],"paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2312.13286."}