{"as_of":"2026-08-12T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32031572f4b8d5b5bb1ce8d6b09681916fb5cc9675f2df448fb3f2e493b56110","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:02:30.892972Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:27:51.967982Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:b0becedf395ce1a5d288c67424b37402301f6b7efe4e1359ec406e0d9ef9ff23","observation_id":"dd7f3554-44ee-42ba-b06b-467407e2c8e1","resolution":{"observed_at":"2026-05-16T02:56:41.910944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:b596650be2553da9bd9039bb40cf781acd89952a97a0956a62384ea07a6bd7e6","observation_id":"f15eaf2c-2b1c-491b-8f51-e9039fa916b6","resolution":{"observed_at":"2026-05-14T18:08:01.435214Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:d6fbc0a90197b44984d6935a6a4d66849041226d0c1d8b406fa027c8cbd3f650","observation_id":"737d77a7-40dc-464e-9c30-c372d0fa1ddf","resolution":{"observed_at":"2026-05-16T16:35:38.122002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:432ff3e33788df7901c5b5150037f5f31bab51f19eadfadd232d142c62aa2711","observation_id":"f54563f4-19de-49c9-bf52-f9b7adf70306","resolution":{"observed_at":"2026-05-17T05:30:27.803927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b8047042aac29060960de540c472c4e9e77f4ece0c2cae0c56f523a84055495c","observation_id":"026ec8cd-05d3-41ab-9ba2-5bd5371627b9","resolution":{"observed_at":"2026-05-18T15:27:51.971525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T01:29:30.032408Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2403.14624"},"observation_digest":"sha256:fb3039b5bd649b3457cd84bc560aa0f44562aaa2f732cd1085d3ec21700496c5","observation_id":"f13f8c6f-5713-46a2-adce-0cef7d4feb27","resolution":{"observed_at":"2026-05-17T01:29:30.088181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-11T20:03:49.116970Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:b4a46e27711ac4c2e0c48e8b69a31cf88c3e7e3d502eb4a823830c86620f53d6","observation_id":"a484bc68-6ffa-4826-a853-fe2fb956504c","resolution":{"observed_at":"2026-05-17T10:46:28.643912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:e945f0e38f47d558dce9700bcbca8719eb1cdaa2b3d26bf943f6ffc115572d8a","observation_id":"19aa1d17-3199-40e6-8c75-6f59a9889bd4","resolution":{"observed_at":"2026-05-16T07:59:32.696358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-08-12T12:02:30.892972Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17558","last_updated":"2024-11-26T16:21:03Z","snapshot_observed_at":"2026-08-12T15:50:41.927659Z","submitted_at":"2024-11-26T16:21:03Z","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-12T12:02:30.892972Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2411.17558"},"observation_digest":"sha256:4755a0036a2de89430c52c95be621d7879cba9d0ac3717e33838479d144e05b8","observation_id":"fe3e5d8f-105c-4c0f-95b9-272f90625caa","resolution":{"observed_at":"2026-08-12T12:02:30.892972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-08-11T16:56:06.121595Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T11:44:25.110955Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:06.121595Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2412.09596"},"observation_digest":"sha256:446832992699f383b834cb2f1062beaf37ff40d90724f7c8cee159b66e790332","observation_id":"b40d57bb-ec1e-4364-b7a9-13a64f2269e7","resolution":{"observed_at":"2026-08-11T16:56:06.121595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-08-11T04:29:04.231658Z","title":"A Challenger to GPT-4V? Early Explo- rations of Gemini in Visual Expertise","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18826","last_updated":"2024-12-25T08:31:53Z","snapshot_observed_at":"2026-08-11T16:24:19.048579Z","submitted_at":"2024-12-25T08:31:53Z","title":"RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:29:04.231658Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2412.18826"},"observation_digest":"sha256:7d2795353c5849d25806e7a7c26da429a3182adee88c8e793cedfdd2a4b8e54e","observation_id":"a134b349-2279-4f04-b1dd-cc3d1a1ed253","resolution":{"observed_at":"2026-08-11T04:29:04.231658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.12436/citation-record","integrity":"/paper/2312.12436/integrity","json":"/paper/2312.12436/citation-record.json","paper":"/paper/2312.12436"},"outbound":[],"paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:00:54.413180Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2312.12436."}