{"as_of":"2026-08-17T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9213032da03feec7b654c87f5b25b465bd3a39137fbbcb0ae39b0b5ff411f15c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:21:54.590335Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:649dab09e1ab1a4e6807b37102e2054f209973287109094482b921cc8a203f41","observation_id":"217ca226-394d-49d1-82e7-fb462604f334","resolution":{"observed_at":"2026-05-10T20:25:34.309406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:930abcd46f49244a777febad12f606b79fd676aa1eb545a3b13e3bd57ddd8015","observation_id":"6aa60318-4518-4baf-b743-feb9d0bdf296","resolution":{"observed_at":"2026-05-11T12:33:33.307160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:5ac26bfc5d999ca55f0662294b7fc44567420198e5c7c46256388292da9e6f5e","observation_id":"b5641bb9-40a0-4262-8502-9a954cfc4b04","resolution":{"observed_at":"2026-05-10T21:07:32.087932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:7345f4f5f15ad59cd6ba281f8ba8ebcd675536034951ff1a6e5657eaf2ead151","observation_id":"0b33969a-66ec-4006-8894-d29737ff13b1","resolution":{"observed_at":"2026-05-23T07:42:42.993709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-11T20:24:58.819520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.819520Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a46eb77eed9007bf61877c6cf06e9454ae1efd5094adb95ef91fb02b0f19434e","observation_id":"c745772d-88be-4c47-9f00-6d7516d1e0ac","resolution":{"observed_at":"2026-08-11T20:24:58.819520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-10T11:53:55.481346Z","title":"Reformulating vision-language foundation models and datasets towards universal multimodal assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-15T21:06:18.731250Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:53:55.481346Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2501.16629"},"observation_digest":"sha256:3b9aef287f1d341397d48ef5911bfba2c618d6966ee418d43a0710c4ea81427d","observation_id":"1edcaefa-fd54-4104-8ec9-14bc52363ac6","resolution":{"observed_at":"2026-08-10T11:53:55.481346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-07T22:43:59.490358Z","title":"Reformulating vision-language foundation models and datasets towards universal multimodal assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-08-16T12:52:38.093535Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T22:43:59.490358Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2502.09093"},"observation_digest":"sha256:354eac45d189dca07535564e6a1c34d5eb07aa28bee97a38bf50aafaf340b2f6","observation_id":"82484be8-65d5-475b-8c38-226399ffc1f5","resolution":{"observed_at":"2026-08-07T22:43:59.490358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-16T10:21:54.590335Z","title":"Reformulating vision-language foundation models and datasets towards universal multimodal assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18397","last_updated":"2025-07-15T07:32:27Z","snapshot_observed_at":"2026-08-16T10:15:07.374373Z","submitted_at":"2025-04-25T14:48:18Z","title":"Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:54.590335Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2504.18397"},"observation_digest":"sha256:6c052c2b551318668181c8451564b6f0bfd99f4e51760f9a08f85194f7a60b7b","observation_id":"7d7ebf00-79a0-40bb-aa53-1d77bebc41fd","resolution":{"observed_at":"2026-08-16T10:21:54.590335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-15T21:06:20.914042Z","title":"arXiv preprint arXiv:2310.00653 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10875","last_updated":"2025-05-16T05:32:25Z","snapshot_observed_at":"2026-08-17T00:48:38.252957Z","submitted_at":"2025-05-16T05:32:25Z","title":"A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:20.914042Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2505.10875"},"observation_digest":"sha256:25ca6afaef2185032d6f244e05aaa5c17ba708d16df81a5baec9e4182231202b","observation_id":"02f89778-fd8d-41d2-9518-107419363a5e","resolution":{"observed_at":"2026-08-15T21:06:20.914042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-07T14:22:59.580874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19100","last_updated":"2025-05-25T11:33:08Z","snapshot_observed_at":"2026-08-16T05:38:37.195610Z","submitted_at":"2025-05-25T11:33:08Z","title":"ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:22:59.580874Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2505.19100"},"observation_digest":"sha256:4e3d8fa00addcfe5ff7b07676fa475a92ed5fc2eeafb7cf11aa4e9b78eb5e5ee","observation_id":"d24988dc-67bf-42b4-b1df-8f20cb1da434","resolution":{"observed_at":"2026-08-07T14:22:59.580874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-08-17T01:48:25.917894Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:696c37da43832c50d52e01482a7b2e2d85e225d0b7d114b6adf47f3c764f1c07","observation_id":"f30a3137-a4df-42e0-871f-31751ce3591c","resolution":{"observed_at":"2026-05-19T16:27:39.259198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:c2e577a0c87a733e1931662bcb31604522050e8d134f5bcaf60baf56958c5405","observation_id":"965a76ad-644f-4ffc-87e6-c643293715e6","resolution":{"observed_at":"2026-07-03T09:07:48.417157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00653/citation-record","integrity":"/paper/2310.00653/integrity","json":"/paper/2310.00653/citation-record.json","paper":"/paper/2310.00653"},"outbound":[],"paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2310.00653."}