{"as_of":"2026-08-20T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b20af6534602eea99f06548455dad9dd84ea6570939492c41f78f63092e8c5bc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:14:24.357070Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.481871Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-20T12:23:13.963013Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:f5371f458e3b05c849fb02a327fcbb046e65d48e34db0139ceeb092a4282c9a2","observation_id":"238f4ae0-43af-44c0-ac1d-6f6f576eac31","resolution":{"observed_at":"2026-05-18T15:27:52.145811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:6fd0c3ffb8e1fb36d99d1aa5c2d9f0a7234981ee2206d2d9a7ab711321303963","observation_id":"efa3fa37-7825-49ae-ae74-70459f1c9d1b","resolution":{"observed_at":"2026-05-23T22:20:21.568598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:a472726d034d463e3d5d58598b1f8e9abf6277b9225bda88e469a808d8464365","observation_id":"1c655613-c311-4e0f-9bf6-b1980c9068c9","resolution":{"observed_at":"2026-05-16T04:09:36.430260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:a0d499b0be90a702b2b58e36c1cb94f6f26edbf698cc06c7ec8e7c3561989351","observation_id":"e83d3dbb-328f-4248-b67d-2a7d1d376388","resolution":{"observed_at":"2026-05-15T22:48:36.288113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T16:12:25.980853Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2409.12514"},"observation_digest":"sha256:a73766c613c2cad81d9bb2ea39a87da504b120d3790fad16ae8ce833341a17d6","observation_id":"01874c40-64b1-4a60-ad83-df77265fd892","resolution":{"observed_at":"2026-05-17T16:12:26.041647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:97b7945ca308d986e4ba2f4b3b7ca2880ca8be45438b0a05bd9fd606b361eafb","observation_id":"064ebc94-c7b9-47c6-956c-da541c1e6655","resolution":{"observed_at":"2026-05-15T22:09:16.073820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-12T19:14:24.357070Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10928","last_updated":"2024-11-17T01:16:37Z","snapshot_observed_at":"2026-08-16T23:08:01.128154Z","submitted_at":"2024-11-17T01:16:37Z","title":"Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:24.357070Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2411.10928"},"observation_digest":"sha256:99cdcaf7fe983ddbe5ad7edb35c44fd226a1757d6b25193b0c65e801f7e1d00e","observation_id":"bfa17e6d-eb0d-460e-9494-c54ee7549810","resolution":{"observed_at":"2026-08-12T19:14:24.357070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-12T19:10:14.361152Z","title":"Llava-phi: Efficient multi-modal assistant with small language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10943","last_updated":"2024-11-17T02:44:56Z","snapshot_observed_at":"2026-08-20T12:37:12.500700Z","submitted_at":"2024-11-17T02:44:56Z","title":"Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:10:14.361152Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2411.10943"},"observation_digest":"sha256:d3fd43292b4ca08a1d495f3fcd54e097897759298497f60c01455154380f9e20","observation_id":"350fbf87-738c-4120-bf83-c1e3e53f517d","resolution":{"observed_at":"2026-08-12T19:10:14.361152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-12T04:28:39.788524Z","title":"Who is the artist of the object?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01370","last_updated":"2025-09-08T18:23:33Z","snapshot_observed_at":"2026-08-19T12:40:41.112593Z","submitted_at":"2024-12-02T10:54:31Z","title":"Understanding Museum Exhibits using Vision-Language Reasoning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T04:28:39.788524Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.01370"},"observation_digest":"sha256:2d98c03b01e285e719b3bafd87cdab7d04bbaaf16aeab68ae49b6a7a69649037","observation_id":"8433939e-def4-4455-b368-f57453b87aea","resolution":{"observed_at":"2026-08-12T04:28:39.788524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-11T16:57:06.818547Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-18T01:48:53.175172Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.818547Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:7fed013c2088985766b4816d6d7db69b901c0fe1c8f941ae21a7c1a29aa7c9a3","observation_id":"01a51fb4-2b19-467e-95e9-18ad1872f3f2","resolution":{"observed_at":"2026-08-11T16:57:06.818547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-11T10:25:34.251640Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16701","last_updated":"2025-08-30T16:41:13Z","snapshot_observed_at":"2026-08-17T16:25:56.761099Z","submitted_at":"2024-12-21T16:59:00Z","title":"AlzheimerRAG: Multimodal Retrieval Augmented Generation for Clinical Use Cases using PubMed articles","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:34.251640Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.16701"},"observation_digest":"sha256:a185cd60ff15e1b5a72d198e47d2f1cbd5302c24ba42719d4ef474fb845cc1a1","observation_id":"bf603baa-01b3-46dd-9ca7-8a40f53975ee","resolution":{"observed_at":"2026-08-11T10:25:34.251640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-10T23:12:19.104157Z","title":"Llava- ϕ: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.104157Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:196e48dd5af980e92f66aa259c55f8db193cd43b1720efce6ea60d62dec79cbc","observation_id":"066c069c-f4d9-4b05-9906-c9891d41afa8","resolution":{"observed_at":"2026-08-10T23:12:19.104157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-10T21:42:12.664774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-17T18:00:27.329541Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.664774Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:6d0d2df499d7eaa629c392f07d227290a2844e6adeab4f6f0de0514fc51796a4","observation_id":"b47da43e-68bb-4219-90ff-0a9e8e9856fe","resolution":{"observed_at":"2026-08-10T21:42:12.664774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-10T21:16:23.985198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05554","last_updated":"2025-01-09T20:01:15Z","snapshot_observed_at":"2026-08-13T08:29:41.229641Z","submitted_at":"2025-01-09T20:01:15Z","title":"LLMQuoter: Enhancing RAG Capabilities Through Efficient Quote Extraction From Large Contexts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:16:23.985198Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2501.05554"},"observation_digest":"sha256:2828ffdb35bac3f78d7b4e60fdba98bdb3d69b128a3054c66cbed91288c90d55","observation_id":"069d95ed-154c-49f9-8fb8-b65a17131abb","resolution":{"observed_at":"2026-08-10T21:16:23.985198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:4c874f42b92cc250a3a1dfc639b3c2e03560240fc7b34a68df8ed64a9bd570b7","observation_id":"ee3c0e73-0e11-4f6a-9d7f-ae60a25d8028","resolution":{"observed_at":"2026-05-11T08:14:53.057371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-08T19:32:32.091286Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-19T23:42:35.575400Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.091286Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:e87814c7c40014a6ae694f31ada86af01880e66f07cec3594e84ec6beca5075d","observation_id":"22b36fa5-7f81-4cef-a74a-5cb88c287ac6","resolution":{"observed_at":"2026-08-08T19:32:32.091286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:7d70a6eccedca7f394629d93ef3ee36e9677a9d9c1f9b93f8c2ee819c0ddf91f","observation_id":"c94ca341-21c4-4a6b-970f-82d1e6a2e98f","resolution":{"observed_at":"2026-05-17T07:24:04.756472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-07T14:04:59.785169Z","title":"Llava-phi: Efficient multi-modal assistant with small language model.arXiv preprint arXiv:2401.02330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-18T22:51:20.969084Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.785169Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:1c87862df2a1fbb83a8b829fd24ab24c9fc723e49b9a1a9eee6aeb0f028522d2","observation_id":"62bdc963-0009-484b-8998-f6b6db471a92","resolution":{"observed_at":"2026-08-07T14:04:59.785169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-04T18:58:13.064497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09560","last_updated":"2025-09-11T15:51:43Z","snapshot_observed_at":"2026-08-16T11:02:15.281160Z","submitted_at":"2025-09-11T15:51:43Z","title":"Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:13.064497Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2509.09560"},"observation_digest":"sha256:7a79ff83c447df40675b7450b7d59060774cbcc66788f9261137fd834dc743f5","observation_id":"e3d9b7ca-2369-4474-9e1e-20e63ef9d394","resolution":{"observed_at":"2026-08-04T18:58:13.064497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2603.19790","last_updated":"2026-04-15T01:38:03Z","snapshot_observed_at":"2026-08-12T14:27:23.399017Z","submitted_at":"2026-03-20T09:28:09Z","title":"From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T08:53:18.268970Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2603.19790"},"observation_digest":"sha256:68a5b622c94702ba233ceb1e86c876ad584ea64029359061cf39092e4855219f","observation_id":"5f37af42-41e5-4448-9e3e-cb67becaef07","resolution":{"observed_at":"2026-05-15T08:55:19.436731Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":285,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:3d5ed788f776eeb5d3baa74dbdd9301110fe149ea4c89d214c1e32c8796ac875","observation_id":"e441337d-b762-42cb-9e2c-65302fb3803d","resolution":{"observed_at":"2026-07-04T06:39:37.483246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-02T13:37:02.165763Z","title":"doi:10.48550/arXiv.2401.02330 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-19T02:00:22.433536Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-08-02T13:37:02.165763Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:aa3b95d32c102acbc4aacadc8efd3e0b620b8dada3b216ef6afc2c09b9cd6a2b","observation_id":"1f0fdd25-f117-41c8-8184-f0f80beee9a8","resolution":{"observed_at":"2026-08-02T13:37:02.165763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.02330/citation-record","integrity":"/paper/2401.02330/integrity","json":"/paper/2401.02330/citation-record.json","paper":"/paper/2401.02330"},"outbound":[],"paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2401.02330."}