{"as_of":"2026-08-17T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:870da5e8d832bb1084a6942ede6d12d4861d3c347d6f01030f2b55b01834a13c","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:56:46.279061Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:43:16.364125Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T20:47:45.997187Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"cited_work":{"arxiv_id":"2412.08378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fila: Fine- grained vision language models","venue":null,"work_id":"af414920-fdbf-43a0-99f1-3d4ff0a29ef4","year":2024},"citing_paper":{"arxiv_id":"2605.16909","last_updated":"2026-05-16T09:49:25Z","snapshot_observed_at":"2026-08-15T14:15:47.623703Z","submitted_at":"2026-05-16T09:49:25Z","title":"TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T20:43:16.364125Z"},"links":{"cited_paper":"/paper/2412.08378","citing_paper":"/paper/2605.16909"},"observation_digest":"sha256:1ef95588ff100e8918346f093d68ba835a160a1e497be48319a39527791df3ce","observation_id":"c76ac201-24c0-48b3-93cf-51a6d244060f","resolution":{"observed_at":"2026-05-19T20:47:45.998928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08378/citation-record","integrity":"/paper/2412.08378/integrity","json":"/paper/2412.08378/citation-record.json","paper":"/paper/2412.08378"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T17:56:46.154642Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.154642Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:d010fa7319f52d026aa0a2c732e8ffba983e41812d8f63541c7096e61b616775","observation_id":"f813ec16-4a44-46b2-96c0-1376501fd228","resolution":{"observed_at":"2026-08-11T17:56:46.154642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T17:56:46.160077Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.160077Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:05dfcc2d2f064a0f9db72182978eb69e3133c2614008e052c9e0fac81c69a13b","observation_id":"4909a288-bb1f-4aee-b11f-df4b973d623e","resolution":{"observed_at":"2026-08-11T17:56:46.160077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T17:56:46.165232Z","title":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Zhenyu Qiu, Wei Lin, Jinrui Yang, Xiawu Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.165232Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:4f913b2d89413b1f33b72b36d2e7353077ef65a0d45c4caecfbaf115c7dd8eb2","observation_id":"888df4e2-6bce-4c69-945a-8a2489a81a2d","resolution":{"observed_at":"2026-08-11T17:56:46.165232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-11T17:56:46.175229Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.175229Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:5dea1f004f9beee596a0e298ec11486640a870c9f069a364c82ef4b7dcd03bbb","observation_id":"ea4bc805-2138-49c8-b0d4-f514d986f7c1","resolution":{"observed_at":"2026-08-11T17:56:46.175229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T17:56:46.186496Z","title":"Andreas K ¨opf, Yannic Kilcher, Dimitri von R ¨utte, Sotiris Anagnostidis, Zhi Rui Tam, Keith Stevens, Abdullah Barhoum, Duc Nguyen, Oliver Stanley, Rich ´ard Nagyfi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.186496Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:ea8640b964059f6460ea365638aecc5ddfec66a070fa463251cb0e48657eef65","observation_id":"b3d3e998-e05f-4e26-97dc-c4565a33a5c6","resolution":{"observed_at":"2026-08-11T17:56:46.186496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T17:56:46.192029Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.192029Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:5bbfec05eb94206d81678881b0e908a3d09de3bf94d071b1f65f5ad7ca0b2b57","observation_id":"428fa63d-aa58-43e8-87c2-8b460dfb63c0","resolution":{"observed_at":"2026-08-11T17:56:46.192029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T17:56:46.197387Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.197387Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:96c86a96dc9f6f34fde71ab14aee8237ae9819757cf68c9114dfb2b951ff48ef","observation_id":"1175c106-796f-429e-8a42-686da30ca90b","resolution":{"observed_at":"2026-08-11T17:56:46.197387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T17:56:46.202345Z","title":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.202345Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:1d1e3d5750a4fa2e7955a36a44596b5dc7171cf37115f730084a53e583e61047","observation_id":"6ba66138-4fc2-4694-8843-2fba4401a95b","resolution":{"observed_at":"2026-08-11T17:56:46.202345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T17:56:46.207284Z","title":"Minesh Mathew, Viraj Bagal, Rub `en P´erez Tito, Dimosthenis Karatzas, Ernest Valveny, and C","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.207284Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:23638d031757a5a60631f6d9db1a4fccae2b598a08b39b376c09cd7490aaf65a","observation_id":"9bc0d697-dd1d-4f1d-87fe-7262da9f3897","resolution":{"observed_at":"2026-08-11T17:56:46.207284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T17:56:46.213549Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.213549Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:7ca72a0df6399940e65dcd6dfa8a33f620ea3d16804921d513190859cd0434c9","observation_id":"8d3c4315-3ca8-4715-82c9-2179207d2bc1","resolution":{"observed_at":"2026-08-11T17:56:46.213549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.764801Z","title":null,"venue":null,"work_id":"6e3fb62a-c8b3-47d6-9c4c-23a1ce8a1a81","year":1910},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.218289Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:1c7bb55b523bd5d91d2aea455bd8547a68ec4b37d302e0ae9e25ec70475d241b","observation_id":"a0970d59-34c6-4972-a6b9-5388cb254a10","resolution":{"observed_at":"2026-08-11T17:56:46.770043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-11T17:56:46.222949Z","title":"Amanpreet Singh, Vivek Natarajan, Meet Shah, Yu Jiang, Xinlei Chen, Dhruv Batra, Devi Parikh, and Marcus Rohrbach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.222949Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:bc052b331c76e54a7d477ae293a7b8c9c6ddaffa93909663ec06398647d0f619","observation_id":"f2e99b39-f197-4592-836e-3a76de13f774","resolution":{"observed_at":"2026-08-11T17:56:46.222949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:56:46.233399Z","title":"A Vaswani","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.233399Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:53e0c44ec69091bfec1baa71af7fe1a7c059f7cba56bc98485d9ecf138c8f8db","observation_id":"44f6bc17-8221-4c0d-8520-aafe88bde415","resolution":{"observed_at":"2026-08-11T17:56:46.233399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-16T14:36:01.153196Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-11T17:56:46.238546Z","title":"Ruyi Xu, Yuan Yao, Zonghao Guo, Junbo Cui, Zanlin Ni, Chunjiang Ge, Tat-Seng Chua, Zhiyuan Liu, Maosong Sun, and Gao Huang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.238546Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:5e78e44349d59364ce6a3c6722238bbad5b34201f26378fc44003ea4d32b6b9b","observation_id":"ae29ba6e-f9d1-4903-a0f4-529a03f08af7","resolution":{"observed_at":"2026-08-11T17:56:46.238546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-16T14:54:06.604406Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T17:56:46.243482Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.243482Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c342fe35962535841adc8e63fe5fc353c8af82610f1e105916467357f2da83a5","observation_id":"55c95798-9e2b-41f5-b04c-686960fd8bd6","resolution":{"observed_at":"2026-08-11T17:56:46.243482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-11T17:56:46.248659Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.248659Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c8b71ee61f1a564f34fcbaabdde705de6ee0546bac56e4fe335803d7114a782b","observation_id":"8a2f6583-0adc-40a9-ad94-e54e32ebd7f6","resolution":{"observed_at":"2026-08-11T17:56:46.248659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T17:56:46.253816Z","title":"org/abs/2205.01068","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.253816Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:1bdb2cb060a995896dcd715ab121962c27fa6666c2d3d65e1ea7360b1bb0ddba","observation_id":"7a54fad1-509b-4f1b-a290-bca8dd6e1302","resolution":{"observed_at":"2026-08-11T17:56:46.253816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-17T21:31:00.017761Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T17:56:46.258654Z","title":"Dehua Zheng, Wenhui Dong, Hailin Hu, Xinghao Chen, and Yunhe Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.258654Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:d9a976d25fc0ad006ecd2548964c6a2e5d55b39bd488a15309b742418cc68e9c","observation_id":"13a0b67e-8927-45fa-b62a-1bb7f7b13556","resolution":{"observed_at":"2026-08-11T17:56:46.258654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-08-08T19:18:06.171048Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-11T17:56:46.263567Z","title":"Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.263567Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:b5433b9527d253e57a7c19dc8269f37519a16e262e59594f78f424022c65b719","observation_id":"d7a57c20-ba52-4629-bb46-b6dcbdfef324","resolution":{"observed_at":"2026-08-11T17:56:46.263567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.747747Z","title":"We compared our model with Minigemini-HD and LLaV A-NeXT","venue":null,"work_id":"a0b61e20-63ed-41b0-8fcd-8d5520163989","year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.268813Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:13ea4026492de2b63e33d5a6f6842fb017c54636fdb32b94f95a084ab893b61a","observation_id":"97de2a77-2931-475b-ba2a-127cf6c5935f","resolution":{"observed_at":"2026-08-11T17:56:46.753400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.731650Z","title":"For the language model, we utilize LLaMA3-8B-Instruct (Touvron et al., 2023)","venue":null,"work_id":"7c49a37d-f48b-4490-9296-4d7c2b3b7eca","year":2023},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.274343Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:f8391b59426cf685546d88fc0445463978c8f58badedc1da2b04b71418c0c289","observation_id":"3cc98f9f-d5eb-4096-94be-a52d521ab81a","resolution":{"observed_at":"2026-08-11T17:56:46.736611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.713599Z","title":"1 Published as a conference paper at ICLR 2025 C A LIGNMENT STRATEGY Conv StageInput Dimensions (D, H, W)Output Dimensions (D, H, W)ViT LayerViT Dimensions (D, H, W) 1 (192, 192,","venue":null,"work_id":"bdb629d5-c044-4abb-a27b-06e79407a83a","year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.279061Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:1651647ec1572982a78acc24277ee831034a46288b92a0353edfb7d5d0ec6167","observation_id":"e10d6f62-724e-42c3-a318-5986a7073dfd","resolution":{"observed_at":"2026-08-11T17:56:46.720232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08163","last_updated":"2018-03-29T17:42:15Z","snapshot_observed_at":"2026-08-14T19:52:17.945143Z","submitted_at":"2018-01-24T19:47:04Z","title":"DVQA: Understanding Data Visualizations via Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08163","snapshot_observed_at":"2026-08-11T17:56:46.180959Z","title":"Aniruddha Kembhavi, Mike Salvato, Eric Kolve, Minjoon Seo, Hannaneh Hajishirzi, and Ali Farhadi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.180959Z"},"links":{"cited_paper":"/paper/1801.08163","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:4eb2ca8a4111190b6b1517a55de7ad2c6a88c6c9fe1bb41b965a8e04343a8251","observation_id":"90357c10-ccc6-4179-9542-bb05f495d320","resolution":{"observed_at":"2026-08-11T17:56:46.180959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-08-16T14:34:13.145148Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-11T17:56:46.227473Z","title":"Rub`en Tito, Dimosthenis Karatzas, and Ernest Valveny","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.227473Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:071eb4b89340aab3fbaead15c4874fe3f39ba581286a1ad479726c6a236d3d7d","observation_id":"4c3cc7a5-af74-4f29-a919-0133eb80ee98","resolution":{"observed_at":"2026-08-11T17:56:46.227473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T17:56:46.136537Z","title":"Soravit Changpinyo, Piyush Sharma, Nan Ding, and Radu Soricut","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.136537Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:36eacf46bf3f198a7fd2a85f4a4d997ca8d24e35fcaa63cb9352b9eabe087ce0","observation_id":"154c7030-8c73-4199-a715-a1fa32a30540","resolution":{"observed_at":"2026-08-11T17:56:46.136537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-08-16T18:44:50.804742Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-11T17:56:46.142751Z","title":"Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhi- hong Chen, Jianquan Li, Xiang Wan, and Benyou Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.142751Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:d7ca037a34327003948e12fcee3362d8cc9e204b4efea2130db5217f3dcad833","observation_id":"cc89895b-463a-4be5-adbb-c83152f070e5","resolution":{"observed_at":"2026-08-11T17:56:46.142751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:56:46.130070Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.130070Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:a181e2e4cfedd9a33130c3cc78fb357641501dc7ecc25913688e1930dfec627f","observation_id":"4094e0ec-f248-4279-add7-b8db8605f171","resolution":{"observed_at":"2026-08-11T17:56:46.130070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T17:56:46.148931Z","title":"Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.148931Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c09b7dd2a43f34f0f07da57b10295c49c290a3e30cdcc66e21f14fd870d787f3","observation_id":"c2f87344-0c1a-4a6f-8958-2bf4f66c849d","resolution":{"observed_at":"2026-08-11T17:56:46.148931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-17T08:51:17.030494Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T17:56:46.170245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.170245Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:2b094e1adcca32a0e133a385520fee4d8cff4e59d509dc99186526a0881b8f15","observation_id":"81823777-0b65-4849-b7b2-a4ce37034255","resolution":{"observed_at":"2026-08-11T17:56:46.170245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:26:14.747662Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2412.08378."}