{"as_of":"2026-08-14T11:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb7f9bc98e92058a738bfe7b32425fb56df960dd1c81bb85d8018e9846a63557","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:27:52.652519Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:19:23.116337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T19:52:01.828238Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04424","snapshot_observed_at":"2026-08-11T13:19:23.116337Z","title":"Florence-vl: Enhanc- ing vision-language models with generative vision encoder and depth-breadth fusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-13T07:57:54.393510Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:23.116337Z"},"links":{"cited_paper":"/paper/2412.04424","citing_paper":"/paper/2412.13303"},"observation_digest":"sha256:0de43ef580a6cf12f10a556d662df041cb7cf199c18e687aa686ee38b46f19c1","observation_id":"64004760-0a21-4965-9e0b-4fc9dcc32781","resolution":{"observed_at":"2026-08-11T13:19:23.116337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"cited_work":{"arxiv_id":"2412.04424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04424","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Florence-vl: Enhanc- ing vision-language models with generative vision encoder and depth-breadth fusion","venue":null,"work_id":"57f5d0fd-23b7-4874-96ae-948c8f108eeb","year":null},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2412.04424","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:cf968dc8f2781d67b23b428a2ee9ebe2514f6101a4ef7659a7a78de26aaeeef9","observation_id":"218253da-2784-4767-9d0b-c3607ba54cfd","resolution":{"observed_at":"2026-05-22T19:52:01.829787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04424/citation-record","integrity":"/paper/2412.04424/integrity","json":"/paper/2412.04424/citation-record.json","paper":"/paper/2412.04424"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T21:27:52.358895Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.358895Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:4c5335207cc5ba9bab0e5ec717362bba97b62f1efe1e86ffcd862988d9896959","observation_id":"b956506a-982a-431f-8170-27aaaa06b663","resolution":{"observed_at":"2026-08-11T21:27:52.358895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T21:27:52.365941Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.365941Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:da36f014c84c284197421a90c341499d150905f62090ac414f71d57ca41949af","observation_id":"73d66cdb-0fd9-4603-88fb-82d5e93f9db0","resolution":{"observed_at":"2026-08-11T21:27:52.365941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.373463Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.373463Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:9e6c4eb2ef023e69c1b61eedd34f804e8b6f2ec1a7363dd07ff7295d425f6d11","observation_id":"e3dbb1f8-5959-44b1-bc98-6ab0b1857bba","resolution":{"observed_at":"2026-08-11T21:27:52.373463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.590082Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"87016888-bb34-44b2-a730-ceed08724194","year":2021},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.384569Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:8a33fa002f3e8bd781b23e9f6bc84ae4526c241ca3cf39253ed2c8cea8661f36","observation_id":"e545521f-1398-4fcb-acaa-3c8b045d2899","resolution":{"observed_at":"2026-08-11T21:27:53.595830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.390586Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.390586Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:0090590012012abee6f3168b20fc926762e1c8e6a269dd8e42843077206273bf","observation_id":"c2634cb1-deab-4a63-af2c-963f94e4c157","resolution":{"observed_at":"2026-08-11T21:27:52.390586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T21:27:52.396272Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.396272Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:0f8cb319cf3e573bce990a57a405678e773703baa11db09481d3cba26c129959","observation_id":"4bbbe195-f89a-480e-8f8b-41904477a200","resolution":{"observed_at":"2026-08-11T21:27:52.396272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T21:27:52.402068Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.402068Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:d4d5b7f673f6286e63c794429beda46b37b531c62cd22733501de4ed10a71330","observation_id":"705a2024-bc8b-4132-88a3-a692ecf4a82a","resolution":{"observed_at":"2026-08-11T21:27:52.402068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11431","last_updated":"2021-11-22T18:59:34Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:34Z","title":"RedCaps: web-curated image-text data created by the people, for the people","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11431","snapshot_observed_at":"2026-08-11T21:27:52.409590Z","title":"Redcaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.409590Z"},"links":{"cited_paper":"/paper/2111.11431","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:d446acbb0dba0a2537008bd75e982fbdc523a10ee644dcf027c13f7a3e5a8061","observation_id":"9414ee1a-b5f6-4f34-8654-3c2d883cd8f5","resolution":{"observed_at":"2026-08-11T21:27:52.409590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.416001Z","title":"Davit: Dual attention vision transform- ers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.416001Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:1a88f3a5fe04d6c982a71bcd94a4dac53e31744cfb04f03f1138958cbef0134d","observation_id":"ecdf898e-0441-4504-ada4-9e1fbcfa386e","resolution":{"observed_at":"2026-08-11T21:27:52.416001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-08-14T08:52:52.282135Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-11T21:27:52.421540Z","title":"Mousi: Poly-visual-expert vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.421540Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:26b7cdb83aec5f141b5d4549a40ba0afe4831f9d3d211331e6eda4fddf06123c","observation_id":"65923e19-8764-488a-8f45-b407ced021d8","resolution":{"observed_at":"2026-08-11T21:27:52.421540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.544274Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"fbbd07b8-1494-4d7b-bc43-9191c63616f8","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.427855Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:62fb5242b1b9f0f068c2b12964df0161c6dd88a55edd6f579fafa89da2a783f1","observation_id":"d85dddf7-2316-4c01-aef1-2e9e7880a900","resolution":{"observed_at":"2026-08-11T21:27:53.550135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.523511Z","title":"1 OCRBench ChartQA DocVQA InfoVQA Average Florence-VL 7B 41.4 24.3 44.5 29.4 34.9 OCR 40.9 22.9 44.4 29.0 34.2 (a) Ablation study on OCR features on OCR & Chart benchmark","venue":null,"work_id":"42cae073-91ec-4558-b819-deadda721818","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.433721Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:50acdf6953c51cb98c024516e94c5b6d3a5d17cefe9ee3c23c8c7649984e97eb","observation_id":"9949e921-a402-44e7-8569-72e9ea923183","resolution":{"observed_at":"2026-08-11T21:27:53.530537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.440844Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.440844Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:b9409e485bc71ac8b97f8807a2035b1a05469767a82162f8824081febefec6be","observation_id":"2a861900-2d06-4a04-aac0-5dff573460da","resolution":{"observed_at":"2026-08-11T21:27:52.440844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.449811Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.449811Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:6440eb17d0ad96a363b9ca6fbc0638de9d968f3ddab09ed82dcc101f99eb8b7e","observation_id":"1275089c-6f36-4479-b281-f93268b4aadc","resolution":{"observed_at":"2026-08-11T21:27:52.449811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-12T22:26:58.169929Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-11T21:27:52.456702Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate.arXiv preprint arXiv:2410.07167, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.456702Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:793d97f6bb0efdd901adcbb59d1e0d96c79b0df6f6409e8fba7792e127732c7c","observation_id":"97833a46-8d04-47f4-9ce4-7e47936c38dd","resolution":{"observed_at":"2026-08-11T21:27:52.456702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.483655Z","title":"Gqa: A new dataset for real-world visual reasoning and composi- tional question answering","venue":null,"work_id":"3c1ed39d-c98a-4052-afa9-6b04a78f4585","year":2019},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.463327Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:a651025c2621c79d31fbc7c5bc882ba80d867023ccb1702271e44a2f4623aed3","observation_id":"9057387d-297f-4da6-b097-d93f084b186b","resolution":{"observed_at":"2026-08-11T21:27:53.488827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.466433Z","title":"https://huggingface.co/datasets/huggingfacem4/docmatix","venue":null,"work_id":"77ceac1a-b479-45ce-9181-a86c124aaf3c","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.469074Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:3b12af4d0439beb0db67242b32711e75b607edcc426e006ee9403792118f80b2","observation_id":"be1c5739-1cc9-4fc8-a3d4-d63acc3e9d10","resolution":{"observed_at":"2026-08-11T21:27:53.471426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07204","last_updated":"2024-04-10T17:59:45Z","snapshot_observed_at":"2026-08-13T00:33:11.656511Z","submitted_at":"2024-04-10T17:59:45Z","title":"BRAVE: Broadening the visual encoding of vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07204","snapshot_observed_at":"2026-08-11T21:27:52.474048Z","title":"Brave: Broadening the visual encoding of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.474048Z"},"links":{"cited_paper":"/paper/2404.07204","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:c78bbbe2a49110155f8668c8696a84c19a62d39a38defd1c09cb103a307f0fe8","observation_id":"25e88791-2850-4d96-abf5-cb34e4ed394a","resolution":{"observed_at":"2026-08-11T21:27:52.474048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.480290Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.480290Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:f96c8239d70d9d675137c4f7d229f4241f18aa9dfc1a42b3779efa4811f98402","observation_id":"c81180e8-05f8-4fdf-b406-7af522edb8a9","resolution":{"observed_at":"2026-08-11T21:27:52.480290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.438043Z","title":"Segment anything","venue":null,"work_id":"aede3007-488d-4588-82ad-2027d993e185","year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.485430Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:849b3ac3314f92db8e7390139539962d039da2af64924add923a4679225c7698","observation_id":"69d6e750-e170-4d16-b40f-58e33aa5b120","resolution":{"observed_at":"2026-08-11T21:27:53.443083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T21:27:52.490300Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.490300Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:df55040d05763ce3e1b43264f66d0c005ac7d6be678b56ecc754dc81aeb961c9","observation_id":"c18cdb79-ee2e-4d68-80ad-9c318057e82e","resolution":{"observed_at":"2026-08-11T21:27:52.490300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T21:27:52.495049Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.495049Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:3b2b430506a2e0e05fd583edae26a13c094fb3e6216262f6b59b1158cdd228b3","observation_id":"1c185393-b516-4b8f-a95a-a7f5e050ab82","resolution":{"observed_at":"2026-08-11T21:27:52.495049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T21:27:52.500877Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.500877Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:7b0d40a12a98572262b44f0761207cb194fc5fd66ccb3db43ff0bd0e8465e6ee","observation_id":"b7ada76e-a126-41bf-8e2d-2544309c0542","resolution":{"observed_at":"2026-08-11T21:27:52.500877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.419277Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"e03ca717-7dc2-4418-8fb3-5103b8d76d0e","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.507812Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:5b114273fc7f20f312e7e8eaf557bb747bbc3ac325dceb498353a71b90e52fe6","observation_id":"585e9a9a-c40d-424c-af9c-6471ea6713dc","resolution":{"observed_at":"2026-08-11T21:27:53.425426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.401434Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"aba8b84c-abf0-4638-bb66-6e578f58d18f","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.513166Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:e160abb788237b8797edd9a3222a13a61bef23da742cc58736d72c6affc7f65c","observation_id":"f82b0b6d-6db2-4632-b1e7-c07ee3860d84","resolution":{"observed_at":"2026-08-11T21:27:53.407582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.382909Z","title":"Visual instruction tuning","venue":null,"work_id":"2762e2b1-cde6-44ad-908c-faf12eba2026","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.517698Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:b5e9359ce42f343232d6a0d560ff6bf473d5c2a1fdddc2842b985521d6ba41a2","observation_id":"0405be2a-9cb1-41b3-9e90-e9d964aad5f3","resolution":{"observed_at":"2026-08-11T21:27:53.388823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T21:27:52.522098Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.522098Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:9ff64ca9c9ad6525aff1998673fee90f71c93f8b9cbab7e45ea45710958c63d7","observation_id":"df400d4d-2b78-483d-a1cd-3d232cc529a9","resolution":{"observed_at":"2026-08-11T21:27:52.522098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.363458Z","title":"On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"048c4091-ffe7-4dd6-a1dc-8df60cc0dc3e","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.528019Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:8c59ea562453dfa3cd8c5627386927dd7395aeca2a2b1b61669db68ce18aa502","observation_id":"66be9e77-1902-4cae-8bfa-ad0a2649ecd9","resolution":{"observed_at":"2026-08-11T21:27:53.370325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.534535Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.534535Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:9d0ece05611bf78a7250f4d3643e2a01d19fda73c1ae8440472d05dbcf9e1bfe","observation_id":"b4cc4588-c9cb-406e-a003-5ad3c972f9f1","resolution":{"observed_at":"2026-08-11T21:27:52.534535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T21:27:52.542222Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.542222Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:ebc846e2dfc58ad7547b8790b132d9f2f4d42609f47d03514df8db2155e288d5","observation_id":"7882e73a-5805-4a99-a5e8-d8f1de9d942d","resolution":{"observed_at":"2026-08-11T21:27:52.542222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T21:27:52.549213Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.549213Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:3650f1fdbbb62f440c6946471e492b1ebb6affd061c91515e9940330d708f7ab","observation_id":"03014ae0-8ff4-4404-b100-0b1158232468","resolution":{"observed_at":"2026-08-11T21:27:52.549213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.334732Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"5acffaff-2270-45ca-917f-85402a0d5213","year":2021},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.555743Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:977ef5fb11350f01fcffe7ab58996329b70ec07455e074dd5abf66a06516d442","observation_id":"6b97a60d-041a-4f64-84d2-d8ab627bcdff","resolution":{"observed_at":"2026-08-11T21:27:53.340149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.317860Z","title":"Infographicvqa","venue":null,"work_id":"a50a3337-9b8f-4195-a236-ba4ef10ee4de","year":2022},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.562395Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:7cf067642aea54248fa98a0d860cd6ff18cb3d43da095b8de7ea2d18b886f0f7","observation_id":"47f88643-2ab5-451e-a260-1f0eae8f096d","resolution":{"observed_at":"2026-08-11T21:27:53.322795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T21:27:52.567906Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.567906Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:bae04c3151d4c78226f2563622e37490cda51348f39779758f2dcea4da1ee5a2","observation_id":"a398bc26-f685-401e-bcd0-73a7cbafa363","resolution":{"observed_at":"2026-08-11T21:27:52.567906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.576254Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.576254Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:b9b15a3e03f852354aa091ab0f589fcdc82a966722add3f5481c2765e972e60e","observation_id":"d4943f97-7c2e-4cbd-808e-d00c1d060b6f","resolution":{"observed_at":"2026-08-11T21:27:52.576254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.289157Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4201b3f7-2cf3-435e-978f-5aa2916060ab","year":2022},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.581690Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:cc5c61e488cdde3c4f2c63c3d913a03503a304eb46f9e3c0856ccdee0031001c","observation_id":"b88d5a6c-e5f9-46c9-ace0-dc8f350875f1","resolution":{"observed_at":"2026-08-11T21:27:53.294408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.586544Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.586544Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:be80baf0a14ca9c0290272ac06edf412a9b33eb8cb659f3d95e5477d9c69367a","observation_id":"71e6ccaf-f75e-4a55-97a5-ec119f8c7d18","resolution":{"observed_at":"2026-08-11T21:27:52.586544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T21:27:52.592158Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.592158Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:643966293d50d006510854e21e1223ac190e9402d3de9369d2651db5fcdfcf49","observation_id":"09010bec-878a-4b04-b1d3-177e846291a6","resolution":{"observed_at":"2026-08-11T21:27:52.592158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:52.597176Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.597176Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:55064fd8f66d287f9b61b86bbaa3bcdb330d61bbb3271f3292d24235b3a40c46","observation_id":"5d7b7ede-4e70-42f2-9375-2c3f2253565c","resolution":{"observed_at":"2026-08-11T21:27:52.597176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.237245Z","title":"From pixels to prose: A large dataset of dense image cap- tions, 2024","venue":null,"work_id":"4b430735-5e02-4844-81ef-4e68f6d68298","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.601645Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:2cfcf7165df6f84b7709b83c670e5daed42004827302a48f9686575e3f715c19","observation_id":"8a3a990d-15cd-4897-814f-c08f30a6125b","resolution":{"observed_at":"2026-08-11T21:27:53.245545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T21:27:52.606243Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.606243Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:5c26e897739e3fc1aeba59c4e5d832a09517b7f1d750b6419d215afc9098b988","observation_id":"ae169a02-3cd8-42c9-8da2-c956e3896f11","resolution":{"observed_at":"2026-08-11T21:27:52.606243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.218143Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"2ec2c405-c73d-48e1-952d-c2bd1938b82e","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.611668Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:f3960bb858052a9405ab3ec44eda9698c8178c2b89f6af934686d4c23bc9eeb7","observation_id":"791cc9f6-8b4e-42c2-a0d9-998d402dfeb2","resolution":{"observed_at":"2026-08-11T21:27:53.223712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17139","last_updated":"2024-10-14T04:36:09Z","snapshot_observed_at":"2026-08-13T04:31:00.535683Z","submitted_at":"2024-01-30T16:19:55Z","title":"Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17139","snapshot_observed_at":"2026-08-11T21:27:52.617470Z","title":"Large language model evaluation via matrix entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.617470Z"},"links":{"cited_paper":"/paper/2401.17139","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:4df8e4d5e3a3cea154805bcd18bf2f5d5ef05350f53ab8980e0980ebf26c776c","observation_id":"539ee10d-03e0-4204-8786-9fd0a58bf643","resolution":{"observed_at":"2026-08-11T21:27:52.617470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.201117Z","title":"Grok 1.5v: The next generation of ai","venue":null,"work_id":"308e1b6e-f2b1-4023-82e7-5052369379fd","year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.623951Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:7a67f1898331d19a1281025e9eb1485cd0737732cfaba6e96d9d56a2566bb21a","observation_id":"50447d1f-36a5-4257-859b-53a1eb9bf355","resolution":{"observed_at":"2026-08-11T21:27:53.206047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.183569Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"86a39a21-521e-4119-a79a-0c6998e566fc","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.630399Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:452b66edf4f75885b6d320e59116d5cd89c2129c7309e8480bc820ec21298925","observation_id":"57ac3f18-f882-475b-b822-65dc159353f6","resolution":{"observed_at":"2026-08-11T21:27:53.189596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.164957Z","title":"Vision-flan: Scaling human-labeled tasks in visual instruc- tion tuning, 2024","venue":null,"work_id":"e4e8e613-8158-473b-a5c7-6f2d6cf6f9ce","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.635275Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:acb6e91a83f881baf61a5f1da97be0cd24d0ef103ac800d70acb93f2506b5fa1","observation_id":"297f77cb-0bbb-4f14-a6e5-a1b75c730c1d","resolution":{"observed_at":"2026-08-11T21:27:53.170495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T21:27:52.641065Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.641065Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:6fafa80ee220b332d1b9c4552ae4c5bf190b7aad5c34376e8c977f303c9b8d29","observation_id":"92bde076-13c4-43fb-b283-aa4ef0b83d90","resolution":{"observed_at":"2026-08-11T21:27:52.641065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:27:53.142072Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"1b1d1880-5b4d-486f-99b2-aed502d2b8dc","year":2024},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.646737Z"},"links":{"citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:50c139a3fe653e01e4f9ef864dbd744eccd820b17a9e81e83591680679d0c4d8","observation_id":"f0b8e686-718e-4e5b-9b77-3f0029a142b7","resolution":{"observed_at":"2026-08-11T21:27:53.150271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T21:27:52.652519Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:27:52.652519Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.04424"},"observation_digest":"sha256:9f1b2d455766ac5df567b776fd2060b811c9f6a616abcf6445cea6988c138cc9","observation_id":"981cc79f-9a2d-4088-ab3c-0344007fd948","resolution":{"observed_at":"2026-08-11T21:27:52.652519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04424","last_updated":"2024-12-05T18:50:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:47:42.968857Z","submitted_at":"2024-12-05T18:50:39Z","title":"Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2412.04424."}