{"as_of":"2026-08-18T01:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69b1547f49a696ed85faee90e6b1ab2f2ee5f9cf0d817d82ebcccc7454dad105","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:16:27.982410Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:52:07.139701Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:39:23.953906Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:3b28d9521790e8b35df606e445e7f13dd492e50fd513cc240ad70348664c486f","observation_id":"ad7a026c-852b-4e47-8001-2594a43bac8c","resolution":{"observed_at":"2026-05-10T13:23:58.182172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-08-10T20:10:05.454351Z","title":"GMAI-VL & GMAI-VL-5.5M: A large vision-language model and A comprehensive multimodal dataset towards gener al medical AI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09294","last_updated":"2025-01-16T05:01:30Z","snapshot_observed_at":"2026-08-16T07:37:36.735842Z","submitted_at":"2025-01-16T05:01:30Z","title":"Efficient Few-Shot Medical Image Analysis via Hierarchical Contrastive Vision-Language Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:05.454351Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2501.09294"},"observation_digest":"sha256:a8cff31e131e688aa129c2fc31d170da7c89da7228016a27121d5c30f5f39bdc","observation_id":"f0942baf-09d8-4fac-9bdc-b7bcfcf6d01c","resolution":{"observed_at":"2026-08-10T20:10:05.454351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-08-10T18:24:42.030232Z","title":"GMAI-VL & GMAI-VL-5.5 M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset To- wards General Medical AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-08-15T06:37:59.261620Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:24:42.030232Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2501.11347"},"observation_digest":"sha256:861603c565011a2718a315714a4986aa889290f16812957b254fd61749fa049e","observation_id":"6c2296e6-84bd-4304-8071-13b82696856b","resolution":{"observed_at":"2026-08-10T18:24:42.030232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-08-15T22:52:07.139701Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06152","last_updated":"2025-05-09T16:03:47Z","snapshot_observed_at":"2026-08-17T13:37:04.742751Z","submitted_at":"2025-05-09T16:03:47Z","title":"MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:52:07.139701Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2505.06152"},"observation_digest":"sha256:4e7d21cdf6fa985d3a77da15e37861864aeec5180f00dff3ae71e3903ee4ffd3","observation_id":"f3e95069-62e4-42b4-a2a1-85888ad466fa","resolution":{"observed_at":"2026-08-15T22:52:07.139701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-08-06T14:51:09.732041Z","title":"Gmai-vl & gmai-vl-5.5 m: A large vision-language model and a comprehensive multimodal dataset towards gen- eral medical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17539","last_updated":"2025-07-23T14:19:30Z","snapshot_observed_at":"2026-08-15T10:28:53.898287Z","submitted_at":"2025-07-23T14:19:30Z","title":"Constructing Ophthalmic MLLM for Positioning-diagnosis Collaboration Through Clinical Cognitive Chain Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:09.732041Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2507.17539"},"observation_digest":"sha256:5931d84a13bf0e3b6b5225de9b2a9d20f5f73d3e42afe1c7753898e4f6540208","observation_id":"8bacb87c-e481-4cec-ab32-258917010cad","resolution":{"observed_at":"2026-08-06T14:51:09.732041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-08-04T19:27:40.703899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09254","last_updated":"2025-09-11T08:39:08Z","snapshot_observed_at":"2026-08-16T17:44:52.264664Z","submitted_at":"2025-09-11T08:39:08Z","title":"Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:40.703899Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2509.09254"},"observation_digest":"sha256:8d0ef9011026361cb96a996aff07dd912482351fa00eefeb3841d6635ebe0253","observation_id":"ea982593-0a13-4fd5-bd2a-332eb7dacf9b","resolution":{"observed_at":"2026-08-04T19:27:40.703899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T14:02:54.395566Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:4f8b686e6065c2d1bfd0a72b1cfe08d727cae596ec4fd0cff95bb1da610d7eeb","observation_id":"caf1a38d-2a9a-425f-b46e-274e53eb0425","resolution":{"observed_at":"2026-05-12T08:41:25.823690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T00:50:15.010488Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:3a4f4464212cbe7cadb43dc7dcf65d61b57ae90f7d99456e583a2b506769a63e","observation_id":"e9db9ebb-da10-459d-b82c-70780d3ad8e9","resolution":{"observed_at":"2026-05-21T00:53:53.315397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-01T09:10:28.244690Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:332e3fecc328095406bc46f2c80d5ccd6ad66ce291d65b30fc06523cb3bba6f8","observation_id":"0c5f7290-e351-41db-ab89-abcf432d32c3","resolution":{"observed_at":"2026-07-01T09:15:44.022138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-04T01:35:11.966506Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:1092b47ffb6277bad3078539b7f7462b45a647467afc471a35b38d517031a74e","observation_id":"b74a0c42-9500-4b84-9145-94c246601ae6","resolution":{"observed_at":"2026-07-04T01:39:23.956373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"cited_work":{"arxiv_id":"2411.14522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14522","snapshot_observed_at":"2026-07-04T01:39:23.953906Z","title":"arXiv preprint arXiv:2411.14522 (2024)","venue":null,"work_id":"a04ad6d3-d645-47f4-a383-aac24633083d","year":2024},"citing_paper":{"arxiv_id":"2606.27500","last_updated":"2026-06-25T19:36:38Z","snapshot_observed_at":"2026-08-07T13:35:50.634455Z","submitted_at":"2026-06-25T19:36:38Z","title":"Aloe-Vision: Robust Vision-Language Models for Healthcare","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T02:02:47.472868Z"},"links":{"cited_paper":"/paper/2411.14522","citing_paper":"/paper/2606.27500"},"observation_digest":"sha256:2d9d6c7565fa6ae9bebf3178309eb88976e95b60258e0c6b7e9c9ce1fe9dc42f","observation_id":"09c3a83a-c961-4552-979d-203866364e18","resolution":{"observed_at":"2026-07-01T18:25:57.950271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14522/citation-record","integrity":"/paper/2411.14522/integrity","json":"/paper/2411.14522/citation-record.json","paper":"/paper/2411.14522"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:16:27.585908Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.585908Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:5dbd7a5e97a8f36ee2a8d5227ce8b4308c46f94b7b8567cf9c07dfc0998d544d","observation_id":"f0809c6c-e530-4956-bcdd-165374031977","resolution":{"observed_at":"2026-08-12T15:16:27.585908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.591221Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.591221Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:c944e1cdbf8a349efe4b2561554c222866831bc25f7a6096393611e0b66e48f8","observation_id":"bb68ff5b-f2c4-4c68-8a85-b779a8caedd9","resolution":{"observed_at":"2026-08-12T15:16:27.591221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.595870Z","title":"Home - Retina Image Bank, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.595870Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:8ed049d5b5ff6a62b4d3aa9db364e739ab94836e795b1bb3354c854eb7b3506e","observation_id":"ebd4e356-e6fd-4315-94c0-9df366c4fc05","resolution":{"observed_at":"2026-08-12T15:16:27.595870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-12T15:16:27.600653Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.600653Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:f9ee387d3db8d1baa380f88ce4b75132caee906bf30a9c63d5807d3b2d8fd737","observation_id":"939980e2-769d-4fab-bca9-f9733750eeb7","resolution":{"observed_at":"2026-08-12T15:16:27.600653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.605710Z","title":"Blossom orca v3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.605710Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:1f47615e9fad5122b86056567162d328d3657675437881ee129db16510ea183a","observation_id":"737d2341-da84-4bb5-a81c-6ec16d908136","resolution":{"observed_at":"2026-08-12T15:16:27.605710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T15:16:27.610430Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.610430Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:34cb8c342330652f0fea30b824ec1981d6cee231b26c236cf23411202f1b057f","observation_id":"3c358ec7-ce60-4f89-a2ff-f805515b47bd","resolution":{"observed_at":"2026-08-12T15:16:27.610430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18058","last_updated":"2024-11-02T11:08:49Z","snapshot_observed_at":"2026-08-16T14:06:07.278155Z","submitted_at":"2024-03-26T19:24:18Z","title":"COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18058","snapshot_observed_at":"2026-08-12T15:16:27.615383Z","title":"Coig-cqia: Quality is all you need for chinese instruction fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.615383Z"},"links":{"cited_paper":"/paper/2403.18058","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:45f9ebc18d181a5bead40cc814158a47b5f182279ff4a180d3d9aed5b5352b20","observation_id":"5ff89aa8-1982-4eac-a181-7e472d9800e5","resolution":{"observed_at":"2026-08-12T15:16:27.615383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.621116Z","title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.621116Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:8ef6cc052da2fb46ef3b1dfa0be10716f7c36027eea63c6bef253c0fc64d1600","observation_id":"7f1b43fe-ab6d-45a7-a574-e3609967799f","resolution":{"observed_at":"2026-08-12T15:16:27.621116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.626151Z","title":"Cosmopedia, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.626151Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:50021c49320038ef9e337596dd15c0b9c2b86e9c088fb990e87a7b802320824f","observation_id":"8dc39d1f-77dc-4245-8dae-722d79aca42e","resolution":{"observed_at":"2026-08-12T15:16:27.626151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.275782Z","title":"Leetcode dataset, 2023","venue":null,"work_id":"1f09d529-0981-47ed-8f02-e26ab42bc40c","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.631296Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:d48b69958869326454c076515588c4a674b34cb6b58b0057cbfcc4f199083bfa","observation_id":"7abd5be5-6e47-4733-8029-1b3ca22517b0","resolution":{"observed_at":"2026-08-12T15:16:29.280400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.259123Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text en- coding","venue":null,"work_id":"176eeb6a-6c4a-4602-aed2-fdca177d8228","year":2022},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.635487Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ebadac8958e993296dbc2ba138deec63d4f147974031a90903c5fcfdf4436944","observation_id":"0b54dee0-d328-40fe-8383-6bd19b4df47f","resolution":{"observed_at":"2026-08-12T15:16:29.264936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19538","last_updated":"2024-06-03T19:14:12Z","snapshot_observed_at":"2026-08-16T13:48:03.256128Z","submitted_at":"2024-05-29T21:48:56Z","title":"CheXpert Plus: Augmenting a Large Chest X-ray Dataset with Text Radiology Reports, Patient Demographics and Additional Image Formats","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19538","snapshot_observed_at":"2026-08-12T15:16:27.639887Z","title":"Chexpert plus: Hundreds of thousands of aligned radiology texts, im- ages and patients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.639887Z"},"links":{"cited_paper":"/paper/2405.19538","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:01a3f56cd91af5b884f595c91a0fddb29ea2fcc4223c355dce2cbf37fd5f120b","observation_id":"85d4dbcf-82ad-45f9-88e4-b9f37d25c8c8","resolution":{"observed_at":"2026-08-12T15:16:27.639887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-12T15:16:27.644551Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.644551Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:2e9ae2db028bdf8c2ba2593d130a3238e4e229acf1c9778b255f01d370c1a558","observation_id":"d842d6a9-bf21-4984-a324-0eb0a2b022ac","resolution":{"observed_at":"2026-08-12T15:16:27.644551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-16T13:39:01.243847Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-12T15:16:27.649840Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.649840Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:509d425e5a506d6c70637bdcb2c48dccc7a3fec17abf1f6d6faf51681280aa48","observation_id":"00198be9-9255-40dc-a781-d94e84bcdfb4","resolution":{"observed_at":"2026-08-12T15:16:27.649840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T15:16:27.654549Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.654549Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:facfaf93e7c28892f99005b95b2556acfcd19c9038efa6123fd9d5db1800467c","observation_id":"6452a82c-112c-497c-8344-a58c7e70e083","resolution":{"observed_at":"2026-08-12T15:16:27.654549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03361","last_updated":"2024-10-21T04:26:41Z","snapshot_observed_at":"2026-08-16T13:28:08.884972Z","submitted_at":"2024-08-06T17:59:21Z","title":"GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03361","snapshot_observed_at":"2026-08-12T15:16:27.659001Z","title":"Gmai-mmbench: A comprehensive mul- timodal evaluation benchmark towards general medical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.659001Z"},"links":{"cited_paper":"/paper/2408.03361","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:77291e11f445017e364330c126a9c8550167f57dfb043909affa1f54fa23a31f","observation_id":"9992be07-b41d-4250-8c0d-7bb53dc2a890","resolution":{"observed_at":"2026-08-12T15:16:27.659001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T15:16:27.663595Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.663595Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:fe0c3c3e2dbc71c73255528a275899af8a39f532896ee51b4fe872943ad9b221","observation_id":"67103c64-7a6c-4c77-a765-e4fa706aa943","resolution":{"observed_at":"2026-08-12T15:16:27.663595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T15:16:27.668566Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.668566Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ce439b189da64f45467c2f6998db30631a24cb26275542a591df01e07b30163e","observation_id":"d99355f5-d6e6-4409-a946-df250c1b60a2","resolution":{"observed_at":"2026-08-12T15:16:27.668566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.244384Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":"1d3fccb9-fabb-4ac2-997a-cf32113627a2","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.673094Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:e3f50a5fa033e24de73ecc8c17f27d3d1d3076dee2a0ed480a4979625f2a54a8","observation_id":"1dcfadc6-fc6b-452b-bc74-a8276bdc61db","resolution":{"observed_at":"2026-08-12T15:16:29.249357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.228964Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"7ff318a6-09ca-4bcd-8276-93c769c53b4e","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.677471Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:5c9745009fa4199444d218f9cb10d57e32cb67561c9f4a5d0ce7f7520019b58f","observation_id":"e77aa06e-8cda-4729-9e83-b4e5ea7a6843","resolution":{"observed_at":"2026-08-12T15:16:29.234179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.212499Z","title":"Preparing a collection of radiology examinations for distribution and re- trieval","venue":null,"work_id":"598f022b-efaa-4457-96f2-14a0d2d55742","year":2016},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.682661Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:8d525a7ad57ae79bb5668d79eda2837a272649ad17b5bf222b460da9c7d00922","observation_id":"ad70fd0b-a3f1-4d5b-9d30-30cc3d69bbca","resolution":{"observed_at":"2026-08-12T15:16:29.217940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.195741Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"72c91b6e-15f2-433c-b9db-6a9846c44b6a","year":2021},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.687092Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:dcd140aa047c9d589cf33931b5eb416a662c9211c183ed51bfd134bbea6fae5a","observation_id":"bc1e1e32-9ddb-49b9-9fdc-a15944844fbd","resolution":{"observed_at":"2026-08-12T15:16:29.200954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.179473Z","title":"Enhancing chat language models by scaling high- quality instructional conversations, 2023","venue":null,"work_id":"e89e23c0-9eab-461e-9422-bac236bcc7eb","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.691663Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6d9129e901c4defbf715fc8c21cd0534eec5c7d2dcf6573d5fadf6272c6f0d63","observation_id":"6acb6d61-6d11-4d9a-a197-33b0bf516e35","resolution":{"observed_at":"2026-08-12T15:16:29.184316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-12T15:16:27.695949Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.695949Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:d829db0ef6258b901b9b2519787c3fd113bbf882a6a80b0cca458637f7ca056b","observation_id":"3d36b248-f3b7-431d-9b55-156ba62e6399","resolution":{"observed_at":"2026-08-12T15:16:27.695949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T15:16:27.700784Z","title":"Palm- e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.700784Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:07344b08720db9d52a4541d27ba531e533a4432b9084d5a4bba3882182ab4d7b","observation_id":"9535ac0b-a992-421a-9ea8-04cfdbcbfd07","resolution":{"observed_at":"2026-08-12T15:16:27.700784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.163399Z","title":"Vlmevalkit: An open- source toolkit for evaluating large multi-modality models","venue":null,"work_id":"c7c76b1e-c06d-4c4d-a676-f03608799fc5","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.705216Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:3991e6cca15262d4cb53f49a273fb66e020edcd2f3ca53db54b2cccb01187dd6","observation_id":"948e59e8-2f08-439e-8009-5b0feccbab3e","resolution":{"observed_at":"2026-08-12T15:16:29.168528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.149120Z","title":"Lima: Less is more for alignment, 2023","venue":null,"work_id":"06727638-8ab9-41bd-b35d-427074bd89bf","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.710153Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6942f71160e3af7c2bf5bd99596ca0bf9180f8d1bfcd32de4ca59f129a992a42","observation_id":"8a090375-375b-410d-93ad-3a419b62b743","resolution":{"observed_at":"2026-08-12T15:16:29.153816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-12T15:16:27.714258Z","title":"Llama-adapter v2: Parameter-efficient vi- sual instruction model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.714258Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:48d699aafb7578a0afbeb70e230c7158bbb8e4cbe27fc5dd96b8eb13f3c7e36f","observation_id":"f82a13f6-f47a-4bd2-b682-ac2ec7b82f6f","resolution":{"observed_at":"2026-08-12T15:16:27.714258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15127","last_updated":"2024-11-04T15:54:21Z","snapshot_observed_at":"2026-08-16T13:58:29.301858Z","submitted_at":"2024-04-23T15:27:19Z","title":"GSCo: Towards Generalizable AI in Medicine via Generalist-Specialist Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15127","snapshot_observed_at":"2026-08-12T15:16:27.719300Z","title":"MedDr: Diagnosis-guided bootstrapping for large-scale medical vision-language learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.719300Z"},"links":{"cited_paper":"/paper/2404.15127","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ca9f10ebb7c3eec72bc19be3847c82ff84c787663c05f1c2cb1a7bbe1ff61e53","observation_id":"2eb5b23a-ea07-4bb6-9655-5760089ae459","resolution":{"observed_at":"2026-08-12T15:16:27.719300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-12T15:16:27.724943Z","title":"Pathvqa: 30000+ questions for medical visual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.724943Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:7ac61f1d570142714d5a0dc27deef0603a4ddec75227db2d5d330eabf2e733a0","observation_id":"d8bc2560-4eca-4777-828a-8138c7af8401","resolution":{"observed_at":"2026-08-12T15:16:27.724943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.133898Z","title":"Medical-diff-vqa: A large- scale medical dataset for difference visual question answer- ing on chest x-ray images, 2023","venue":null,"work_id":"1ce1dee1-2507-44a3-97ad-07a9f43c24c4","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.729955Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:adb92f8a6e76bf00ec4477bb2a5ea3622159f29fc6b4057d8f4d3d5ddcc13c5e","observation_id":"d05aa105-d6ff-4b0d-b562-f2a77d7db6d7","resolution":{"observed_at":"2026-08-12T15:16:29.139048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.118244Z","title":"Omnimedvqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":"12ab0264-80d1-46f0-9685-2c1bdedc1460","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.735065Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:5bd54b2eadf011338db14142749dddb41dfd6fcf0d5ae67d3d64ac9284f5e948","observation_id":"ba74ef87-2fdb-4792-879b-d01e3d2f952d","resolution":{"observed_at":"2026-08-12T15:16:29.123637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.739731Z","title":"Quilt-1m: One million image-text pairs for histopathology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.739731Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:b3ac1a290e4306dfa26b07f40eb60b392546825cd339fae4fd830dc66c674e9e","observation_id":"ff3c5f8b-8fd7-4e65-9ae8-75f7947ad433","resolution":{"observed_at":"2026-08-12T15:16:27.739731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.094198Z","title":"Quilt-1m: One million image-text pairs for histopathology","venue":null,"work_id":"a566ad66-83b4-4583-bba8-b7b40e8b344d","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.744344Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:df4bcdf7cb12907799d7cc599a428fd0b683ef264619b488e6ebe2b7e296b678","observation_id":"f30d8a76-7125-4b8e-ada2-812d6923897e","resolution":{"observed_at":"2026-08-12T15:16:29.098556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.078562Z","title":"Mimic-cxr, a de- identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"c51e00c3-9415-4abd-a6b0-f272d9199626","year":2019},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.748724Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:b106cca23b57b31dc715d35afb115b6af5616d33cd531ae1db9811f5084baaab","observation_id":"ace6742a-394a-42b2-bfdb-b3ea4158bf6e","resolution":{"observed_at":"2026-08-12T15:16:29.083428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.753361Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.753361Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ba80fa473fd6479e297e0f3069e101b1d2e8b4265aa28d9ecfea30b9830cc396","observation_id":"846fe4a7-c08e-457f-b314-e69ff2ca614c","resolution":{"observed_at":"2026-08-12T15:16:27.753361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.758298Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.758298Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a2e30b54bd6afdacad7d21f4b2a740ee3c17f6f734f535733c74c55061a4a927","observation_id":"a9550fcf-9ead-481f-afd1-ec4c9bd02839","resolution":{"observed_at":"2026-08-12T15:16:27.758298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.045415Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"83e01a7a-f957-4f4e-8d93-99dc7db0a019","year":2022},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.762995Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:faf831cc379259db54b1be19e430c64b1e07b2a5080c37fe3d20aba2611bb7d2","observation_id":"422491cf-ac34-4dec-a00f-76c566fb2159","resolution":{"observed_at":"2026-08-12T15:16:29.050300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.029996Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":"b84c328d-0804-4e8f-bf28-2d54048475ce","year":2018},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.767451Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:74f9a084675fe5a5e58364ee5c0579e9ae7607b80ebfbf66d73e5109c06a17fe","observation_id":"084ee0bd-36b7-4457-ac56-28d29ee3c24d","resolution":{"observed_at":"2026-08-12T15:16:29.034671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:29.014601Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day","venue":null,"work_id":"b27626dd-d775-42b4-aa9d-37f5497aba63","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.771951Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:7badad4e6a78a516236dc76d0558678c9b9bca3488ba8cd359c6934405882b60","observation_id":"2ae0acb5-eee4-4e2c-a796-97a2c323fb55","resolution":{"observed_at":"2026-08-12T15:16:29.020269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.775959Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.775959Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:aa927cc87d8524ec639384e6844ff5c60b4a8e05ebcd76b62c472931dc389e2f","observation_id":"66cb7b1c-534e-4578-ae99-22a6b0fec26b","resolution":{"observed_at":"2026-08-12T15:16:27.775959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.780679Z","title":"Seeing and understanding: Bridging vision with chemical knowledge via chemvlm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.780679Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:f8e55a07dd19cdaae195200836bcbf1d18f347f6759759843027cc16d16d41aa","observation_id":"f0ead3e3-c8a0-4351-92a9-c8ec737d7e05","resolution":{"observed_at":"2026-08-12T15:16:27.780679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.990439Z","title":"Pmc-clip: Con- trastive language-image pre-training using biomedical docu- ments","venue":null,"work_id":"15e2e95a-3881-4afd-94aa-b91f8569ec0d","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.786209Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:61c666793605c44c9cc521426ac98a5a9feef85b4be17a46b5765650412de160","observation_id":"7dd5f11b-00a0-4169-8a00-84f9a18958a0","resolution":{"observed_at":"2026-08-12T15:16:28.995216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.975266Z","title":"Slake: A semantically-labeled knowledge- enhanced dataset for medical visual question answering","venue":null,"work_id":"475342f2-c8f0-4970-a87c-8971ee39c8c5","year":2021},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.790508Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ffe3a618f7692f2133aa56ddf7315a7eb6c1614ed99eb96bd97cb27bd39e623f","observation_id":"614c8785-f960-42cf-a6f7-d6223ac5951b","resolution":{"observed_at":"2026-08-12T15:16:28.980089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.960436Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"61f66a34-5954-449a-92f8-ee5f1cd883f2","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.795480Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:09e7bc217ecdffa295fc0d388ae54473cc76fda9c5e24570cb79b4289bb61a41","observation_id":"c8bc8183-cf94-451e-9376-1e6c221afa9f","resolution":{"observed_at":"2026-08-12T15:16:28.965005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.800062Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.800062Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a9e7348eacd604aa4e63cf01e7366d9cb3fe6ae69af01d90b12d89ceb070eaf8","observation_id":"c280c82f-eb05-476b-951e-368da4b01900","resolution":{"observed_at":"2026-08-12T15:16:27.800062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-12T15:16:27.804972Z","title":"Logiqa: A challenge dataset for ma- chine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.804972Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a8e8aacc38e6764774c9707375651fa122376bb802760e02f27e3bb771b2a132","observation_id":"bb30a723-cae1-4d6e-af03-8c5af8a9c59c","resolution":{"observed_at":"2026-08-12T15:16:27.804972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17956","last_updated":"2023-11-01T07:10:23Z","snapshot_observed_at":"2026-08-16T14:48:22.025365Z","submitted_at":"2023-10-27T08:05:21Z","title":"Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17956","snapshot_observed_at":"2026-08-12T15:16:27.809953Z","title":"Qilin-med-vl: Towards chinese large vision-language model for general healthcare.arXiv preprint arXiv:2310.17956, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.809953Z"},"links":{"cited_paper":"/paper/2310.17956","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:ea77775c4f4d69144d66cfb8eb423248e5b5243942da1aa437cba6b1817a8911","observation_id":"a9067b3d-23bc-4783-85ae-ad813262062f","resolution":{"observed_at":"2026-08-12T15:16:27.809953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T15:16:27.814735Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.814735Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6d2fb2a1b01697eb327baae5738fd50639e7d38ab8fca3b41a40011773f35f87","observation_id":"d5db7375-b621-4c75-ad9e-f5eec85839a8","resolution":{"observed_at":"2026-08-12T15:16:27.814735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-12T15:16:27.819817Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.819817Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:1dd17088a3ef36ad25c398a2c02253e6d7ea572f9d2ae4a132b10a829655a1f1","observation_id":"01181550-8cd0-4fb9-9e27-495406497941","resolution":{"observed_at":"2026-08-12T15:16:27.819817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.935471Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"6d858b68-478f-4ec4-9b02-24d123b54143","year":2021},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.824469Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:20e591cf3a1e82b51d8101c3293183e70adff6b9901dd5ab8d415364303bd8aa","observation_id":"0494fc53-150b-42ec-85e3-4b4ae42c5b68","resolution":{"observed_at":"2026-08-12T15:16:28.940226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.919386Z","title":"Orca-math: Unlocking the potential of slms in grade school math, 2024","venue":null,"work_id":"3b109704-98d2-4daa-835e-9e09c239bfcf","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.828628Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:8740b488978f6381a97b0db8947755209dc492c7eff6cdcf8aacfd91cbae2d64","observation_id":"cc0f8001-9fab-47d0-af8a-0862f495cf19","resolution":{"observed_at":"2026-08-12T15:16:28.924769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.903491Z","title":"Med-flamingo: a multimodal medical few-shot learner","venue":null,"work_id":"56bab0e4-cec5-4233-b209-8345a65540c2","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.832932Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:338dbf7f9b1abbb9a7c45d9a12062d78fe3dbb7f82743e30755857a9a951341c","observation_id":"00368572-52cc-40f1-8a26-fa8e34513d9f","resolution":{"observed_at":"2026-08-12T15:16:28.908155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.837170Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.837170Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:d4f8fda7896754775e14b0b89e4d9c01abb2422fc661ae10eaebed5ea2ba7992","observation_id":"bc8763a9-3187-47bd-a685-f42c07709cc5","resolution":{"observed_at":"2026-08-12T15:16:27.837170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T15:16:27.841408Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.841408Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:b258a7289101bcc58e208d7d505473f6e284b1240039fa804505499a5b564f0f","observation_id":"01d7b33c-d69c-41b7-aa1f-5eef4d7074ad","resolution":{"observed_at":"2026-08-12T15:16:27.841408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.877336Z","title":"Seco de Herrera, et al","venue":null,"work_id":"f804de0f-9922-4e1a-8fda-f77ad4e61990","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.845726Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:d670cc8ab9f8c8b98b7461e0781c47830e4387726b4babaece4e6a2de154e4e1","observation_id":"b819e4e5-efab-4e82-b283-9c263b4af9c7","resolution":{"observed_at":"2026-08-12T15:16:28.881963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18416","snapshot_observed_at":"2026-08-12T15:16:27.850285Z","title":"Capabilities of gem- ini models in medicine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.850285Z"},"links":{"cited_paper":"/paper/2404.18416","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:dc7f919ef6762486961de81a9c3fb7cc258502020b85794ce6ca9cc72c6a3ddb","observation_id":"bac7800f-9f96-41eb-ba65-82294ed302ee","resolution":{"observed_at":"2026-08-12T15:16:27.850285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.860971Z","title":"Large language models encode clinical knowledge","venue":null,"work_id":"73099768-5c9d-400f-8e7b-7a1eaf9c57ba","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.855141Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a681d1cc3e899158ed88363790f710ec86cdef4b49aa15d23ce09b19d25336a7","observation_id":"bb1443b6-b347-4b3d-be41-72aae5223b28","resolution":{"observed_at":"2026-08-12T15:16:28.865635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06000","last_updated":"2020-10-12T19:56:08Z","snapshot_observed_at":"2026-08-16T19:14:02.445101Z","submitted_at":"2020-10-12T19:56:08Z","title":"MedICaT: A Dataset of Medical Images, Captions, and Textual References","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06000","snapshot_observed_at":"2026-08-12T15:16:27.859906Z","title":"Medicat: A dataset of medical images, captions, and textual references","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.859906Z"},"links":{"cited_paper":"/paper/2010.06000","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:fd71364c83f39c37f2b433c79a396d597fcbb1900a1c21ac8b9d90168ff25505","observation_id":"1b0907b5-9f76-4b44-b231-bc57dcbc8375","resolution":{"observed_at":"2026-08-12T15:16:27.859906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.844740Z","title":"Hashimoto","venue":null,"work_id":"e9fd6518-3b16-406c-a81d-78302ae4eb71","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.864071Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:8d14056bf56d54cc7ca2d9dee404aad6101ce392ddd54bef774b824656bf856d","observation_id":"adfe8103-d840-4aa2-b589-e46d6b6d813b","resolution":{"observed_at":"2026-08-12T15:16:28.850185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T15:16:27.869235Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.869235Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:5adfeb6699dcb37d275c3264ba37f9ac64fedf786b442747013f8c7e7fe50a43","observation_id":"8bc57a48-baaf-4bbc-a4f5-019338a9bb5d","resolution":{"observed_at":"2026-08-12T15:16:27.869235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.829430Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":"9fc3c9dd-4b35-447a-9cd3-06d15be6b06f","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.874061Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:51e9c5a7aa9b4c617795f339bfa050374e50deec180005b2873d489de3098cd8","observation_id":"4c1ded91-8ed5-40c9-886a-ab80b647eba1","resolution":{"observed_at":"2026-08-12T15:16:28.834619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.814831Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":"3c847512-3954-4354-9b73-19255378e240","year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.878676Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:432f19c06b345320be727dc34c43dceeb2d407d75c255c79b743f92902fb1dc1","observation_id":"012f75d3-df3f-428e-bc0f-65b3b58fbe29","resolution":{"observed_at":"2026-08-12T15:16:28.819417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T15:16:27.883868Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.883868Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a470aab40bf2fb2ea2e95afb37800787cbce79442e1cb2e065ca199727e80fc7","observation_id":"2d717345-e6c4-4d7c-b475-1959ea84eb6b","resolution":{"observed_at":"2026-08-12T15:16:27.883868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T15:16:27.888474Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.888474Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:4b92ff6cbdb18df9868bcd789af4b5546c9b53a05703818c19d21bc522d03792","observation_id":"975b2ba1-b3bd-432c-902f-2bd51c9a0077","resolution":{"observed_at":"2026-08-12T15:16:27.888474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.893658Z","title":"Towards gen- eralist biomedical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.893658Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6f9417887fc30bcdb85e5760b20e126a810e054ebe3fecefcd6c9f62cd66dca7","observation_id":"91903ecb-3c1c-4234-917f-356fd40d1a59","resolution":{"observed_at":"2026-08-12T15:16:27.893658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14454","last_updated":"2023-08-25T14:08:38Z","snapshot_observed_at":"2026-08-16T15:37:09.057272Z","submitted_at":"2023-04-27T18:29:05Z","title":"PMC-LLaMA: Towards Building Open-source Language Models for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14454","snapshot_observed_at":"2026-08-12T15:16:27.898170Z","title":"Pmc-llama: Further finetuning llama on medical papers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.898170Z"},"links":{"cited_paper":"/paper/2304.14454","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:b2ba0a5a4283a8fd9ad8b504a136d08c8272b6a56d1723d7a4a78ffa063edf54","observation_id":"9223ef79-fa0b-47a8-abdf-f2919e1588e2","resolution":{"observed_at":"2026-08-12T15:16:27.898170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-16T15:10:43.905696Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-12T15:16:27.903306Z","title":"Towards generalist foundation model for radiol- ogy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.903306Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:2f25d0894cafa32ebbfcb65c54f4ec690ad59c76c2c28a0ff03a6b4adf6ffd1e","observation_id":"fcb4f0f9-ac6e-44f9-afbb-d8f71ccee68e","resolution":{"observed_at":"2026-08-12T15:16:27.903306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02900","last_updated":"2025-07-10T08:33:52Z","snapshot_observed_at":"2026-08-16T13:28:19.033963Z","submitted_at":"2024-08-06T02:09:35Z","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02900","snapshot_observed_at":"2026-08-12T15:16:27.908322Z","title":"Medtrinity-25m: A large-scale multimodal dataset with multigranular annotations for medicine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.908322Z"},"links":{"cited_paper":"/paper/2408.02900","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:39feb3c129e8c10213947cbff0664e3e38e7b1ebdaaeb0e39e4d727d75f15043","observation_id":"95d0985f-facc-4500-99cf-a5463af0032f","resolution":{"observed_at":"2026-08-12T15:16:27.908322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T15:16:27.913904Z","title":"LLaV A-UHD: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.913904Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:e27e98b18a842e6f4eeabe83f62d57920dbeb68f39f4f5fa2dc864f0a36fe13b","observation_id":"e2fd5e40-6ffa-47b7-a945-2e14b621c775","resolution":{"observed_at":"2026-08-12T15:16:27.913904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.788433Z","title":"Firefly( 流 萤): 中 文 对 话 式 大 语 言 模 型","venue":null,"work_id":"3a4ded60-f2cc-428a-86e7-d79758bfab1d","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.918585Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:c6078eeb342c263faadef03d13f3dd047ba491e22a08d1d25473991dabc4e0c2","observation_id":"9bea8762-ce0a-467e-8158-f1c2cf4504c6","resolution":{"observed_at":"2026-08-12T15:16:28.793733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11969","last_updated":"2023-11-20T17:59:03Z","snapshot_observed_at":"2026-08-16T16:32:09.624925Z","submitted_at":"2023-11-20T17:59:03Z","title":"SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11969","snapshot_observed_at":"2026-08-12T15:16:27.923422Z","title":"Sa-med2d-20m dataset: Segment any- thing in 2d medical imaging with 20 million masks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.923422Z"},"links":{"cited_paper":"/paper/2311.11969","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a59de37ee1a79150379e1ccac77b50f6ba5b0b2071fe05231457211894efc2d2","observation_id":"53169a36-9c93-4476-a02a-e31960efaaa1","resolution":{"observed_at":"2026-08-12T15:16:27.923422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-17T11:19:59.774979Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-12T15:16:27.928118Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.928118Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:99fb29d8aeb6fd617ebdcbea20cc2f9305839fde78a49f53a62d1662bd986636","observation_id":"589337fe-1275-4edb-a5c6-ff4f47647968","resolution":{"observed_at":"2026-08-12T15:16:27.928118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-12T15:16:27.932740Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.932740Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a5a0c05e0575d962bdc49ba91406f747c6eeb8472378a59985110b2172fb84ab","observation_id":"0b35edca-080d-4e12-890b-22ac3a091234","resolution":{"observed_at":"2026-08-12T15:16:27.932740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.772426Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"6079d4dc-2022-42ef-b227-b2fa6739278f","year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.937065Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6f785f863371217b2d36042826705817a8cef0e25eb2aa162fb7ddbf66859e1d","observation_id":"61836b9d-123c-4ef2-931e-d527a78ede2d","resolution":{"observed_at":"2026-08-12T15:16:28.777508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:27.941299Z","title":"A generalist vision–language foundation model for diverse biomedical tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.941299Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:0e00cf68490e8680a315b1910654951ba9d1bcd847f34bbd7049a8d60fd0efa1","observation_id":"e910100c-211f-4468-b854-0a80a34ee52c","resolution":{"observed_at":"2026-08-12T15:16:27.941299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-12T15:16:27.945529Z","title":"Pmc-vqa: Vi- sual instruction tuning for medical visual question answer- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.945529Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:13fe58094627bc443b862563fcada9879d88ac18ec79eb52c8ba574eb48445cf","observation_id":"f476cd61-7b25-46f1-b91d-13dc0b7abaee","resolution":{"observed_at":"2026-08-12T15:16:27.945529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T15:16:27.949842Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.949842Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:260ef2eb664d12729e73496a3657665ddaf138f76a78f4191aaa5f4f3532347a","observation_id":"f34ccd04-4706-454a-9b63-2557f7b4aa6e","resolution":{"observed_at":"2026-08-12T15:16:27.949842Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.747405Z","title":"The first step involves an initial quality screening using a multimodal large language model (such as GPT-4o) to automatically assess the quality of the pairs","venue":null,"work_id":"7b408396-8a51-4f15-ba37-732329805b45","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.954491Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:6f0041671b17465c9733b96aa136706f9761e4b12b7de46bfe0531125728627e","observation_id":"10508207-032f-4067-b8ca-c9d628aa9eaa","resolution":{"observed_at":"2026-08-12T15:16:28.752077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.731020Z","title":null,"venue":null,"work_id":"1dfb0bbb-80ec-4bbf-aa3b-8e2bf8eaefea","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.959150Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:579926f9964483ff41ebce2b881ce81be8fa1c9f3adbb787775f45fc1f9b7922","observation_id":"b2f6f970-88dc-4bb1-bcf7-ace042973598","resolution":{"observed_at":"2026-08-12T15:16:28.736140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.714385Z","title":"If the average score of the 30 image-text pairs from a dataset is less than or equal to 3 (on a scale of 1 to 5), the dataset is classified as having satisfactory quality","venue":null,"work_id":"4b75e5a4-dfbd-428d-b17f-6cf305c658b9","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.964286Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:d511a052e4b3c406d4ebde78bbe6e777ea059771b887fc79738d5e3f8d2c3e70","observation_id":"2e368cbb-8672-4b61-b8c3-b3217dec7ca5","resolution":{"observed_at":"2026-08-12T15:16:28.719427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.696976Z","title":"- Assess whether there are any medical errors or misleading information that could impact diagnostic or treatment deci- sions","venue":null,"work_id":"8f17ea07-0041-4975-ac61-d797d231501e","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.969048Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:a3fd4dfd34512c65cec47ab93cc5594f5f0ecf77c2658785e9d3f12b58030c40","observation_id":"03b51d9b-25f2-4485-aa2b-6889a99144c2","resolution":{"observed_at":"2026-08-12T15:16:28.702577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.680214Z","title":"- Assess whether the language is fluent and natural, and if there are any overly complex sentence structures that might hinder information transmission","venue":null,"work_id":"bfdd0bd2-abdb-40f5-96c8-211b9b52647e","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.973479Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:c1b28df36ca4dd43ad85a65d11edbd1ea2e6b6fccf77281d11e1478602b49a90","observation_id":"09d4e0a6-fd43-4e39-b16f-f4adbfef6216","resolution":{"observed_at":"2026-08-12T15:16:28.685519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.665053Z","title":"- Assess whether any essential information is missing, omitted, or incomplete","venue":null,"work_id":"0dea0666-4f9e-45fc-a6c9-c5dd51fc6b6e","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.977961Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:c7707c52de3facb8378590a69b6a8723479feb5728b2d6662b2a798b297940dc","observation_id":"0de715af-47ef-4c43-9858-5ec3f5452e93","resolution":{"observed_at":"2026-08-12T15:16:28.669622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:16:28.648217Z","title":"- Ensure that the imaging data is appropriately interpreted, the descriptions are clear and accurate, and they align with the medical diagnosis","venue":null,"work_id":"b537688b-5a37-4626-9deb-36659a3accdb","year":null},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.982410Z"},"links":{"citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:7f11dd05ab46731b3ba0319b43219fdad9a9e6f2ac92de7324f6e079b06dc222","observation_id":"3f55f2e7-f557-4a4f-a3b8-076e01b899ed","resolution":{"observed_at":"2026-08-12T15:16:28.654564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 11 inbound Pith citation observations for arXiv:2411.14522."}