{"as_of":"2026-08-20T14:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ae5e284036c7db456133be2b8cda9aef5aa6e65abf652fa81b535f0de2122ba","coverage":[{"denominator":266,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:52:30.468025Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:40:37.231957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T09:04:04.549147Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18378","snapshot_observed_at":"2026-08-03T18:40:37.231957Z","title":"& Qin, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04238","last_updated":"2026-06-25T12:53:27Z","snapshot_observed_at":"2026-08-18T00:16:27.230564Z","submitted_at":"2025-12-03T20:10:22Z","title":"6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:37.231957Z"},"links":{"cited_paper":"/paper/2506.18378","citing_paper":"/paper/2512.04238"},"observation_digest":"sha256:70c32d22a7b170429bff3e51315c1149e697f51a4b55b2a7b3765321f2bd6c27","observation_id":"684bc499-dd20-4f97-b109-a8e3d89bad96","resolution":{"observed_at":"2026-08-03T18:40:37.231957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":"2506.18378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.18378 , year=","venue":null,"work_id":"e87e153d-f666-4b96-bd11-2b16c2db41f6","year":2025},"citing_paper":{"arxiv_id":"2605.15736","last_updated":"2026-05-15T08:45:57Z","snapshot_observed_at":"2026-08-17T20:03:38.278842Z","submitted_at":"2026-05-15T08:45:57Z","title":"BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T19:18:54.747828Z"},"links":{"cited_paper":"/paper/2506.18378","citing_paper":"/paper/2605.15736"},"observation_digest":"sha256:ed9d388978a4415b262295e009b110fc0e0a5b4a5966e01c53c50c4f31b7bfc5","observation_id":"a5e48800-f60e-45f3-9045-70035c70b634","resolution":{"observed_at":"2026-05-20T19:23:41.062018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":"2506.18378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.18378 , year=","venue":null,"work_id":"e87e153d-f666-4b96-bd11-2b16c2db41f6","year":2025},"citing_paper":{"arxiv_id":"2605.17140","last_updated":"2026-05-19T19:26:19Z","snapshot_observed_at":"2026-08-16T02:05:46.689273Z","submitted_at":"2026-05-16T20:10:19Z","title":"UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T14:54:59.212600Z"},"links":{"cited_paper":"/paper/2506.18378","citing_paper":"/paper/2605.17140"},"observation_digest":"sha256:448e3a412a5f772853df81fe1c3139389a18e7a81faa64ea5021d414baf37368","observation_id":"0fef9fef-aeee-4871-bc0e-36c54706a139","resolution":{"observed_at":"2026-05-20T14:58:24.710350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":"2506.18378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.18378 , year=","venue":null,"work_id":"e87e153d-f666-4b96-bd11-2b16c2db41f6","year":2025},"citing_paper":{"arxiv_id":"2605.17140","last_updated":"2026-05-19T19:26:19Z","snapshot_observed_at":"2026-08-16T02:05:46.689273Z","submitted_at":"2026-05-16T20:10:19Z","title":"UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-21T09:01:38.453097Z"},"links":{"cited_paper":"/paper/2506.18378","citing_paper":"/paper/2605.17140"},"observation_digest":"sha256:86d0b174657a30c011fd85e03afbfa243478fca7c015ab079dfe8f3c75f7f28a","observation_id":"ddaec0b3-66a5-4dd2-b8f1-3def0a8a11eb","resolution":{"observed_at":"2026-05-21T09:04:04.551098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18378","snapshot_observed_at":"2026-08-01T20:30:26.495092Z","title":"arXiv preprint arXiv:2506.18378 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16609","last_updated":"2026-07-18T03:08:31Z","snapshot_observed_at":"2026-08-15T18:58:46.822160Z","submitted_at":"2026-07-18T03:08:31Z","title":"Can Multimodal Large Language Models Understand OCT?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T20:30:26.495092Z"},"links":{"cited_paper":"/paper/2506.18378","citing_paper":"/paper/2607.16609"},"observation_digest":"sha256:a815691e272c05f9400e2f6f0b3ca8c0f675655cea4da9826bc65c4b94c03547","observation_id":"b72ae5c2-a160-42ad-91c7-0b38d5a9c4d9","resolution":{"observed_at":"2026-08-01T20:30:26.495092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18378/citation-record","integrity":"/paper/2506.18378/integrity","json":"/paper/2506.18378/citation-record.json","paper":"/paper/2506.18378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.107370Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.107370Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:4817ddbe9a7d27d745b3a748e30dd37b30b2cccdda6994b366be3605f64ca918","observation_id":"27e085b8-8e7b-4b70-9440-4447914572b9","resolution":{"observed_at":"2026-08-15T18:52:30.107370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.111504Z","title":"Litjens, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.111504Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:95f179d7bedf3dcb71cfb1190b49c46a81a15532c4dcd5130630c714be4907be","observation_id":"6186f53b-0054-41da-b15c-00869531a4b6","resolution":{"observed_at":"2026-08-15T18:52:30.111504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.115212Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.115212Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:191f224957610ddd32cc5ac95d1af96ad06dde86af4d6126e319d8f8b1613228","observation_id":"e5d4dfd4-f277-4b19-8606-c7394639364d","resolution":{"observed_at":"2026-08-15T18:52:30.115212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.119151Z","title":"Esteva, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.119151Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:8e9b481c1c6b36d8323fc774de0f5fd33ed06818d2b6030bf68b459a879a0577","observation_id":"53b440dd-4e1f-4c53-abff-35db2b468e99","resolution":{"observed_at":"2026-08-15T18:52:30.119151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.122766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.122766Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:7d398cd8cc6644d0eb8f588b2dbf00b2fb855a119a5891f0c1b7acbbae8ee773","observation_id":"bcfe5189-14d4-4175-a925-2b253528a64c","resolution":{"observed_at":"2026-08-15T18:52:30.122766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.126345Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.126345Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:475343ca945263acbffbebfcff6c3bad076141678191f14657cae6fda4329818","observation_id":"80ac61bb-4b70-4b6e-94c4-bc7fe08ed565","resolution":{"observed_at":"2026-08-15T18:52:30.126345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.129728Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.129728Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:dbd17ecb537147baad31c7fc9f679e4926022a856ba780efd2db3d11202a5a08","observation_id":"fc9fa082-2b9e-414c-8217-942834b66957","resolution":{"observed_at":"2026-08-15T18:52:30.129728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.132502Z","title":"P ´erez-R´ua, V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.132502Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:682364f9e7f9a0bafe1d67c67158a7b2e01211e1f99ab4b14f8e2022ce789377","observation_id":"4b4ac92a-cb27-4b94-b433-8129440f0625","resolution":{"observed_at":"2026-08-15T18:52:30.132502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.135501Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.135501Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:23cea159b915a4892db1666dea662ad29603f724420361cb382140836d2a7d94","observation_id":"b7369ad2-3de1-489f-baa3-d1c52acce589","resolution":{"observed_at":"2026-08-15T18:52:30.135501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.138373Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.138373Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:1659ff23f5ef1b40fd408d17c775d3e8d00790801954d48061576d52a9f6d0d1","observation_id":"e3556c05-2698-49e0-8dfe-8d23d619643c","resolution":{"observed_at":"2026-08-15T18:52:30.138373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-15T18:52:30.141146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.141146Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:f8a41e21d17c8811ca50dc2eb531e2175915820442183588acc8afd839f26f7b","observation_id":"e462fc29-c7c5-4224-814c-0699b47f3a8b","resolution":{"observed_at":"2026-08-15T18:52:30.141146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T18:52:30.144944Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.144944Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:2ad901469cb6b26df85daccc39bcff1ba3609bee4a8f17402dfbcc9b9ce92c2d","observation_id":"4fa947d6-147b-46ff-aec0-e2b63483efe7","resolution":{"observed_at":"2026-08-15T18:52:30.144944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.148342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.148342Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:71eb91a54579f28cfcf0902e83089643df42e5f4c0f6884a046c4c95990f195c","observation_id":"6a0bb67a-d066-4803-a05a-8f20c3aa7e48","resolution":{"observed_at":"2026-08-15T18:52:30.148342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.151561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.151561Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:edf2e96aa1e2eb49bb8989bcf9a60b51a359fbc9a80164257bd4055418b97af5","observation_id":"867d9eec-3f0b-4f97-9b22-64ef8031f107","resolution":{"observed_at":"2026-08-15T18:52:30.151561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.155191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.155191Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:f58c7af3e1bfa72cd22198012ded4cf480a70f7f0c9d4f604f0e5b395ec1a271","observation_id":"5a39abd3-52dc-4979-ae8d-160e40b27d17","resolution":{"observed_at":"2026-08-15T18:52:30.155191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.158704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.158704Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:517a41f3dd469709bcc064bd39187857064c6bd2cfff1d6a679fb3eb723a64d2","observation_id":"db667cc6-0fd5-4b96-a5f6-3fee4eb920a0","resolution":{"observed_at":"2026-08-15T18:52:30.158704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.162691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.162691Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:ea5cea454d104575bd92a7e251b94c2fc21e8300917db3e232db2d168f984014","observation_id":"06937bf5-b76b-49aa-8daf-c2a6f3b569ed","resolution":{"observed_at":"2026-08-15T18:52:30.162691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.166222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.166222Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:8f126a717dfa524207bf38bf9a1eaca43f6d34734d6911b5e2f6efb1da15f07a","observation_id":"30124fbc-0195-46dc-baeb-de6f92536e62","resolution":{"observed_at":"2026-08-15T18:52:30.166222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.169758Z","title":"Eslami, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.169758Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:27ac6d715dede5122bad0fc52392c8a8273e04e0608284f731593caa10ff7193","observation_id":"0e530efc-5153-47d8-9e4d-808966c7092c","resolution":{"observed_at":"2026-08-15T18:52:30.169758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10372","last_updated":"2024-12-13T18:59:40Z","snapshot_observed_at":"2026-08-13T21:19:28.765174Z","submitted_at":"2024-12-13T18:59:40Z","title":"UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10372","snapshot_observed_at":"2026-08-15T18:52:30.173348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.173348Z"},"links":{"cited_paper":"/paper/2412.10372","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:869dece7f23de3db04e4605f87f4121ddff0c28bf3aed88700fc09d3d56bff4d","observation_id":"1aba8173-5765-42ac-8758-09ad6dc58b44","resolution":{"observed_at":"2026-08-15T18:52:30.173348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.177007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.177007Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:44cc4ae8d4855c455acf91a9f1c19b28164889effb485048798c64a3aec32f99","observation_id":"3b4e71f8-2c0b-4275-88c4-c8acbb7672b4","resolution":{"observed_at":"2026-08-15T18:52:30.177007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.180964Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.180964Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:38ff9e4eeb9145367bdeb08313e87fd8b3ef3dcd4fd90a4d1a8616dc39373587","observation_id":"9be3d7cf-8853-4f17-82f5-79c5db6073fe","resolution":{"observed_at":"2026-08-15T18:52:30.180964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.185115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.185115Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:2a83680c30573f56cedb2e65c9bcc13181ec6c31967866ba638a43bf2523e28d","observation_id":"d3c363af-390a-48fa-8d17-88e9ce763a16","resolution":{"observed_at":"2026-08-15T18:52:30.185115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.189288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.189288Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:acdc268c1d336e22d519ff4c290e9e44376531f138c35892e4a79971feda43db","observation_id":"5811505a-db75-42cd-934c-c67facc198ad","resolution":{"observed_at":"2026-08-15T18:52:30.189288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13752","last_updated":"2023-11-23T00:57:35Z","snapshot_observed_at":"2026-08-19T19:03:24.908731Z","submitted_at":"2023-11-23T00:57:35Z","title":"3D-MIR: A Benchmark and Empirical Study on 3D Medical Image Retrieval in Radiology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13752","snapshot_observed_at":"2026-08-15T18:52:30.193579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.193579Z"},"links":{"cited_paper":"/paper/2311.13752","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:9e9a246a5b8e32902c35341fb5cc9a20d934bcdddb4b4da1f517123a0e72763e","observation_id":"5b589737-3382-4fb4-a511-06cc68672c98","resolution":{"observed_at":"2026-08-15T18:52:30.193579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.197496Z","title":"Zhong, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.197496Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:6313b868a049c29d3e7c5a43575a4120409a0717a68782cebd84e55a97bc5d46","observation_id":"a2a9700a-9680-4e7e-8e72-7ea837202d74","resolution":{"observed_at":"2026-08-15T18:52:30.197496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.200537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.200537Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:c33b7e5bb32e63f6e7717e4033757c04754874ff2510a233bafea778e2c1ff30","observation_id":"6caaf308-40b8-4e44-83f5-cc09b2f6188f","resolution":{"observed_at":"2026-08-15T18:52:30.200537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.203687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.203687Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:66fe2e29c0f85d20058b8888bc7f58eac1872a1cf94b0b98b860512c622be69d","observation_id":"da56425a-15ed-4931-9ccd-c3bfaf6e9255","resolution":{"observed_at":"2026-08-15T18:52:30.203687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.207205Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.207205Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:d65e1eb56dc9359b71827546af553a742752a47d6db314d7b2f92c91d51384ff","observation_id":"00a01e9d-0a96-47c5-a942-5dcca8f06540","resolution":{"observed_at":"2026-08-15T18:52:30.207205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.210640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.210640Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:b0a992cdb4d83bde2af3651031c0a2c789136cf2672c8be31e86f52a0e67ccf6","observation_id":"30254fa9-eb24-4abf-bf28-439a540068db","resolution":{"observed_at":"2026-08-15T18:52:30.210640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.214603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.214603Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:a83bbf99ebbc52d78906f6ebe744e5b9150e438648d1f3e3995530dfc3f4bdc0","observation_id":"fd890eaa-b2c4-4043-ba25-8b7cc7f1b1ef","resolution":{"observed_at":"2026-08-15T18:52:30.214603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.218026Z","title":"Ghosh, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.218026Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:b7c0f0d8d32a0e00e8300fd63aa4050a0029d51017adddd8b11ad5f80273f106","observation_id":"0e3e22fe-7dc4-4405-b02c-4f064f7043bd","resolution":{"observed_at":"2026-08-15T18:52:30.218026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.221596Z","title":"Ferber, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.221596Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:e38cb8cd1b6e3e558319ea41993d359df95bc64fcf7fba397188cce57beda43f","observation_id":"b5f327f2-8ee4-4ad8-a753-6fe07f43204f","resolution":{"observed_at":"2026-08-15T18:52:30.221596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.225107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.225107Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:a211bf670c7923ecf9cfa983c47549d2f608b75f4dba259797b872a4f23e2a13","observation_id":"7f9a8ad2-58e1-41f1-8c44-dc80b775459a","resolution":{"observed_at":"2026-08-15T18:52:30.225107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.228291Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.228291Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:b4cff70586f6390224c0e584638b3d0da14e656b8c8eca639dc8221fdefeb57e","observation_id":"34ec1467-48fb-40cf-b0b0-b05d7ab00287","resolution":{"observed_at":"2026-08-15T18:52:30.228291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.231743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.231743Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:9e4d1f14380b93c87ad26ee8222e02b6903ee746150d162b0a8f135a40fed189","observation_id":"831a1eba-39db-4cdf-9cd9-2547195f93bd","resolution":{"observed_at":"2026-08-15T18:52:30.231743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.235118Z","title":"Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.235118Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:6c13fce46a003f583d00688475d5162a4455265dc0165c41e12ec889332faeb0","observation_id":"fe4d38e5-35bd-4413-a751-a3dd2723d552","resolution":{"observed_at":"2026-08-15T18:52:30.235118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.238580Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.238580Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:9b9410114bb3bea08e42569b451d4eb35f940d2649633445074c4671e0240a58","observation_id":"558fb467-481e-4fbe-815e-280870e3aa0e","resolution":{"observed_at":"2026-08-15T18:52:30.238580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.242060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.242060Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:67682989f7ac848b32c7ab3c464953b39f32c021e64a5b91f1192c61f2f49b29","observation_id":"9c1ab6f6-7ced-4997-9253-2992063d1b0b","resolution":{"observed_at":"2026-08-15T18:52:30.242060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.245349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.245349Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:ec54d75bee09f7b4b1273593533a7a9ab51ab58725cd5ccd24f3ea0185af941c","observation_id":"c05efc0b-d365-431e-90df-6826872494ad","resolution":{"observed_at":"2026-08-15T18:52:30.245349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.248739Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.248739Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:1a1e5faebdb6324594864b3b0ba2b285e51949e61e740d5d77c96003c32edebf","observation_id":"cf38570b-6c93-486a-a492-19df4fc1b465","resolution":{"observed_at":"2026-08-15T18:52:30.248739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.253230Z","title":"Huang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.253230Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:a98a510b26af292fcab734ac0a51d50a7a8d3f93b5090898e51aa02efd8b0521","observation_id":"b76f8b88-b887-40fc-8af2-e2902a65492d","resolution":{"observed_at":"2026-08-15T18:52:30.253230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.257316Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.257316Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:befe1e21ca87723112318cb5be921ffe08f5038b24b5f15bb090c5364a4f5b52","observation_id":"f5603dee-6f27-4005-a1e6-27446631505e","resolution":{"observed_at":"2026-08-15T18:52:30.257316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.261765Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.261765Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:0bbbcf41b4832a91dd85e67e6e8ddc59aa072d4a15d172c0064f7e4c864a4531","observation_id":"d41d1e87-078d-4087-8358-e56387feec14","resolution":{"observed_at":"2026-08-15T18:52:30.261765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01529","last_updated":"2025-02-25T07:04:54Z","snapshot_observed_at":"2026-08-16T14:38:02.743567Z","submitted_at":"2023-12-03T23:03:22Z","title":"T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01529","snapshot_observed_at":"2026-08-15T18:52:30.265258Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.265258Z"},"links":{"cited_paper":"/paper/2312.01529","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:c60997a46c9f907d2fc5fe1befbc01e64dc8ef8b7b9008e76b4a89b216336913","observation_id":"883b1b0b-ac93-438f-bc61-a174c48fcf1d","resolution":{"observed_at":"2026-08-15T18:52:30.265258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.269542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.269542Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:d49f9d08450bea75f42e8cf2939e00eb2280e9e5e3e61c5c1c02826cac8782af","observation_id":"acb4f3d6-5db0-47de-a9aa-e1dcd8ef71b0","resolution":{"observed_at":"2026-08-15T18:52:30.269542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.273896Z","title":"Krai ˇsnikovi´c, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.273896Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:7914a8c3866e3388d776106e3d1640f39b0cd7cec90dbc37c6edcc19be0ae6f5","observation_id":"9429e788-7f54-4e07-a564-9880d4303bab","resolution":{"observed_at":"2026-08-15T18:52:30.273896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02716","last_updated":"2025-01-07T23:12:33Z","snapshot_observed_at":"2026-08-16T13:37:34.443145Z","submitted_at":"2024-07-02T23:48:43Z","title":"Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02716","snapshot_observed_at":"2026-08-15T18:52:30.277973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.277973Z"},"links":{"cited_paper":"/paper/2407.02716","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:01cea4a70a0a657d0c741d8ee7b96155d31e94cd0d03506b6b70e691653353c0","observation_id":"dbe7a04e-2216-425d-8b7f-dfffa65bdd07","resolution":{"observed_at":"2026-08-15T18:52:30.277973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.282266Z","title":"Sathish, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.282266Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:6f495b8475e0af647a904ba9c8644909a565a3ea9cb5a82e55bf5786a2784a4f","observation_id":"fc9b3c43-88fe-4e13-9cf0-118b77963156","resolution":{"observed_at":"2026-08-15T18:52:30.282266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.285777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.285777Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:ea25fbee5f29f2fd8f83bc821a980d8d4ef76113c769e7ab54b025f556a3796e","observation_id":"8e63051f-39cd-41d3-a529-f29ad600acda","resolution":{"observed_at":"2026-08-15T18:52:30.285777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.289193Z","title":"Hussein, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.289193Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:9dd55c8a3254a008683d9e84e15da53293e80ee183112888388b4b4818bbd6ad","observation_id":"2a9a7008-386f-4974-8563-0fe5d6894ad8","resolution":{"observed_at":"2026-08-15T18:52:30.289193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.292408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.292408Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:4d8dadd141fc0c046870e43cf423a8d016538a4effd06b10b22c476a594118b5","observation_id":"ea8ea48c-b43a-4c44-9f55-0bd67f1aca9a","resolution":{"observed_at":"2026-08-15T18:52:30.292408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15517","last_updated":"2023-02-07T16:11:42Z","snapshot_observed_at":"2026-08-16T16:27:48.988473Z","submitted_at":"2022-09-30T15:06:13Z","title":"Medical Image Understanding with Pretrained Vision Language Models: A Comprehensive Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15517","snapshot_observed_at":"2026-08-15T18:52:30.295860Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.295860Z"},"links":{"cited_paper":"/paper/2209.15517","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:6ae6f386d688c42e63e49fcea41f312b811b5dce49d5faa8951ecbd4f813ac43","observation_id":"ec3a9000-e283-47ad-a187-56487418e546","resolution":{"observed_at":"2026-08-15T18:52:30.295860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-15T18:52:30.299468Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.299468Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:f75afbe170c2881a0e0e966f4e0bafaec64aecab248fb1a26b3b9f0cabacfc43","observation_id":"06a31fb7-fa52-4aa0-91c7-be98b6ab0aae","resolution":{"observed_at":"2026-08-15T18:52:30.299468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-15T18:52:30.302754Z","title":"Nichol, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.302754Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:3a37ae29082a5cb5abf7c6e8f986d7bc5a77d3530248c785b53b671bd871d931","observation_id":"62560354-cd1b-4f62-ae8e-1462a69bb6cb","resolution":{"observed_at":"2026-08-15T18:52:30.302754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.306016Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.306016Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:2b49b679805e7c04b32afcb48f2d1543f1fa02ab3450aa0335415bc4b91f394e","observation_id":"94289c9b-a2fb-4ab0-9e50-37b5f8b4f139","resolution":{"observed_at":"2026-08-15T18:52:30.306016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.309420Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.309420Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:4b0c50d6b683ac3000f844c31df87b4b353e7b8a9c9fc36c39dcc46dac71efcf","observation_id":"f041a523-9078-4fb0-a2f9-96cf01b49a9b","resolution":{"observed_at":"2026-08-15T18:52:30.309420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.313014Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.313014Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:b4a6c50486337cb9a1e9d146e397caee3ca8e3210c2e97b49c26a5ef3c35803e","observation_id":"302f4581-3f26-4529-9b10-f8c147897d22","resolution":{"observed_at":"2026-08-15T18:52:30.313014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.316397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.316397Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:61ce0c127e9f2eadf7e35da7f2824119f93d0b64c198c323cd6f37d0b3b3d0df","observation_id":"68d5eb94-fa65-40d0-a5d4-b1d77ba43f94","resolution":{"observed_at":"2026-08-15T18:52:30.316397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-18T11:15:44.490559Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-15T18:52:30.319691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.319691Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:e7cab96eb1b71459f883311b692cd0bb8a8fb028c6c4a0b8384c556ee50dce17","observation_id":"aa734c77-4fd9-4c05-bd05-012138ac4f37","resolution":{"observed_at":"2026-08-15T18:52:30.319691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.323304Z","title":"Betker, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.323304Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:54bf00fc59192aaec2d658a5726c8639630d469b8a4eaeb7e08f05c6f7699703","observation_id":"df4485f8-96c7-4676-9376-794859f66e46","resolution":{"observed_at":"2026-08-15T18:52:30.323304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-15T18:52:30.326650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.326650Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:ffac5617dcc0fdc1e97373392b024acd8e7920257493bd8c08f3805e3d60a2af","observation_id":"fb1b66af-dede-4976-b7eb-055c6f862b7d","resolution":{"observed_at":"2026-08-15T18:52:30.326650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.330995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.330995Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:a131471cad4943ddbf0cb5381f41f5e55f2e05cce8def04390b9f5c5a6c8b3bb","observation_id":"e4095efc-0317-42da-a273-4dc67162fadf","resolution":{"observed_at":"2026-08-15T18:52:30.330995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T18:52:30.334589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.334589Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:a8cfdf60cd3d6f0572af51dd4fffc14b5d08407f1a6ca4aa573ab8a83860866a","observation_id":"c3708652-9b1e-4828-b493-cc5a1c8daed0","resolution":{"observed_at":"2026-08-15T18:52:30.334589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-15T18:52:30.338013Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.338013Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:caeea866fe2abf144783352b11f8af1abc43b72c0114bb97f8e090123723cdc9","observation_id":"7066fa4a-a695-4202-9ab6-4e2167339296","resolution":{"observed_at":"2026-08-15T18:52:30.338013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.341364Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.341364Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:82255ab587238ef37c4e93a1c2a4318e91e746492e013194f253fbf98a05dc65","observation_id":"90b6ed2d-93dd-4c16-be25-634f84212cee","resolution":{"observed_at":"2026-08-15T18:52:30.341364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17183","last_updated":"2025-07-18T10:57:30Z","snapshot_observed_at":"2026-08-19T21:27:34.554577Z","submitted_at":"2023-12-28T18:16:00Z","title":"Large-Vocabulary Segmentation for Medical Images with Text Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17183","snapshot_observed_at":"2026-08-15T18:52:30.344960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.344960Z"},"links":{"cited_paper":"/paper/2312.17183","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:589f5b3e5bec4b4816d2eb0bc9d1feb56aab798bf7e04767b6361e956c5ca1aa","observation_id":"ae023b97-142b-4509-98fa-255f7a86d999","resolution":{"observed_at":"2026-08-15T18:52:30.344960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.349108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.349108Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:407683ce654a73238d161ef151cc04514f41586195de2f4dd22615330cf9e305","observation_id":"6e37ef16-21cb-4be0-92a0-46bbc09a87f4","resolution":{"observed_at":"2026-08-15T18:52:30.349108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-16T14:25:27.106074Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-15T18:52:30.352368Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.352368Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:cef9219947a6b84416cd39eb0f6ff23afb3484df57349eef900f91d571343fa9","observation_id":"32513cdc-4303-46c6-8c3b-e6547a800465","resolution":{"observed_at":"2026-08-15T18:52:30.352368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.356529Z","title":"com/news/claude-3-haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.356529Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:227692eaf6d2fec6b71b2fb64bc13e0df739e4319de516798aa42a2a51fe47eb","observation_id":"512b1afd-2bd9-4f33-81ae-a9513bb5773b","resolution":{"observed_at":"2026-08-15T18:52:30.356529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T18:52:30.360763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.360763Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:5ff1e284092d427083f42f16874e2584a4b7c1fa4e8afbc43c59be217386a179","observation_id":"0f5bb209-d855-4ee4-a888-21184849004b","resolution":{"observed_at":"2026-08-15T18:52:30.360763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.364405Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.364405Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:c71792acd4373be953771fb881e06facf02e1dc9019e02bfbf5090109b861640","observation_id":"23e3a075-fca6-4640-a7b0-59fc24a0df3f","resolution":{"observed_at":"2026-08-15T18:52:30.364405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:52:30.368751Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.368751Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:3fd4fa7bca80f34c12a7c4dc9034884313be6125284443ef4143d05bac1b2c1c","observation_id":"3473cd69-81ec-4621-8c61-ee73dd999782","resolution":{"observed_at":"2026-08-15T18:52:30.368751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T18:52:30.371859Z","title":"Hurst, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.371859Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:6d4c8b944b81594b1311f3dc7e1d629a8454aae067ce1e95e9b9bd5a96c7cc58","observation_id":"d88e3368-424c-47e3-bc43-260df46db29a","resolution":{"observed_at":"2026-08-15T18:52:30.371859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T18:52:30.375514Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.375514Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:5ca8dbf3819f1bf2e4835b4239155f9d66e87f44998faa35298e83487d85b91a","observation_id":"206b5198-d4a5-4596-920c-a51419136458","resolution":{"observed_at":"2026-08-15T18:52:30.375514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-16T16:23:03.490700Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-15T18:52:30.378910Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.378910Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:ef96d74b1e2d0ab86f10046f4129af52aa105c111ff5d821327e11bd3e61a363","observation_id":"889a03bf-00f1-48da-bfe9-10a7bfc4df9e","resolution":{"observed_at":"2026-08-15T18:52:30.378910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-15T18:52:30.382519Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.382519Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:b7a90e8ee1786227a85b42a505c80a784da08d3947be9bae5bf77f28b61ef7c5","observation_id":"d7576ed0-547b-42d8-878d-a4461071da5c","resolution":{"observed_at":"2026-08-15T18:52:30.382519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.387011Z","title":"Bannur, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.387011Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:3f123120693f4a879d78c1125f05811f2c8d15b9c8a5e382e6b2081ac651c4cf","observation_id":"d63af463-ffec-4e9a-98e2-4ce67b6e5fa1","resolution":{"observed_at":"2026-08-15T18:52:30.387011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.391550Z","title":"Silva-Rodriguez, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.391550Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:11992e361128b137c4f21697897b0ba578fc16c60dadc7ef96c9fd4abef18f96","observation_id":"edd4d1a7-a99a-491b-86c6-ad7533d075af","resolution":{"observed_at":"2026-08-15T18:52:30.391550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.395682Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.395682Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:24fd13de0890ab6e81330430833d350fbf2e54ba89f289d89e726bd104317020","observation_id":"6980bc37-e39e-4d52-a887-2ba842ff76ea","resolution":{"observed_at":"2026-08-15T18:52:30.395682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.399643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.399643Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:e8b2056c020b548b39bbbc1c2e24b599763ebe2e84e8b18092f2dac30c3f2719","observation_id":"ce5a399c-e9fa-4103-8d84-8b44028dda2d","resolution":{"observed_at":"2026-08-15T18:52:30.399643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17956","last_updated":"2023-11-01T07:10:23Z","snapshot_observed_at":"2026-08-16T14:48:22.025365Z","submitted_at":"2023-10-27T08:05:21Z","title":"Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17956","snapshot_observed_at":"2026-08-15T18:52:30.403055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.403055Z"},"links":{"cited_paper":"/paper/2310.17956","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:54da8149dbe7a8f420ba0a375423b1aec083f960b4e3e45435a0246205cbc4a5","observation_id":"b7d92b2a-b8a6-4e2a-8e16-49c8a1a4f0e0","resolution":{"observed_at":"2026-08-15T18:52:30.403055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18421","last_updated":"2024-03-27T10:18:21Z","snapshot_observed_at":"2026-08-16T14:05:57.478013Z","submitted_at":"2024-03-27T10:18:21Z","title":"BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18421","snapshot_observed_at":"2026-08-15T18:52:30.406646Z","title":"Bolton, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.406646Z"},"links":{"cited_paper":"/paper/2403.18421","citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:550f20d917261286aaf63d1e2f07792440ed6d73c4d9b10d7eb1272ddd098b66","observation_id":"8ce500c0-af35-4342-a688-2010eeea290b","resolution":{"observed_at":"2026-08-15T18:52:30.406646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.410223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.410223Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:5b4ab72b729de755c4faba1cc81427fc05ede592542211e7c9616ab8bc92c1ba","observation_id":"44ef3c5e-07df-4cfc-8c87-e31cd94c3444","resolution":{"observed_at":"2026-08-15T18:52:30.410223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.413883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.413883Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:62e6d062ebc5a761127aeba664b45321577ac3578662cb59c94146051c3b1719","observation_id":"e10d19e9-ca79-4e1e-aba6-adc7051a0077","resolution":{"observed_at":"2026-08-15T18:52:30.413883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.417350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.417350Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:f494d3b299d5e796bda4ea2c99dd23e967fe9822ed7cdf40156cc8035ce6eb8e","observation_id":"d269330e-b85c-40ca-bf16-cd1811930f63","resolution":{"observed_at":"2026-08-15T18:52:30.417350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.421331Z","title":"van Sonsbeek, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.421331Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:83065d7f13a8a0de7060b00ceff46dcfa3f1ea03a5c8be43201a879287d175ff","observation_id":"2f389798-f40f-424c-939e-098bae789350","resolution":{"observed_at":"2026-08-15T18:52:30.421331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.424687Z","title":"Zheng, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.424687Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:4d5a70b2695d8b6f4d17cbcae7a87349dcf2f5b66a53740a84c4db88fc1bfa03","observation_id":"1a803b3b-7a69-4e56-abf1-b48f59124c29","resolution":{"observed_at":"2026-08-15T18:52:30.424687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.428102Z","title":"Chikontwe, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.428102Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:402408a374ecd250a3c59867f55ccf5f537090cc3f4418dec43c6948fa2fe5b6","observation_id":"f894d1ce-3c4a-4e53-a5a2-9398bb21f9a4","resolution":{"observed_at":"2026-08-15T18:52:30.428102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.431640Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.431640Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:3fd88196b379fc3951f715abf2fc751c1862b52267af13db448bad9fb772185d","observation_id":"0fc1fd9b-a51c-484a-9e6d-ebd6fd04b968","resolution":{"observed_at":"2026-08-15T18:52:30.431640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.435176Z","title":"Akrout, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.435176Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:9b94602d2b9eb4073fcdbc10a2eecf3b29f8207a2ae057a6cce045352ba99cca","observation_id":"1f3d4828-dfec-48b8-95b4-07c86f9f8c99","resolution":{"observed_at":"2026-08-15T18:52:30.435176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.438507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.438507Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:f2fbb83191e2118d1e0916502d6f7dc8a9525243b150e500784ec47b2f00e29e","observation_id":"674f67ab-5e08-40f2-96fd-eb096b80003f","resolution":{"observed_at":"2026-08-15T18:52:30.438507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.441891Z","title":"Tschandl, C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.441891Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:11785548e03878a78c31f5502b7b1690aaefea54365c3f7c9d5c59ff45041038","observation_id":"870cd843-0f13-4a7f-a654-30fa914e89c3","resolution":{"observed_at":"2026-08-15T18:52:30.441891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.445447Z","title":"Jiang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.445447Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:4093b54b282498f2c1fd0147741e40ecae1614bb601306d92f1241502e39361a","observation_id":"89080eea-e8d8-4eec-8c76-ef47761f96a2","resolution":{"observed_at":"2026-08-15T18:52:30.445447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.449108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.449108Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:039b94599fdcb350fb1b9f230e08659f34763c7421d39ad7fb05747918aa8f0b","observation_id":"424d8f9b-f0b1-413b-b13c-b536d1a75da6","resolution":{"observed_at":"2026-08-15T18:52:30.449108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.452473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.452473Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:332dd482503d07c07cea9a9e9ed536b508d71281944370b38def22f07b15c4a5","observation_id":"bbe5b12e-49ee-4820-bf23-8d8a1150b868","resolution":{"observed_at":"2026-08-15T18:52:30.452473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.456099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.456099Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:266147392472724ae9f9bbccdfe3b5d045a29ffbd24d90e038c5c451b88f9cac","observation_id":"b4775d18-ba3d-47b4-9325-0d07edf9487b","resolution":{"observed_at":"2026-08-15T18:52:30.456099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.460364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.460364Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:049cd3693fc632353c5ad4818834cef4ef125077f7ea1132144798e1282d6a19","observation_id":"7c327c56-d4ac-471a-82be-a0ab298fea8a","resolution":{"observed_at":"2026-08-15T18:52:30.460364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.464299Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.464299Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:31a1d562d043d7f7c7a14aae44a2ed114c31582227022d930cf9a7ad765e45d1","observation_id":"9277ab58-03a6-45f7-8b9f-60c078f6e552","resolution":{"observed_at":"2026-08-15T18:52:30.464299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:52:30.468025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T18:52:30.468025Z"},"links":{"citing_paper":"/paper/2506.18378"},"observation_digest":"sha256:d7ecf4a20cdd85dfa91052bb1c001f4b6251915b8e6a548abbe1f162044c7277","observation_id":"da8f2143-f4bc-4d50-a86f-594f9bee2e97","resolution":{"observed_at":"2026-08-15T18:52:30.468025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18378","last_updated":"2025-06-23T08:11:24Z","latest_version":1,"primary_category":"eess.IV","snapshot_observed_at":"2026-08-19T14:53:59.399502Z","submitted_at":"2025-06-23T08:11:24Z","title":"Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":266},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 266 outbound references and 5 inbound Pith citation observations for arXiv:2506.18378."}