Pith. sign in

Paper Citation Record · LEDGER

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 5 inbound Pith citation observations for arXiv:2505.18915.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.18915 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:26:32.001165Z

measured 63 of 63 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-30T23:19:20.522732Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T13:25:45.159185Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc6be267-8891-49d7-bd21-dc0bf589cd58 · outbound

This paper cites Nlm at imageclef 2018 visual question answering in the medical domain.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Nlm at imageclef 2018 visual question answering in the medical domain

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.748683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:28.388076Z digest=sha256:ea1342931a84b5c190c282ac98e8d10952ccc9497232aac069978d50cbd8bd37

Observation 0c52f3e7-68af-4c8a-b4a1-adab30f8ff99 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.469475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.469475Z digest=sha256:fb836a3f9db5bb3bbcc2bb2250dac5c09800b85ca3f845e306c7ee4e49e0a5aa

Observation edb05bfd-7bb6-4375-a298-3f8b8331dc28 · outbound

This paper cites Differentiating renal neoplasms from simple cysts on contrast-enhanced ct on the basis of attenuation and homogeneity.American Journal of Roentgenology, 208(4):801–804, 2017.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Differentiating renal neoplasms from simple cysts on contrast-enhanced ct on the basis of attenuation and homogeneity.American Journal of Roentgenology, 208(4):801–804, 2017

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.602593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.602593Z digest=sha256:ea1be05cab6f9beb611f192655ab0085d542cb808eac953200de4860771f0141

Observation af66faa2-52a1-4c8b-b1d4-c3646f36cea2 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.700335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.700335Z digest=sha256:0c4410cf1174ca49eeb944097d6cfbbf36871587de8dfd0ffadd35c878e137c5

Observation 3ec56a87-766c-4818-9970-36a05edbb4d6 · outbound

This paper cites 2017 Robotic Instrument Segmentation Challenge.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering 2017 Robotic Instrument Segmentation Challenge

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.744200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.744200Z digest=sha256:23de81723dfc8d3708a8d06093fd356808f4ca535808a2e5098eed10942b012d

Observation e411385c-5704-4fab-97c6-2f09fb7e27e3 · outbound

This paper cites The medical segmentation decathlon.arXiv preprint arXiv:2106.05735, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering The medical segmentation decathlon.arXiv preprint arXiv:2106.05735, 2021

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.776512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.776512Z digest=sha256:62259f5c5ec455a92f47df237da6467b69d3c4425188dc2aafad609ac45f639a

Observation 80578d81-f810-4025-a65d-6a6b47436b5f · outbound

This paper cites M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.812740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.812740Z digest=sha256:e808ccda17e73ad4b94b9222c8e1dab8db3fbeb982eb2c79858bf42d49970b8d

Observation 0eb29bd9-9d0e-4568-ac77-26dee075d419 · outbound

This paper cites RadGPT: Constructing 3D Image-Text Tumor Datasets.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering RadGPT: Constructing 3D Image-Text Tumor Datasets

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.856361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.856361Z digest=sha256:cf92653552d675f7b3ec04baa687964eac8104c45615df223267adec9e2b4194

Observation aaacc22a-1480-43e9-9b79-4372d6068948 · outbound

This paper cites Overview of the vqa-med task at imageclef 2021: Visual question answering and generation in the medical domain.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Overview of the vqa-med task at imageclef 2021: Visual question answering and generation in the medical domain

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.913920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.913920Z digest=sha256:176cfb95690777a6db478ef57f86e0372c2919ebb1652c2eb5066f8ddd0f295f

Observation 113a939d-0fa2-4d5c-b577-1812e7e57bbe · outbound

This paper cites The Liver Tumor Segmentation Benchmark (LiTS).

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering The Liver Tumor Segmentation Benchmark (LiTS)

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.961837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.961837Z digest=sha256:f44cd5230c6458a61e33c8a04b4efc955a88aef29fc5e8361525c1786c96100a

Observation 61f7282a-0da5-4d09-89ca-36c467b3e2a7 · outbound

This paper cites Merlin: A vision language foundation model for 3d computed tomography.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Merlin: A vision language foundation model for 3d computed tomography

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.005527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.005527Z digest=sha256:f0fc6fcb32875a4497c4ecea602f8d3227f0cd398bb92cead242bce960c29faf

Observation b07faed2-51eb-4150-9ac0-b44dd4b36683 · outbound

This paper cites CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.045166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.045166Z digest=sha256:678fa9bcb9deb9cbe99c1f78bc89ee050b4d869dbc5a4341794e38d187353b98

Observation 765f338a-a54a-45ac-91e2-c25417ba3a37 · outbound

This paper cites Rsna 2023 abdominal trauma detection, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Rsna 2023 abdominal trauma detection, 2023

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.712079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.085121Z digest=sha256:a02c84ed0fa3ba154a61ba97c139c8eb34389dd716045c6b91a5fe511de26a68

Observation cc6fc416-4e9b-4df0-9c53-6c21dbc3a244 · outbound

This paper cites Preparing a collection of radiology examinations for distribution and retrieval.Journal of the American Medical Informatics Association, 23(2):304–310, 2016.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Preparing a collection of radiology examinations for distribution and retrieval.Journal of the American Medical Informatics Association, 23(2):304–310, 2016

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.699484Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.124161Z digest=sha256:ddcda2987a0729da72c93824a381ca864af59266b2f3101cfe38f0181f2dd09d

Observation ba305b8f-4104-47c6-953e-f31d89d93dd4 · outbound

This paper cites Computed tomography evaluation of pancreatic steatosis: correlation with covid-19 prognosis.Future Virology, 17(4): 231–237, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Computed tomography evaluation of pancreatic steatosis: correlation with covid-19 prognosis.Future Virology, 17(4): 231–237, 2022

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.168055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.168055Z digest=sha256:0e8e5a83fff9dec5997c98a1c0170d1125e22e056a1422c00bff09a590b0d1cd

Observation d09b29ed-c10f-45fa-83f5-710fb6b9b454 · outbound

This paper cites Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.224578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.224578Z digest=sha256:d0eda914d9fe8b6d624377e032f343e977405c2176eca658b96b4448d8d92617

Observation d31a0a41-b37c-4fda-910a-7a5c7dfb1ec0 · outbound

This paper cites Ct2rep: Automated radiology report generation for 3d medical imaging.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Ct2rep: Automated radiology report generation for 3d medical imaging

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.681205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.270738Z digest=sha256:8bd4dec8a3e870100ae474318eb21eea2ba90325e7d40275837a8530272dca33

Observation 6bdbe833-8aba-4d48-901a-1a7f94046efb · outbound

This paper cites Generatect: Text-conditional generation of 3d chest ct volumes.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Generatect: Text-conditional generation of 3d chest ct volumes

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.669326Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.311862Z digest=sha256:57a68ba923e627933912ce2c66f7b8cee53891b5ea388afad1a424ab0a43382a

Observation 90bbf954-a266-4eae-b1bc-311489b4ff4e · outbound

This paper cites an unresolved cited work.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:26:34.657950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.355155Z digest=sha256:807818136c6fd33231e021f6c49b2ce1c47196b892a575b6486e2b6c74f7e2f2

Observation dcd411c6-0f02-4b9d-a6c3-6f0361678ebc · outbound

This paper cites Vision-language models for medical report generation and visual question answering: A review.Frontiers in Artificial Intelligence, 7:1430984, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Vision-language models for medical report generation and visual question answering: A review.Frontiers in Artificial Intelligence, 7:1430984, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.644681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.407937Z digest=sha256:277ffca2b7739909f879533e0906e70d2409d7eb44d3b6f59b849d3aa93d94a9

Observation e7d92b58-0a8b-4ed2-8b5a-729d3a1d7757 · outbound

This paper cites Deep residual learning for image recognition.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Deep residual learning for image recognition

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.465676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.465676Z digest=sha256:63d5abd1b3edcb084e962bcda64495743614981605e46ae3b7b512f4d2ff338f

Observation 92f84a6d-27c0-43a6-8887-124bef03b0ee · outbound

This paper cites PathVQA: 30000+ Questions for Medical Visual Question Answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering PathVQA: 30000+ Questions for Medical Visual Question Answering

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.501168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.501168Z digest=sha256:f996c9958c93c273a848d4429565dd8464f52c8f50e63789ba7082651a659be5

Observation 2e9b9039-1fc2-47cc-972f-32c7a4edc4a6 · outbound

This paper cites An international challenge to use artificial intelligence to define the state-of-the-art in kidney and kidney tumor segmentation in ct imaging., 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering An international challenge to use artificial intelligence to define the state-of-the-art in kidney and kidney tumor segmentation in ct imaging., 2020

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.554989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.554989Z digest=sha256:b54bd9eff7e73b9b4b730b50e1685c349322eb88062f6fc3a0ea924d1992e5c9

Observation 53ff101f-a388-44da-84f8-62ce768fda3a · outbound

This paper cites Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.614352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.614352Z digest=sha256:b801ff8ca03b4fbdd4eb50035bf95d0f982aee4f613d6b7373d1ba816dca3b1e

Observation 691d7f5f-e63b-4a26-a7ea-22f967b4ebde · outbound

This paper cites nnu-net: a self-configuring method for deep learning-based biomedical image segmentation.Nature methods, 18(2):203–211, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering nnu-net: a self-configuring method for deep learning-based biomedical image segmentation.Nature methods, 18(2):203–211, 2021

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.680646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.680646Z digest=sha256:e55d8058f551e61610b17dfb98d03f4b9754d928e3720f9db09481d114f916de

Observation afde571d-f3c7-4889-bc0c-d5f3340cbc08 · outbound

This paper cites Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in Neural Information Processing Systems, 35:36722–36732, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in Neural Information Processing Systems, 35:36722–36732, 2022

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.606051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.738127Z digest=sha256:3fcc7f1f15b3b35944150fc117cf467426bd3eb542578db097c70977e5152233

Observation 601069b9-3391-4213-acc1-2967d5ddd4c3 · outbound

This paper cites Leading in the treatment of pancreatic cysts,.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Leading in the treatment of pancreatic cysts,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.592937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.795516Z digest=sha256:a444e5fab9f63421ced49c1210a99ab973957ce607da28a8f3aabec01da01e80

Observation 15ee332c-f6fc-40eb-9db3-fe51cb4144ce · outbound

This paper cites Clevr: A diagnostic dataset for compositional language and elementary visual reasoning.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Clevr: A diagnostic dataset for compositional language and elementary visual reasoning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.910148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.910148Z digest=sha256:4dbd23f775b9d149f54ab12a1efbdf8fa1fb5c33d60a14da041e7869055c65ed

Observation acdb2ad3-cad0-4db1-83e8-4ae226e5b1a6 · outbound

This paper cites Towards visual dialog for radiology.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards visual dialog for radiology

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.545591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.953620Z digest=sha256:ea5af473366ab521d3095c32bc107dfed57db34c0e1cfdb73634c9f85f5b1d35

Observation 008569ad-bfad-4009-9d04-d76f009f5d38 · outbound

This paper cites Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.004809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.004809Z digest=sha256:71c53db71398e5d91a83ad2e8f1d527a7192dff33df1cd3f9452ed4c777aa666

Observation 5a5d0f93-9c40-44d5-a487-5856826efdfe · outbound

This paper cites A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1): 1–10, 2018.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1): 1–10, 2018

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.043752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.043752Z digest=sha256:6b89daba113606d1967f9710221b992553a8c94eccda1e97aafdedb3a975cae4

Observation b541d444-9c2d-4a89-a986-e53bbe449c8c · outbound

This paper cites AutoRG-Brain: Grounded Report Generation for Brain MRI.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering AutoRG-Brain: Grounded Report Generation for Brain MRI

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.112916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.112916Z digest=sha256:ad7ebeda65b7b6bd54b17f3dab100785dc49aeb10a827144f10dbb670f415f37

Observation 62408c31-1707-4787-9210-5af91e47377b · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.151061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.151061Z digest=sha256:d87b7069b92858b267aa3b5ff1cdaaa400ecb55d5e6e5c376230305842c878bd

Observation 94ddbb18-1aeb-4fd8-8067-02f5120c84aa · outbound

This paper cites Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, 2023

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.254473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.254473Z digest=sha256:54cc1e4ba1fc8afdfd4a4fccc3b89092134149698693b2f47ef72af66c6f4345

Observation a2d6eb3d-2310-4c61-a436-70bb4ea7ba0a · outbound

This paper cites Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.287206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:30.345270Z digest=sha256:6e02784337f1b174be37332a18517d85490f1845f0a7387c3d18acd11eb7e52f

Observation 30fbadfe-e079-49e4-aee7-f458f25d62ff · outbound

This paper cites WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.423328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.423328Z digest=sha256:5e431ab9f95d6ed2caee2e670c7a9f03831c7a2281218ca061a586a3f51c3e6e

Observation 92c57a7b-da13-4f2d-a280-4888ad0727b6 · outbound

This paper cites Abdomenct-1k: Is abdominal organ segmentation a solved problem.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Abdomenct-1k: Is abdominal organ segmentation a solved problem.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.507559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.507559Z digest=sha256:9785ed453e8e7589aaa9778cc8e52cd4d1903704a19d842c1a7ab6fe4fb4ddd6

Observation f79bf655-6310-459e-aae0-eab5fb3d2848 · outbound

This paper cites Fast and low-gpu-memory abdomen ct organ segmentation: the flare challenge.Medical Image Analysis, 82:102616, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Fast and low-gpu-memory abdomen ct organ segmentation: the flare challenge.Medical Image Analysis, 82:102616, 2022

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.602450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.602450Z digest=sha256:7c1988ccfd3519b26649782383fb9e6661e4d6667e6c83f5cb8e3e1d9566884a

Observation fdd47cdc-1660-4e88-8a3e-3d3849fdccdb · outbound

This paper cites Umass at imageclef medical visual question answering (med-vqa) 2018 task.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Umass at imageclef medical visual question answering (med-vqa) 2018 task

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.020554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:30.715578Z digest=sha256:318532b33449a2fd2980158006e8b2eb39e202fadc08ae8b85bdc404331bcd20

Observation c4e5da05-f67e-4d0e-b078-ebccbb7b7cea · outbound

This paper cites Cgmvqa: A new classification and generative model for medical visual question answering.IEEE Access, 8:50626–50636, 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Cgmvqa: A new classification and generative model for medical visual question answering.IEEE Access, 8:50626–50636, 2020

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.706924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:30.799080Z digest=sha256:55a69f04110f3142bb3790f7f50f679d15d3a3ac9ad9957247fd7be02915a9e9

Observation ffff1fb0-9123-48a7-9e9e-afc8918c8337 · outbound

This paper cites Ct-org, a new dataset for multiple organ segmentation in computed tomography.Scientific Data, 7(1): 1–9, 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Ct-org, a new dataset for multiple organ segmentation in computed tomography.Scientific Data, 7(1): 1–9, 2020

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.868881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.868881Z digest=sha256:8199a6ec3bcdd4940975611ce5338f81391dec322fc6009b1991691454c4c03c

Observation 9197e8dd-11be-45c3-8d94-2c25b9ca2845 · outbound

This paper cites Deeporgan: Multi-level deep convolutional networks for automated pancreas segmentation.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Deeporgan: Multi-level deep convolutional networks for automated pancreas segmentation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.928770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.928770Z digest=sha256:fd4259a1c6dabfae5a662d8ec53aa9ddb32ea62b700cb4263cf3a0656c8a92aa

Observation 08e18473-05ef-4861-8c2a-edd92d67cefc · outbound

This paper cites Medfusenet: An attention-based multimodal deep learning model for visual question answering in the medical domain.Scientific Reports, 11(1):19826, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medfusenet: An attention-based multimodal deep learning model for visual question answering in the medical domain.Scientific Reports, 11(1):19826, 2021

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.461360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:31.000563Z digest=sha256:abd1109951c7cf727aedc6af29a59aaef5af7ff5b9100af4568cb9a6cbc0f503

Observation 7585b2fe-5db4-413d-8e2f-b2354c898973 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.082499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.082499Z digest=sha256:ee28396853ef1a192cd3243ff46c4e07a743277039b3215df8f33a8015df8004

Observation e80f558a-9643-45ce-8ceb-a2c7e8d3402f · outbound

This paper cites Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.160004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.160004Z digest=sha256:ea3af8afa66332b2374f2161649b2bbe56d3e5ddc60c9cfe2efd9b735da6cae3

Observation 25873790-5135-4ccd-aa5b-a5a8444dbf09 · outbound

This paper cites Multi-modal learning from unpaired images: Application to multi-organ segmentation in ct and mri.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Multi-modal learning from unpaired images: Application to multi-organ segmentation in ct and mri

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.220501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.220501Z digest=sha256:3da291cddd9c62b425f4d9b43829e5532a928504f10de9a27ce020283e3e0e19

Observation fcf9266d-530b-4fac-ac57-62963ff26cba · outbound

This paper cites Medclip: Contrastive learning from unpaired medical images and text.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medclip: Contrastive learning from unpaired medical images and text

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.295509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.295509Z digest=sha256:f12cc0197761608e1e08191dd7867077f157590cd52dd2bd3e75015f5a82a7bc

Observation a626d111-ef03-4117-ab45-325fbf44fb8e · outbound

This paper cites Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.365940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.365940Z digest=sha256:91450f342a9594901b1d09fb879d1ade999fba32627815cf68046ea9e587b1f8

Observation 7f89ea47-c3c3-4fbc-babb-00e1be278c83 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.413061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.413061Z digest=sha256:a9198d77d52c30c0ade409ce5e6d6f1d018ad338110cb8124a9d861ed0cbe361

Observation 10334b5d-af21-4006-8e38-1a3f6db636f3 · outbound

This paper cites Advancing Multimodal Medical Capabilities of Gemini.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Advancing Multimodal Medical Capabilities of Gemini

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.498560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.498560Z digest=sha256:9550f7f50c993bf3523f9e0f4498cb3d3a7b89f46a0d3e564d6bc4e66690c922

Observation 745d4205-4c81-4310-9f57-8c621470cb3f · outbound

This paper cites How big can it get? a comparative analysis of llms in architecture and scaling.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering How big can it get? a comparative analysis of llms in architecture and scaling

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.154597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:31.575915Z digest=sha256:6e4ac0d4ca722553d0057536aa842c60bee5d20e03c32d755e282627033938bd

Observation c2b2440d-8c21-411c-b09d-c7265b4fbe34 · outbound

This paper cites CoCa: Contrastive Captioners are Image-Text Foundation Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering CoCa: Contrastive Captioners are Image-Text Foundation Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.633408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.633408Z digest=sha256:2872e9103e7620161be481ea6a353f7930eb3120f994f3a08485f02870cd35ea

Observation 8c5870bb-5504-41de-a250-7709b73c39dd · outbound

This paper cites Computed tomography scans in the evaluation of fatty liver disease in a population based study: the multi-ethnic study of atherosclerosis.Academic radiology, 19(7):811–818, 2012.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Computed tomography scans in the evaluation of fatty liver disease in a population based study: the multi-ethnic study of atherosclerosis.Academic radiology, 19(7):811–818, 2012

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:32.916546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:31.704276Z digest=sha256:000ea51b75da3f91366a05b85ab7326456b849dddb4d3a0026ab31801ca0e978

Observation e134d42b-9c87-410e-b3b8-8fa00f650fad · outbound

This paper cites Vision-language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Vision-language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:32.589494Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:31.785891Z digest=sha256:a1f5e518a477648cd7de23a365669b2cdf82a8ee78d2587f4de1670d4dec1401

Observation 37f8d29f-fe4a-4fbc-b37d-118cb68bbf33 · outbound

This paper cites BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.862406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.862406Z digest=sha256:958dbda05ee1b5cbedbb81f2a500ab9215f2923a4b11cd69797039b909c97747

Observation aea7cef3-290e-4c37-b18f-01da180f82f5 · outbound

This paper cites PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.925242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.925242Z digest=sha256:a87748446322649b6488833b2c1f340b1f4c7e1cbf4ec449cf4f2f11c5abff02

Observation fb37f7de-b915-4ec8-a4c1-e829ff92d56a · outbound

This paper cites RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:32.001165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:32.001165Z digest=sha256:517568d9066ea62d6b41a5830e07c651026dbd484f00d96e089ff178d0e70995

Observation 78cea072-95cd-4cf0-82f1-060bd5a39ddb · outbound

This paper cites Accessed: 2025-05-05.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Accessed: 2025-05-05

Reference 2022

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.576213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:26:29.852152Z digest=sha256:f73dba6e1f24da9f0551afcc814c370708b4a373c4ad060838e887edacbf8093

Pith citing papers

Observation 69d1c6e1-372d-4f39-b296-3c78d768ec41 · inbound

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs cites this paper.

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:41:09.458561Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-08T14:49:53.357083Z digest=sha256:7d017e24dab1abf50be3480b36785c0f9baef48fccb77d0c0f13866be61f2d8a

Observation 549dd043-10f0-45a6-be53-1a43a5666fd7 · inbound

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models cites this paper.

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T07:56:27.084951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T01:31:41.805037Z digest=sha256:e3abb237505d06cd9dafbd484f0c8edb78803d635f2fe363652a669999ac5882

Observation 1cace8f1-f33e-4b8c-a533-efad72952be2 · inbound

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models cites this paper.

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T13:25:45.160672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-30T23:19:20.522732Z digest=sha256:eda11bf9afb8739d773c81c13178d6525611a3714a7852125e98e67e4ea3f7ca

Observation 1f59a6d0-bce4-46e1-8e0a-42129171ea1d · inbound

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology cites this paper.

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-12T03:56:21.638325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T03:55:55.359488Z digest=sha256:baf8df18ddaf74cc777d824904b4fe291d70f8f27ef99dfa11e7c9213b8057c3

Observation 2bd1ab3b-b992-4b6a-8366-dc7fbf587be7 · inbound

Beyond Masks: The Case for Medical Image Parsing cites this paper.

Beyond Masks: The Case for Medical Image Parsing Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:42:03.563431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-13T01:40:27.841002Z digest=sha256:506137b60b99bf29f50287ead0f5f636b5912961b80b04a273359e67dc7939b3