Pith. sign in

Paper Citation Record · LEDGER

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

As of 21 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 5 inbound Pith citation observations for arXiv:2505.18915.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.18915 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:26:32.001165Z

measured 63 of 63 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-30T23:19:20.522732Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T13:25:45.159185Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc6be267-8891-49d7-bd21-dc0bf589cd58 · outbound

This paper cites Nlm at imageclef 2018 visual question answering in the medical domain.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Nlm at imageclef 2018 visual question answering in the medical domain

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.748683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:28.388076Z digest=sha256:a81297c1ca30772b19d0ba8211047164fd4f3d56be3237e17598a700d0bd9c14

Observation 0c52f3e7-68af-4c8a-b4a1-adab30f8ff99 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.469475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.469475Z digest=sha256:9e1d79e7f2c3efd682f3293756e66c6994a5783f22e0888d68fb14d3c00c2bfa

Observation edb05bfd-7bb6-4375-a298-3f8b8331dc28 · outbound

This paper cites Differentiating renal neoplasms from simple cysts on contrast-enhanced ct on the basis of attenuation and homogeneity.American Journal of Roentgenology, 208(4):801–804, 2017.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Differentiating renal neoplasms from simple cysts on contrast-enhanced ct on the basis of attenuation and homogeneity.American Journal of Roentgenology, 208(4):801–804, 2017

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.602593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.602593Z digest=sha256:871e27f07b7762bae74d4e2909361f6eed2572e496055141754b1af829af74c8

Observation af66faa2-52a1-4c8b-b1d4-c3646f36cea2 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.700335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.700335Z digest=sha256:b7f832d337565340f6e301ae1289da3601665b6349ae1fbcfa29f5d2d077f65c

Observation 3ec56a87-766c-4818-9970-36a05edbb4d6 · outbound

This paper cites 2017 Robotic Instrument Segmentation Challenge.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering 2017 Robotic Instrument Segmentation Challenge

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.744200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.744200Z digest=sha256:2da18ae65e2e3001b6d5d25527976436ffb1a7887d2a24e073978a32510266dd

Observation e411385c-5704-4fab-97c6-2f09fb7e27e3 · outbound

This paper cites The medical segmentation decathlon.arXiv preprint arXiv:2106.05735, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering The medical segmentation decathlon.arXiv preprint arXiv:2106.05735, 2021

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.776512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.776512Z digest=sha256:a9127510857420da3ef373323b58996c1f7cc06882d8221b436ce7fa734bdd51

Observation 80578d81-f810-4025-a65d-6a6b47436b5f · outbound

This paper cites M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.812740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.812740Z digest=sha256:0cd392a00aae01316c4b44714ebfda44636f00a0762cca6397caf8576723c963

Observation 0eb29bd9-9d0e-4568-ac77-26dee075d419 · outbound

This paper cites RadGPT: Constructing 3D Image-Text Tumor Datasets.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering RadGPT: Constructing 3D Image-Text Tumor Datasets

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.856361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.856361Z digest=sha256:5295adb8290b29957791e01e64b6092112cc50d61251030f8f8355e4d838ca9e

Observation aaacc22a-1480-43e9-9b79-4372d6068948 · outbound

This paper cites Overview of the vqa-med task at imageclef 2021: Visual question answering and generation in the medical domain.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Overview of the vqa-med task at imageclef 2021: Visual question answering and generation in the medical domain

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.913920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.913920Z digest=sha256:cae0fa8a15eb532962baa262e01e18b8f6f51f958e79ef76ab964d9dcc36a0d7

Observation 113a939d-0fa2-4d5c-b577-1812e7e57bbe · outbound

This paper cites The Liver Tumor Segmentation Benchmark (LiTS).

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering The Liver Tumor Segmentation Benchmark (LiTS)

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:28.961837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:28.961837Z digest=sha256:36a2d04ddb81b99e1612a9f2b14ffbc1981840f2a69394f16be46979f23eb3ac

Observation 61f7282a-0da5-4d09-89ca-36c467b3e2a7 · outbound

This paper cites Merlin: A vision language foundation model for 3d computed tomography.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Merlin: A vision language foundation model for 3d computed tomography

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.005527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.005527Z digest=sha256:4bf855f95be4eeed7f88a1c0851d1c80f3dec8b690b7dfad54907452723e2f4a

Observation b07faed2-51eb-4150-9ac0-b44dd4b36683 · outbound

This paper cites CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.045166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.045166Z digest=sha256:5f89ce9f81dd3bc19e66be48abb780e2995dc197f6da143d4e3d67284af667f0

Observation 765f338a-a54a-45ac-91e2-c25417ba3a37 · outbound

This paper cites Rsna 2023 abdominal trauma detection, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Rsna 2023 abdominal trauma detection, 2023

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.712079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.085121Z digest=sha256:2cdec10da7f39e2fb768b903a7d633ed88580450c41af0eb05035656a1a296da

Observation cc6fc416-4e9b-4df0-9c53-6c21dbc3a244 · outbound

This paper cites Preparing a collection of radiology examinations for distribution and retrieval.Journal of the American Medical Informatics Association, 23(2):304–310, 2016.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Preparing a collection of radiology examinations for distribution and retrieval.Journal of the American Medical Informatics Association, 23(2):304–310, 2016

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.699484Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.124161Z digest=sha256:4da87ec80b2338a9003d0db13fedaf4b51214337c5b6d52da86860eee3a73734

Observation ba305b8f-4104-47c6-953e-f31d89d93dd4 · outbound

This paper cites Computed tomography evaluation of pancreatic steatosis: correlation with covid-19 prognosis.Future Virology, 17(4): 231–237, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Computed tomography evaluation of pancreatic steatosis: correlation with covid-19 prognosis.Future Virology, 17(4): 231–237, 2022

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.168055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.168055Z digest=sha256:db86a0eaa8802ffc1110f29a06b84c77df6269b021def69ba701310cf235fc18

Observation d09b29ed-c10f-45fa-83f5-710fb6b9b454 · outbound

This paper cites Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.224578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.224578Z digest=sha256:4c1664c3b56c2518d4ffeb6dcaa4e15dfa5269aca022e0a492d08b32c30fa49f

Observation d31a0a41-b37c-4fda-910a-7a5c7dfb1ec0 · outbound

This paper cites Ct2rep: Automated radiology report generation for 3d medical imaging.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Ct2rep: Automated radiology report generation for 3d medical imaging

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.681205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.270738Z digest=sha256:c8e1d10168a263d59c1805e17038efa67a5d16fcefe85d022b6a65eaa79631bf

Observation 6bdbe833-8aba-4d48-901a-1a7f94046efb · outbound

This paper cites Generatect: Text-conditional generation of 3d chest ct volumes.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Generatect: Text-conditional generation of 3d chest ct volumes

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.669326Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.311862Z digest=sha256:042d398ccf7ede6ba7b6d4a648a3c10821fcfc0c5e59ae04f0c3658e99d2b333

Observation 90bbf954-a266-4eae-b1bc-311489b4ff4e · outbound

This paper cites an unresolved cited work.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:26:34.657950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.355155Z digest=sha256:a28cff75e4a26a8d28912607a97834474c882da8486936f919a178b1faa450af

Observation dcd411c6-0f02-4b9d-a6c3-6f0361678ebc · outbound

This paper cites Vision-language models for medical report generation and visual question answering: A review.Frontiers in Artificial Intelligence, 7:1430984, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Vision-language models for medical report generation and visual question answering: A review.Frontiers in Artificial Intelligence, 7:1430984, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.644681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.407937Z digest=sha256:c5e7451254706d07cd5611d77e121bae6050d240e9e9c344f719274a5d5f8c0e

Observation e7d92b58-0a8b-4ed2-8b5a-729d3a1d7757 · outbound

This paper cites Deep residual learning for image recognition.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Deep residual learning for image recognition

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.465676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.465676Z digest=sha256:c6ad509f5a8f9f9cc78d86d6f27ac3201a945c3cc3c1e8c6bfd3652525322c22

Observation 92f84a6d-27c0-43a6-8887-124bef03b0ee · outbound

This paper cites PathVQA: 30000+ Questions for Medical Visual Question Answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering PathVQA: 30000+ Questions for Medical Visual Question Answering

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.501168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.501168Z digest=sha256:49409f290d87fccc3fbde341184b3291779d676e2a142717989fa704e59f7f68

Observation 2e9b9039-1fc2-47cc-972f-32c7a4edc4a6 · outbound

This paper cites An international challenge to use artificial intelligence to define the state-of-the-art in kidney and kidney tumor segmentation in ct imaging., 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering An international challenge to use artificial intelligence to define the state-of-the-art in kidney and kidney tumor segmentation in ct imaging., 2020

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.554989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.554989Z digest=sha256:50cf11409bd2d5f006411aeeb4ef990893ca92652088ad267908b576c5c568e4

Observation 53ff101f-a388-44da-84f8-62ce768fda3a · outbound

This paper cites Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.614352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.614352Z digest=sha256:b37e1972874c3175beaccb00071f670858b5ca34939cf4df8f65ab2520c5facc

Observation 691d7f5f-e63b-4a26-a7ea-22f967b4ebde · outbound

This paper cites nnu-net: a self-configuring method for deep learning-based biomedical image segmentation.Nature methods, 18(2):203–211, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering nnu-net: a self-configuring method for deep learning-based biomedical image segmentation.Nature methods, 18(2):203–211, 2021

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.680646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.680646Z digest=sha256:27d1de7bf86106004efd0c6f30326ee5a524fe994f63b6d43b95781069c3104a

Observation afde571d-f3c7-4889-bc0c-d5f3340cbc08 · outbound

This paper cites Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in Neural Information Processing Systems, 35:36722–36732, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in Neural Information Processing Systems, 35:36722–36732, 2022

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.606051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.738127Z digest=sha256:f1956053c390c244b3f4e3f44e1ca766ea1bfe5319616c956e7bc091e82c8345

Observation 601069b9-3391-4213-acc1-2967d5ddd4c3 · outbound

This paper cites Leading in the treatment of pancreatic cysts,.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Leading in the treatment of pancreatic cysts,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.592937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.795516Z digest=sha256:b955b33fbeaa8a90eda15af44bcdf0893bac37b25206b5c0663843a0aa26bccd

Observation 15ee332c-f6fc-40eb-9db3-fe51cb4144ce · outbound

This paper cites Clevr: A diagnostic dataset for compositional language and elementary visual reasoning.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Clevr: A diagnostic dataset for compositional language and elementary visual reasoning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:29.910148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:29.910148Z digest=sha256:5f2411e1700a40366a67216eadd9dab4fa07ab4ddd654f97582f3da34375e577

Observation acdb2ad3-cad0-4db1-83e8-4ae226e5b1a6 · outbound

This paper cites Towards visual dialog for radiology.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards visual dialog for radiology

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.545591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.953620Z digest=sha256:5014caf27a028bc7235d8f12e71d59f508fdc3e0a1b7d763399a81235ac2a4af

Observation 008569ad-bfad-4009-9d04-d76f009f5d38 · outbound

This paper cites Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.004809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.004809Z digest=sha256:f229a5e6dffe74899833eb727f66a5627a92d9cb1b47f54a42771865a04b293b

Observation 5a5d0f93-9c40-44d5-a487-5856826efdfe · outbound

This paper cites A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1): 1–10, 2018.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1): 1–10, 2018

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.043752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.043752Z digest=sha256:9cc8c6dccc5de5d0c5a9f09ba75bf1d8c3d0d274c7131c054d01f494a6fb2584

Observation b541d444-9c2d-4a89-a986-e53bbe449c8c · outbound

This paper cites AutoRG-Brain: Grounded Report Generation for Brain MRI.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering AutoRG-Brain: Grounded Report Generation for Brain MRI

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.112916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.112916Z digest=sha256:aa1dab2bd223bc13b1d905e9ffff25320bd6df2eec25c8a2a8b7f9dbfe28c30d

Observation 62408c31-1707-4787-9210-5af91e47377b · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.151061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.151061Z digest=sha256:f04c12f83586e3a995e280cf3d7615bade66b88046b3ea615e5a73a3f2eee86d

Observation 94ddbb18-1aeb-4fd8-8067-02f5120c84aa · outbound

This paper cites Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, 2023.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, 2023

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.254473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.254473Z digest=sha256:2762845a2f4db06238075082f83d7c342817ebfcc3d1e96f23bc4b7b9015b2ca

Observation a2d6eb3d-2310-4c61-a436-70bb4ea7ba0a · outbound

This paper cites Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.287206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:30.345270Z digest=sha256:21fb06c4c65a41818c523de72f70dcd925f18597b9b7e87568b9bdd3ff443c4f

Observation 30fbadfe-e079-49e4-aee7-f458f25d62ff · outbound

This paper cites WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.423328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.423328Z digest=sha256:2f3cc6da4c0695314a6af889c839324f281826358c4005c3ee3396511e654960

Observation 92c57a7b-da13-4f2d-a280-4888ad0727b6 · outbound

This paper cites Abdomenct-1k: Is abdominal organ segmentation a solved problem.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Abdomenct-1k: Is abdominal organ segmentation a solved problem.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.507559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.507559Z digest=sha256:6c259166109801aa81d8bcf0c623df93ac39248319bd3ca48657f803a501c694

Observation f79bf655-6310-459e-aae0-eab5fb3d2848 · outbound

This paper cites Fast and low-gpu-memory abdomen ct organ segmentation: the flare challenge.Medical Image Analysis, 82:102616, 2022.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Fast and low-gpu-memory abdomen ct organ segmentation: the flare challenge.Medical Image Analysis, 82:102616, 2022

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.602450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.602450Z digest=sha256:cca83e7b5a4e337db6fc2a613459518734c64286a40ebed95918b100d7c1181a

Observation fdd47cdc-1660-4e88-8a3e-3d3849fdccdb · outbound

This paper cites Umass at imageclef medical visual question answering (med-vqa) 2018 task.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Umass at imageclef medical visual question answering (med-vqa) 2018 task

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.020554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:30.715578Z digest=sha256:bb35da628b038c8e42dbd5b506ce1217fb06b6c13dd7f89d180bbb037c0ba0d2

Observation c4e5da05-f67e-4d0e-b078-ebccbb7b7cea · outbound

This paper cites Cgmvqa: A new classification and generative model for medical visual question answering.IEEE Access, 8:50626–50636, 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Cgmvqa: A new classification and generative model for medical visual question answering.IEEE Access, 8:50626–50636, 2020

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.706924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:30.799080Z digest=sha256:a0c6d089222ee14b2a915d8db2e03fe8ce6336b9c059bcc73a413e46caa66146

Observation ffff1fb0-9123-48a7-9e9e-afc8918c8337 · outbound

This paper cites Ct-org, a new dataset for multiple organ segmentation in computed tomography.Scientific Data, 7(1): 1–9, 2020.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Ct-org, a new dataset for multiple organ segmentation in computed tomography.Scientific Data, 7(1): 1–9, 2020

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.868881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.868881Z digest=sha256:2446a4a9f6832c03a91c135019740bca4e69ce511744711f31d1851a4f85987b

Observation 9197e8dd-11be-45c3-8d94-2c25b9ca2845 · outbound

This paper cites Deeporgan: Multi-level deep convolutional networks for automated pancreas segmentation.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Deeporgan: Multi-level deep convolutional networks for automated pancreas segmentation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:30.928770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:30.928770Z digest=sha256:e37955cbac6ad1d9502a1c1208353ef10d93a3e14da539bae063110065244f3f

Observation 08e18473-05ef-4861-8c2a-edd92d67cefc · outbound

This paper cites Medfusenet: An attention-based multimodal deep learning model for visual question answering in the medical domain.Scientific Reports, 11(1):19826, 2021.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medfusenet: An attention-based multimodal deep learning model for visual question answering in the medical domain.Scientific Reports, 11(1):19826, 2021

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.461360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:31.000563Z digest=sha256:60ce5f0cad89c6a82cfc3d44e42d67d831ec20371b502a2886807c9da29e6179

Observation 7585b2fe-5db4-413d-8e2f-b2354c898973 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.082499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.082499Z digest=sha256:4ff21d9c8f9dfb38a691baf6a734d9a0187aeb979fab691b51b930965e95767d

Observation e80f558a-9643-45ce-8ceb-a2c7e8d3402f · outbound

This paper cites Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.160004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.160004Z digest=sha256:75dc917731d9aeff1a008e3c480b0a7be3090e9f730739b6c47343911e542044

Observation 25873790-5135-4ccd-aa5b-a5a8444dbf09 · outbound

This paper cites Multi-modal learning from unpaired images: Application to multi-organ segmentation in ct and mri.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Multi-modal learning from unpaired images: Application to multi-organ segmentation in ct and mri

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.220501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.220501Z digest=sha256:3aa3a3060d9d93ca61fef3cf0119bcfe12cda936e4f746a0c8d2cb58a28b8de3

Observation fcf9266d-530b-4fac-ac57-62963ff26cba · outbound

This paper cites Medclip: Contrastive learning from unpaired medical images and text.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Medclip: Contrastive learning from unpaired medical images and text

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.295509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.295509Z digest=sha256:7a902d96e47decb7dd25d2491ae0398b67ae5fb619ff49d257232209d0f6c21c

Observation a626d111-ef03-4117-ab45-325fbf44fb8e · outbound

This paper cites Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.365940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.365940Z digest=sha256:5147642857fec78b84764b927069e5dcef78f1edbe5ca42df9f79d818a145cb8

Observation 7f89ea47-c3c3-4fbc-babb-00e1be278c83 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.413061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.413061Z digest=sha256:3a48dc63f6b240fdcb7ec6a7d92b482c931e738ca0b3f4cc15420a5bdc82ce1e

Observation 10334b5d-af21-4006-8e38-1a3f6db636f3 · outbound

This paper cites Advancing Multimodal Medical Capabilities of Gemini.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Advancing Multimodal Medical Capabilities of Gemini

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.498560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.498560Z digest=sha256:361491f0f2ae205d5e86ad6e9c1ed4069ef074753a857d6f1371eef92660683e

Observation 745d4205-4c81-4310-9f57-8c621470cb3f · outbound

This paper cites How big can it get? a comparative analysis of llms in architecture and scaling.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering How big can it get? a comparative analysis of llms in architecture and scaling

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:33.154597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:31.575915Z digest=sha256:44365aeb6a3144c56b640e6d2364f1b8840f56b302289a240b1f37f0a5c7313b

Observation c2b2440d-8c21-411c-b09d-c7265b4fbe34 · outbound

This paper cites CoCa: Contrastive Captioners are Image-Text Foundation Models.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering CoCa: Contrastive Captioners are Image-Text Foundation Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.633408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.633408Z digest=sha256:7347784e3cd0c13a33b55ed2281fcd120365188ffa0cbe547df2daccb3276dae

Observation 8c5870bb-5504-41de-a250-7709b73c39dd · outbound

This paper cites Computed tomography scans in the evaluation of fatty liver disease in a population based study: the multi-ethnic study of atherosclerosis.Academic radiology, 19(7):811–818, 2012.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Computed tomography scans in the evaluation of fatty liver disease in a population based study: the multi-ethnic study of atherosclerosis.Academic radiology, 19(7):811–818, 2012

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:32.916546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:31.704276Z digest=sha256:4b2450b38f9ff32d5113a985c8b320271ba7e81725ef14aed16e6634345f7b13

Observation e134d42b-9c87-410e-b3b8-8fa00f650fad · outbound

This paper cites Vision-language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Vision-language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:32.589494Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:31.785891Z digest=sha256:d522d4d93129b4d7b0ed8d8800bfec3a728e76693828e24c5045ebe609cb6129

Observation 37f8d29f-fe4a-4fbc-b37d-118cb68bbf33 · outbound

This paper cites BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.862406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.862406Z digest=sha256:087b45b0feeb508b549ea8f7be70f5aa28d6d03791e9dd76c6d884b880e7ca2a

Observation aea7cef3-290e-4c37-b18f-01da180f82f5 · outbound

This paper cites PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:31.925242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:31.925242Z digest=sha256:6b3e5190fc26a58d00a7b9ad734f4bc0faec0ea72f546172f290b292f86a7235

Observation fb37f7de-b915-4ec8-a4c1-e829ff92d56a · outbound

This paper cites RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T14:26:32.001165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:26:32.001165Z digest=sha256:407e4ec8e4f6f8a85bdb409af4df99ef0d5b41f34df642ef3bf66616561d3a40

Observation 78cea072-95cd-4cf0-82f1-060bd5a39ddb · outbound

This paper cites Accessed: 2025-05-05.

Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering Accessed: 2025-05-05

Reference 2022

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:26:34.576213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T14:26:29.852152Z digest=sha256:6f5e7a2a30442570c0751c6049b80e0ab7abac1d74dc2759bd5b915669aa75db

Pith citing papers

Observation 69d1c6e1-372d-4f39-b296-3c78d768ec41 · inbound

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs cites this paper.

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:41:09.458561Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-08T14:49:53.357083Z digest=sha256:16e2cbc17cebc1e576fdba954cbcd63deb3e2ef442b35e67b905f7d45806f4d5

Observation 549dd043-10f0-45a6-be53-1a43a5666fd7 · inbound

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models cites this paper.

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T07:56:27.084951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-12T01:31:41.805037Z digest=sha256:83c916a58388fbdeb6a0d916724a8f9585b907690620580cfb64e0b429e96d89

Observation 1cace8f1-f33e-4b8c-a533-efad72952be2 · inbound

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models cites this paper.

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T13:25:45.160672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-30T23:19:20.522732Z digest=sha256:bd60c99c2d8eb398c436974a1c5357b9c6862684c06addf06c5344af5f822a2a

Observation 1f59a6d0-bce4-46e1-8e0a-42129171ea1d · inbound

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology cites this paper.

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-12T03:56:21.638325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-12T03:55:55.359488Z digest=sha256:28ab57076855fb6da7ccdea8d9a4d5a44d156f32d958d5a05d82cc2e6fd42fda

Observation 2bd1ab3b-b992-4b6a-8366-dc7fbf587be7 · inbound

Beyond Masks: The Case for Medical Image Parsing cites this paper.

Beyond Masks: The Case for Medical Image Parsing Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:42:03.563431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-13T01:40:27.841002Z digest=sha256:72a290d71dc85a0f431380846eb2b1aee99e00ee4063dfbd4dc0054f293a06d0