{"as_of":"2026-08-18T01:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f87b4484a954b8154f3ca06a45caa9973d3066302da9c1a2aff088199dbc5502","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:32.001165Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:19:20.522732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:25:45.159185Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2505.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18915","snapshot_observed_at":"2026-07-01T13:25:45.159185Z","title":"Are vision language models ready for clinical diagno- sis? a 3d medical benchmark for tumor-centric visual question answering","venue":null,"work_id":"8a58737b-cbec-4404-9557-ece054293f5c","year":2025},"citing_paper":{"arxiv_id":"2605.05810","last_updated":"2026-05-07T07:46:17Z","snapshot_observed_at":"2026-08-16T04:48:01.615261Z","submitted_at":"2026-05-07T07:46:17Z","title":"CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T14:49:53.357083Z"},"links":{"cited_paper":"/paper/2505.18915","citing_paper":"/paper/2605.05810"},"observation_digest":"sha256:c612021bfbee7ea40db5e5a1871dd19bee99b735d05acac733fde1fc420913ef","observation_id":"69d1c6e1-372d-4f39-b296-3c78d768ec41","resolution":{"observed_at":"2026-05-11T18:41:09.458561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2505.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18915","snapshot_observed_at":"2026-07-01T13:25:45.159185Z","title":"Are vision language models ready for clinical diagno- sis? a 3d medical benchmark for tumor-centric visual question answering","venue":null,"work_id":"8a58737b-cbec-4404-9557-ece054293f5c","year":2025},"citing_paper":{"arxiv_id":"2605.08787","last_updated":"2026-06-19T11:21:43Z","snapshot_observed_at":"2026-08-14T08:00:09.299101Z","submitted_at":"2026-05-09T08:16:00Z","title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:41.805037Z"},"links":{"cited_paper":"/paper/2505.18915","citing_paper":"/paper/2605.08787"},"observation_digest":"sha256:44a31b60bebb3144ab4b02853b90a51eac7a48ef53a9bffeab810edbab2baaa8","observation_id":"549dd043-10f0-45a6-be53-1a43a5666fd7","resolution":{"observed_at":"2026-05-12T07:56:27.084951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2505.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18915","snapshot_observed_at":"2026-07-01T13:25:45.159185Z","title":"Are vision language models ready for clinical diagno- sis? a 3d medical benchmark for tumor-centric visual question answering","venue":null,"work_id":"8a58737b-cbec-4404-9557-ece054293f5c","year":2025},"citing_paper":{"arxiv_id":"2605.08787","last_updated":"2026-06-19T11:21:43Z","snapshot_observed_at":"2026-08-14T08:00:09.299101Z","submitted_at":"2026-05-09T08:16:00Z","title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T23:19:20.522732Z"},"links":{"cited_paper":"/paper/2505.18915","citing_paper":"/paper/2605.08787"},"observation_digest":"sha256:33b8c3b49dfbc9983b3a2dfaf55d175493e52fe4387b8fb73fc2734683672d3d","observation_id":"1cace8f1-f33e-4b8c-a533-efad72952be2","resolution":{"observed_at":"2026-07-01T13:25:45.160672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2505.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18915","snapshot_observed_at":"2026-07-01T13:25:45.159185Z","title":"Are vision language models ready for clinical diagno- sis? a 3d medical benchmark for tumor-centric visual question answering","venue":null,"work_id":"8a58737b-cbec-4404-9557-ece054293f5c","year":2025},"citing_paper":{"arxiv_id":"2605.10761","last_updated":"2026-05-11T15:57:35Z","snapshot_observed_at":"2026-08-02T12:12:15.627459Z","submitted_at":"2026-05-11T15:57:35Z","title":"RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:55:55.359488Z"},"links":{"cited_paper":"/paper/2505.18915","citing_paper":"/paper/2605.10761"},"observation_digest":"sha256:366f7a96cba9e335518238112ec7cc83d11098135b56578cabf403e286e978ab","observation_id":"1f59a6d0-bce4-46e1-8e0a-42129171ea1d","resolution":{"observed_at":"2026-05-12T03:56:21.638325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2505.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18915","snapshot_observed_at":"2026-07-01T13:25:45.159185Z","title":"Are vision language models ready for clinical diagno- sis? a 3d medical benchmark for tumor-centric visual question answering","venue":null,"work_id":"8a58737b-cbec-4404-9557-ece054293f5c","year":2025},"citing_paper":{"arxiv_id":"2605.11438","last_updated":"2026-05-12T02:47:53Z","snapshot_observed_at":"2026-08-17T00:03:21.778754Z","submitted_at":"2026-05-12T02:47:53Z","title":"Beyond Masks: The Case for Medical Image Parsing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:40:27.841002Z"},"links":{"cited_paper":"/paper/2505.18915","citing_paper":"/paper/2605.11438"},"observation_digest":"sha256:81ba207bbde1197f4312f1ca090c5ebb749e00eea7d3771b764a0f55abde15f5","observation_id":"2bd1ab3b-b992-4b6a-8366-dc7fbf587be7","resolution":{"observed_at":"2026-05-13T01:42:03.563431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18915/citation-record","integrity":"/paper/2505.18915/integrity","json":"/paper/2505.18915/citation-record.json","paper":"/paper/2505.18915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.744627Z","title":"Nlm at imageclef 2018 visual question answering in the medical domain","venue":null,"work_id":"fb2850fa-b952-4f9d-b2e1-b3511dc93e3e","year":2018},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.388076Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:e4e4c20e2ad6e3eee1d8d5c1c0022dd705a40c4c305086f7919b1d67c42d7e2a","observation_id":"bc6be267-8891-49d7-bd21-dc0bf589cd58","resolution":{"observed_at":"2026-08-07T14:26:34.748683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:26:28.469475Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.469475Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:9e1d79e7f2c3efd682f3293756e66c6994a5783f22e0888d68fb14d3c00c2bfa","observation_id":"0c52f3e7-68af-4c8a-b4a1-adab30f8ff99","resolution":{"observed_at":"2026-08-07T14:26:28.469475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:28.602593Z","title":"Differentiating renal neoplasms from simple cysts on contrast-enhanced ct on the basis of attenuation and homogeneity.American Journal of Roentgenology, 208(4):801–804, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.602593Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:871e27f07b7762bae74d4e2909361f6eed2572e496055141754b1af829af74c8","observation_id":"edb05bfd-7bb6-4375-a298-3f8b8331dc28","resolution":{"observed_at":"2026-08-07T14:26:28.602593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:28.700335Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.700335Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:b7f832d337565340f6e301ae1289da3601665b6349ae1fbcfa29f5d2d077f65c","observation_id":"af66faa2-52a1-4c8b-b1d4-c3646f36cea2","resolution":{"observed_at":"2026-08-07T14:26:28.700335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06426","last_updated":"2019-02-21T17:01:02Z","snapshot_observed_at":"2026-08-14T17:15:06.830535Z","submitted_at":"2019-02-18T07:08:36Z","title":"2017 Robotic Instrument Segmentation Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06426","snapshot_observed_at":"2026-08-07T14:26:28.744200Z","title":"2017 robotic instrument segmentation challenge.arXiv preprint arXiv:1902.06426, 2019","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.744200Z"},"links":{"cited_paper":"/paper/1902.06426","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:2da18ae65e2e3001b6d5d25527976436ffb1a7887d2a24e073978a32510266dd","observation_id":"3ec56a87-766c-4818-9970-36a05edbb4d6","resolution":{"observed_at":"2026-08-07T14:26:28.744200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:28.776512Z","title":"The medical segmentation decathlon.arXiv preprint arXiv:2106.05735, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.776512Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:a9127510857420da3ef373323b58996c1f7cc06882d8221b436ce7fa734bdd51","observation_id":"e411385c-5704-4fab-97c6-2f09fb7e27e3","resolution":{"observed_at":"2026-08-07T14:26:28.776512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T14:26:28.812740Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models.arXiv preprint arXiv:2404.00578, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.812740Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:b71565771d8e5cd20aecff3a34ec520341d2a575c282fac48d014b36b15da42c","observation_id":"80578d81-f810-4025-a65d-6a6b47436b5f","resolution":{"observed_at":"2026-08-07T14:26:28.812740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04678","last_updated":"2025-08-19T17:05:14Z","snapshot_observed_at":"2026-08-17T22:43:37.548973Z","submitted_at":"2025-01-08T18:39:10Z","title":"RadGPT: Constructing 3D Image-Text Tumor Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04678","snapshot_observed_at":"2026-08-07T14:26:28.856361Z","title":"Radgpt: Constructing 3d image-text tumor datasets.arXiv preprint arXiv:2501.04678, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.856361Z"},"links":{"cited_paper":"/paper/2501.04678","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:5295adb8290b29957791e01e64b6092112cc50d61251030f8f8355e4d838ca9e","observation_id":"0eb29bd9-9d0e-4568-ac77-26dee075d419","resolution":{"observed_at":"2026-08-07T14:26:28.856361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:28.913920Z","title":"Overview of the vqa-med task at imageclef 2021: Visual question answering and generation in the medical domain","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.913920Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:cae0fa8a15eb532962baa262e01e18b8f6f51f958e79ef76ab964d9dcc36a0d7","observation_id":"aaacc22a-1480-43e9-9b79-4372d6068948","resolution":{"observed_at":"2026-08-07T14:26:28.913920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04056","last_updated":"2022-11-25T09:24:35Z","snapshot_observed_at":"2026-08-14T17:31:38.744041Z","submitted_at":"2019-01-13T20:38:16Z","title":"The Liver Tumor Segmentation Benchmark (LiTS)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04056","snapshot_observed_at":"2026-08-07T14:26:28.961837Z","title":"The liver tumor segmentation benchmark (lits).arXiv preprint arXiv:1901.04056, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:28.961837Z"},"links":{"cited_paper":"/paper/1901.04056","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:36a2d04ddb81b99e1612a9f2b14ffbc1981840f2a69394f16be46979f23eb3ac","observation_id":"113a939d-0fa2-4d5c-b577-1812e7e57bbe","resolution":{"observed_at":"2026-08-07T14:26:28.961837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.005527Z","title":"Merlin: A vision language foundation model for 3d computed tomography","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.005527Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:4bf855f95be4eeed7f88a1c0851d1c80f3dec8b690b7dfad54907452723e2f4a","observation_id":"61f7282a-0da5-4d09-89ca-36c467b3e2a7","resolution":{"observed_at":"2026-08-07T14:26:29.005527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20509","last_updated":"2025-02-27T20:39:03Z","snapshot_observed_at":"2026-08-16T12:54:29.760910Z","submitted_at":"2025-02-27T20:39:03Z","title":"CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20509","snapshot_observed_at":"2026-08-07T14:26:29.045166Z","title":"Coca-cxr: Contrastive captioners learn strong temporal structures for chest x-ray vision-language understanding.arXiv preprint arXiv:2502.20509, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.045166Z"},"links":{"cited_paper":"/paper/2502.20509","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:ec50129a2f22a028c7384dacf047a437b270b5b0445b3de5ea4b1dd30fd9c05b","observation_id":"b07faed2-51eb-4150-9ac0-b44dd4b36683","resolution":{"observed_at":"2026-08-07T14:26:29.045166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.707549Z","title":"Rsna 2023 abdominal trauma detection, 2023","venue":null,"work_id":"ab9d654b-b8fa-4683-a88d-176787cabc81","year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.085121Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:93ca0f454da0880722ed1d7c7d3db1444c9295f4bd82a11616c705b63c432d03","observation_id":"765f338a-a54a-45ac-91e2-c25417ba3a37","resolution":{"observed_at":"2026-08-07T14:26:34.712079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.694997Z","title":"Preparing a collection of radiology examinations for distribution and retrieval.Journal of the American Medical Informatics Association, 23(2):304–310, 2016","venue":null,"work_id":"d23a9251-f95d-4efb-a515-80e194ea5918","year":2016},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.124161Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:d2a8b1a979730dfaa951ad1d0cf9d4f52ace95a22fb1c49fb7a518a0a1490605","observation_id":"cc6fc416-4e9b-4df0-9c53-6c21dbc3a244","resolution":{"observed_at":"2026-08-07T14:26:34.699484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.168055Z","title":"Computed tomography evaluation of pancreatic steatosis: correlation with covid-19 prognosis.Future Virology, 17(4): 231–237, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.168055Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:db86a0eaa8802ffc1110f29a06b84c77df6269b021def69ba701310cf235fc18","observation_id":"ba305b8f-4104-47c6-953e-f31d89d93dd4","resolution":{"observed_at":"2026-08-07T14:26:29.168055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.224578Z","title":"Developing generalist foundation models from a multimodal dataset for 3d computed tomography.arXiv preprint arXiv:2403.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.224578Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:4c1664c3b56c2518d4ffeb6dcaa4e15dfa5269aca022e0a492d08b32c30fa49f","observation_id":"d09b29ed-c10f-45fa-83f5-710fb6b9b454","resolution":{"observed_at":"2026-08-07T14:26:29.224578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.677363Z","title":"Ct2rep: Automated radiology report generation for 3d medical imaging","venue":null,"work_id":"824e89a1-2124-4d30-a17d-2074ad02a82b","year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.270738Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:e7ced138c14f921ee2f36ed44f46efe441b6ab65c5af04f16f6bae0d4adfd0ec","observation_id":"d31a0a41-b37c-4fda-910a-7a5c7dfb1ec0","resolution":{"observed_at":"2026-08-07T14:26:34.681205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.665375Z","title":"Generatect: Text-conditional generation of 3d chest ct volumes","venue":null,"work_id":"77337f67-d787-486d-bc9e-386a956f71ca","year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.311862Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:f0ed8d1ec8c6969ce5186c9aea8d4d872ec34761ddf57dc9b3a5d7488b68e211","observation_id":"6bdbe833-8aba-4d48-901a-1a7f94046efb","resolution":{"observed_at":"2026-08-07T14:26:34.669326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.653508Z","title":null,"venue":null,"work_id":"7d286006-eaae-4db1-b5f8-592a90b1166e","year":2018},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.355155Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:af1197fbf498e64fcbd314c45e615018f3b72f60bc4409cfa6fc419c45e46c86","observation_id":"90bbf954-a266-4eae-b1bc-311489b4ff4e","resolution":{"observed_at":"2026-08-07T14:26:34.657950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.638893Z","title":"Vision-language models for medical report generation and visual question answering: A review.Frontiers in Artificial Intelligence, 7:1430984, 2024","venue":null,"work_id":"43634202-ccbd-4471-a619-771734060d5c","year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.407937Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:5847b0757b038ee02394be30ec1530604d2ca878c74f34e9e7b659319072ee27","observation_id":"dcd411c6-0f02-4b9d-a6c3-6f0361678ebc","resolution":{"observed_at":"2026-08-07T14:26:34.644681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.465676Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.465676Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:c6ad509f5a8f9f9cc78d86d6f27ac3201a945c3cc3c1e8c6bfd3652525322c22","observation_id":"e7d92b58-0a8b-4ed2-8b5a-729d3a1d7757","resolution":{"observed_at":"2026-08-07T14:26:29.465676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-07T14:26:29.501168Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.501168Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:49409f290d87fccc3fbde341184b3291779d676e2a142717989fa704e59f7f68","observation_id":"92f84a6d-27c0-43a6-8887-124bef03b0ee","resolution":{"observed_at":"2026-08-07T14:26:29.501168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.554989Z","title":"An international challenge to use artificial intelligence to define the state-of-the-art in kidney and kidney tumor segmentation in ct imaging., 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.554989Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:50cf11409bd2d5f006411aeeb4ef990893ca92652088ad267908b576c5c568e4","observation_id":"2e9b9039-1fc2-47cc-972f-32c7a4edc4a6","resolution":{"observed_at":"2026-08-07T14:26:29.554989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.614352Z","title":"Omnimed- vqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.614352Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:b37e1972874c3175beaccb00071f670858b5ca34939cf4df8f65ab2520c5facc","observation_id":"53ff101f-a388-44da-84f8-62ce768fda3a","resolution":{"observed_at":"2026-08-07T14:26:29.614352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.680646Z","title":"nnu-net: a self-configuring method for deep learning-based biomedical image segmentation.Nature methods, 18(2):203–211, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.680646Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:27d1de7bf86106004efd0c6f30326ee5a524fe994f63b6d43b95781069c3104a","observation_id":"691d7f5f-e63b-4a26-a7ea-22f967b4ebde","resolution":{"observed_at":"2026-08-07T14:26:29.680646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.601191Z","title":"Amos: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation.Advances in Neural Information Processing Systems, 35:36722–36732, 2022","venue":null,"work_id":"434ca4f5-eedd-434f-9d15-32585c5f8805","year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.738127Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:a8f4755daf0b5b7a5caf0d9cf377be3e132047ea66fe857a7df54f1d70a78114","observation_id":"afde571d-f3c7-4889-bc0c-d5f3340cbc08","resolution":{"observed_at":"2026-08-07T14:26:34.606051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.585162Z","title":"Leading in the treatment of pancreatic cysts,","venue":null,"work_id":"6c121b5a-ae40-4032-bdb9-38717035f4b0","year":null},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.795516Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:69fa4cf827b71a8a872ed893359d5db7a69d28296bb3757c8ddc641800dd346c","observation_id":"601069b9-3391-4213-acc1-2967d5ddd4c3","resolution":{"observed_at":"2026-08-07T14:26:34.592937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:29.910148Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.910148Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:5f2411e1700a40366a67216eadd9dab4fa07ab4ddd654f97582f3da34375e577","observation_id":"15ee332c-f6fc-40eb-9db3-fe51cb4144ce","resolution":{"observed_at":"2026-08-07T14:26:29.910148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.462530Z","title":"Towards visual dialog for radiology","venue":null,"work_id":"25041423-0839-4444-94ef-58430636e069","year":2020},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.953620Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:fb028f66fd63c7a16956d6d330638788d8fb76faaa8d242fb4f8a55002ddb961","observation_id":"acdb2ad3-cad0-4db1-83e8-4ae226e5b1a6","resolution":{"observed_at":"2026-08-07T14:26:34.545591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.004809Z","title":"Miccai multi-atlas labeling beyond the cranial vault–workshop and challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.004809Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:f229a5e6dffe74899833eb727f66a5627a92d9cb1b47f54a42771865a04b293b","observation_id":"008569ad-bfad-4009-9d04-d76f009f5d38","resolution":{"observed_at":"2026-08-07T14:26:30.004809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.043752Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1): 1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.043752Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:9cc8c6dccc5de5d0c5a9f09ba75bf1d8c3d0d274c7131c054d01f494a6fb2584","observation_id":"5a5d0f93-9c40-44d5-a487-5856826efdfe","resolution":{"observed_at":"2026-08-07T14:26:30.043752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16684","last_updated":"2024-07-30T02:15:03Z","snapshot_observed_at":"2026-08-16T13:31:40.514674Z","submitted_at":"2024-07-23T17:50:00Z","title":"AutoRG-Brain: Grounded Report Generation for Brain MRI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16684","snapshot_observed_at":"2026-08-07T14:26:30.112916Z","title":"Autorg-brain: Grounded report generation for brain mri.arXiv preprint arXiv:2407.16684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.112916Z"},"links":{"cited_paper":"/paper/2407.16684","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:f2eff8b3bf77bf106f3cfa24ddf9c50066d2a8f0a4a13464ffc52ecd34d2d1f3","observation_id":"b541d444-9c2d-4a89-a986-e53bbe449c8c","resolution":{"observed_at":"2026-08-07T14:26:30.112916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.151061Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36: 28541–28564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.151061Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:f04c12f83586e3a995e280cf3d7615bade66b88046b3ea615e5a73a3f2eee86d","observation_id":"62408c31-1707-4787-9210-5af91e47377b","resolution":{"observed_at":"2026-08-07T14:26:30.151061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.254473Z","title":"Medical visual question answering: A survey.Artificial Intelligence in Medicine, 143:102611, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.254473Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:2762845a2f4db06238075082f83d7c342817ebfcc3d1e96f23bc4b7b9015b2ca","observation_id":"94ddbb18-1aeb-4fd8-8067-02f5120c84aa","resolution":{"observed_at":"2026-08-07T14:26:30.254473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.148896Z","title":"Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":"0ab60972-e20e-4679-b8f3-c370e706e3c4","year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.345270Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:a954de3c593ff943be5f6187bbc2979e64ae303045774e47c25750d7f8944659","observation_id":"a2d6eb3d-2310-4c61-a436-70bb4ea7ba0a","resolution":{"observed_at":"2026-08-07T14:26:34.287206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02403","last_updated":"2023-02-13T03:24:50Z","snapshot_observed_at":"2026-08-16T17:44:26.622091Z","submitted_at":"2021-11-03T02:26:14Z","title":"WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02403","snapshot_observed_at":"2026-08-07T14:26:30.423328Z","title":"Word: Revisiting organs segmentation in the whole abdominal region","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.423328Z"},"links":{"cited_paper":"/paper/2111.02403","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:2f3cc6da4c0695314a6af889c839324f281826358c4005c3ee3396511e654960","observation_id":"30fbadfe-e079-49e4-aee7-f458f25d62ff","resolution":{"observed_at":"2026-08-07T14:26:30.423328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.507559Z","title":"Abdomenct-1k: Is abdominal organ segmentation a solved problem.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.507559Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:6c259166109801aa81d8bcf0c623df93ac39248319bd3ca48657f803a501c694","observation_id":"92c57a7b-da13-4f2d-a280-4888ad0727b6","resolution":{"observed_at":"2026-08-07T14:26:30.507559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.602450Z","title":"Fast and low-gpu-memory abdomen ct organ segmentation: the flare challenge.Medical Image Analysis, 82:102616, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.602450Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:cca83e7b5a4e337db6fc2a613459518734c64286a40ebed95918b100d7c1181a","observation_id":"f79bf655-6310-459e-aae0-eab5fb3d2848","resolution":{"observed_at":"2026-08-07T14:26:30.602450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:33.911391Z","title":"Umass at imageclef medical visual question answering (med-vqa) 2018 task","venue":null,"work_id":"fa9044f6-6cad-4f41-b34d-cd2823f5e7a4","year":2018},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.715578Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:7724465325d90d7b4c3d87547554970d9e9a2f844f589b1399d531b46bd92c68","observation_id":"fdd47cdc-1660-4e88-8a3e-3d3849fdccdb","resolution":{"observed_at":"2026-08-07T14:26:34.020554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:33.583062Z","title":"Cgmvqa: A new classification and generative model for medical visual question answering.IEEE Access, 8:50626–50636, 2020","venue":null,"work_id":"57e5166a-d266-4e17-a4fa-5346954a1dd5","year":2020},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.799080Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:a02943edaafedb520034c361aa031943df3d6f2d0b3f52f801bd9ab0cbe2a17e","observation_id":"c4e5da05-f67e-4d0e-b078-ebccbb7b7cea","resolution":{"observed_at":"2026-08-07T14:26:33.706924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.868881Z","title":"Ct-org, a new dataset for multiple organ segmentation in computed tomography.Scientific Data, 7(1): 1–9, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.868881Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:2446a4a9f6832c03a91c135019740bca4e69ce511744711f31d1851a4f85987b","observation_id":"ffff1fb0-9123-48a7-9e9e-afc8918c8337","resolution":{"observed_at":"2026-08-07T14:26:30.868881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:30.928770Z","title":"Deeporgan: Multi-level deep convolutional networks for automated pancreas segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:30.928770Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:e37955cbac6ad1d9502a1c1208353ef10d93a3e14da539bae063110065244f3f","observation_id":"9197e8dd-11be-45c3-8d94-2c25b9ca2845","resolution":{"observed_at":"2026-08-07T14:26:30.928770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:33.349197Z","title":"Medfusenet: An attention-based multimodal deep learning model for visual question answering in the medical domain.Scientific Reports, 11(1):19826, 2021","venue":null,"work_id":"272d2160-364c-423f-a83e-10f46f751d22","year":2021},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.000563Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:8d179792c8a1cf9cd8b33d9d282de488bb153947791f1e8db38ca9b472f834fc","observation_id":"08e18473-05ef-4861-8c2a-edd92d67cefc","resolution":{"observed_at":"2026-08-07T14:26:33.461360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:26:31.082499Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.082499Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:4ff21d9c8f9dfb38a691baf6a734d9a0187aeb979fab691b51b930965e95767d","observation_id":"7585b2fe-5db4-413d-8e2f-b2354c898973","resolution":{"observed_at":"2026-08-07T14:26:31.082499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:31.160004Z","title":"Towards generalist biomedical ai.Nejm Ai, 1(3):AIoa2300138, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.160004Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:75dc917731d9aeff1a008e3c480b0a7be3090e9f730739b6c47343911e542044","observation_id":"e80f558a-9643-45ce-8ceb-a2c7e8d3402f","resolution":{"observed_at":"2026-08-07T14:26:31.160004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:31.220501Z","title":"Multi-modal learning from unpaired images: Application to multi-organ segmentation in ct and mri","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.220501Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:3aa3a3060d9d93ca61fef3cf0119bcfe12cda936e4f746a0c8d2cb58a28b8de3","observation_id":"25873790-5135-4ccd-aa5b-a5a8444dbf09","resolution":{"observed_at":"2026-08-07T14:26:31.220501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:31.295509Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.295509Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:7a902d96e47decb7dd25d2491ae0398b67ae5fb619ff49d257232209d0f6c21c","observation_id":"fcf9266d-530b-4fac-ac57-62963ff26cba","resolution":{"observed_at":"2026-08-07T14:26:31.295509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-16T15:10:43.905696Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-07T14:26:31.365940Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data.arXiv preprint arXiv:2308.02463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.365940Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:5147642857fec78b84764b927069e5dcef78f1edbe5ca42df9f79d818a145cb8","observation_id":"a626d111-ef03-4117-ab45-325fbf44fb8e","resolution":{"observed_at":"2026-08-07T14:26:31.365940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-14T22:29:28.847917Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T14:26:31.413061Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.413061Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:eeae299e1a3ee63cc249f747b3b6461a8ec9fe5c97a6b552cdace30dc0c60db5","observation_id":"7f89ea47-c3c3-4fbc-babb-00e1be278c83","resolution":{"observed_at":"2026-08-07T14:26:31.413061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03162","last_updated":"2024-05-06T04:44:22Z","snapshot_observed_at":"2026-08-16T13:55:11.369835Z","submitted_at":"2024-05-06T04:44:22Z","title":"Advancing Multimodal Medical Capabilities of Gemini","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03162","snapshot_observed_at":"2026-08-07T14:26:31.498560Z","title":"Advancing multimodal medical capabilities of gemini.arXiv preprint arXiv:2405.03162, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.498560Z"},"links":{"cited_paper":"/paper/2405.03162","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:361491f0f2ae205d5e86ad6e9c1ed4069ef074753a857d6f1371eef92660683e","observation_id":"10334b5d-af21-4006-8e38-1a3f6db636f3","resolution":{"observed_at":"2026-08-07T14:26:31.498560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:33.042491Z","title":"How big can it get? a comparative analysis of llms in architecture and scaling","venue":null,"work_id":"c6026506-69d0-4372-b3e1-44fcbd833004","year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.575915Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:474bcfcc75f59af9263f70ad3e5da3e59bbd7643fd6dc43ba8ca5da5a0511d50","observation_id":"745d4205-4c81-4310-9f57-8c621470cb3f","resolution":{"observed_at":"2026-08-07T14:26:33.154597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T14:26:31.633408Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.633408Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:7347784e3cd0c13a33b55ed2281fcd120365188ffa0cbe547df2daccb3276dae","observation_id":"c2b2440d-8c21-411c-b09d-c7265b4fbe34","resolution":{"observed_at":"2026-08-07T14:26:31.633408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:32.730411Z","title":"Computed tomography scans in the evaluation of fatty liver disease in a population based study: the multi-ethnic study of atherosclerosis.Academic radiology, 19(7):811–818, 2012","venue":null,"work_id":"3c13ed3c-b71f-4353-8470-4840228079e1","year":2012},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.704276Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:fffdb0bd56587becf31d40ff4347186c74e149989858f61117356082e0783f2b","observation_id":"8c5870bb-5504-41de-a250-7709b73c39dd","resolution":{"observed_at":"2026-08-07T14:26:32.916546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:32.475184Z","title":"Vision-language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"edaef1c5-04c3-4158-865c-5b3474474ee8","year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.785891Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:d17e5d2e52381061dc8985b64be72024aab6f46999ec2f044cec8e8e0ae3cf62","observation_id":"e134d42b-9c87-410e-b3b8-8fa00f650fad","resolution":{"observed_at":"2026-08-07T14:26:32.589494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-07T14:26:31.862406Z","title":"Large-scale domain-specific pretraining for biomedical vision-language processing.arXiv preprint arXiv:2303.00915, 2(3):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.862406Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:9e22b1d65b748c4608836c0ce439f2eadfa5b8ec2c00d421635ec7b2b90e4356","observation_id":"37f8d29f-fe4a-4fbc-b37d-118cb68bbf33","resolution":{"observed_at":"2026-08-07T14:26:31.862406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-07T14:26:31.925242Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering.arXiv preprint arXiv:2305.10415, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:31.925242Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:6b3e5190fc26a58d00a7b9ad734f4bc0faec0ea72f546172f290b292f86a7235","observation_id":"aea7cef3-290e-4c37-b18f-01da180f82f5","resolution":{"observed_at":"2026-08-07T14:26:31.925242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16754","last_updated":"2024-04-25T17:11:37Z","snapshot_observed_at":"2026-08-17T16:25:56.941516Z","submitted_at":"2024-04-25T17:11:37Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16754","snapshot_observed_at":"2026-08-07T14:26:32.001165Z","title":"Multiple (25) hypoattenuating liver masses. Largest one (segment 2) measures 3.2 x 1.7 cm. Total volume of all liver masses: 19.4 cm3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:32.001165Z"},"links":{"cited_paper":"/paper/2404.16754","citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:407e4ec8e4f6f8a85bdb409af4df99ef0d5b41f34df642ef3bf66616561d3a40","observation_id":"fb37f7de-b915-4ec8-a4c1-e829ff92d56a","resolution":{"observed_at":"2026-08-07T14:26:32.001165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:34.567137Z","title":"Accessed: 2025-05-05","venue":null,"work_id":"7fb74c45-dcd1-4806-8041-018abcba3136","year":2022},"citing_paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:29.852152Z"},"links":{"citing_paper":"/paper/2505.18915"},"observation_digest":"sha256:0d4529045eec2df3d1faefe290b4797938b224dcea42b2b822707a1852228906","observation_id":"78cea072-95cd-4cf0-82f1-060bd5a39ddb","resolution":{"observed_at":"2026-08-07T14:26:34.576213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18915","last_updated":"2025-05-25T00:50:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:18:44.348749Z","submitted_at":"2025-05-25T00:50:15Z","title":"Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 5 inbound Pith citation observations for arXiv:2505.18915."}