{"as_of":"2026-08-17T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8eebb6a7c3358f035aaa998a2a547f9ce4ce4181fdea49f241100e349f2165ae","coverage":[{"denominator":273,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:32:54.396482Z","state":"measured"},{"denominator":107,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":107,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:22:51.474653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:23:59.931932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2504.21051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-06-29T22:23:59.931932Z","title":"& Tang, H","venue":null,"work_id":"4288ede7-ce69-442f-a90c-61310090d490","year":2025},"citing_paper":{"arxiv_id":"2510.02001","last_updated":"2026-04-20T01:16:53Z","snapshot_observed_at":"2026-07-06T22:31:30.171287Z","submitted_at":"2025-10-02T13:22:13Z","title":"Generating Findings for Jaw Cysts in Dental Panoramic Radiographs Using a GPT-Based VLM: A Preliminary Study on Building a Two-Stage Self-Correction Loop with Structured Output (SLSO) Framework","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T10:33:57.456950Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2510.02001"},"observation_digest":"sha256:693e5fb91a79a08c7fd949273e20b905829381f9489be71b4b4d3cfcf755b6d4","observation_id":"bd298695-fdd6-4888-8e30-75d5e9c1633d","resolution":{"observed_at":"2026-05-18T10:36:15.338466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-08-03T19:22:51.474653Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.00918","last_updated":"2026-06-20T15:23:57Z","snapshot_observed_at":"2026-08-12T18:34:27.023829Z","submitted_at":"2025-11-30T14:52:11Z","title":"Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:51.474653Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2512.00918"},"observation_digest":"sha256:55161aba579704cf3a7174cadc8528aefe56fdb7583efcb2831d4f7223a6601e","observation_id":"ababd7ba-e369-49db-b477-b77609c8400f","resolution":{"observed_at":"2026-08-03T19:22:51.474653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2504.21051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-06-29T22:23:59.931932Z","title":"& Tang, H","venue":null,"work_id":"4288ede7-ce69-442f-a90c-61310090d490","year":2025},"citing_paper":{"arxiv_id":"2604.08333","last_updated":"2026-04-09T15:07:26Z","snapshot_observed_at":"2026-08-11T13:11:38.292964Z","submitted_at":"2026-04-09T15:07:26Z","title":"Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:13.523021Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2604.08333"},"observation_digest":"sha256:40b1198c214061784a78786eaa64d4e1fb56c4448b52ffd1adbcc50936278ad0","observation_id":"7d1c4294-23fe-41b0-8044-b59429559b75","resolution":{"observed_at":"2026-05-11T05:21:00.782695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2504.21051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-06-29T22:23:59.931932Z","title":"& Tang, H","venue":null,"work_id":"4288ede7-ce69-442f-a90c-61310090d490","year":2025},"citing_paper":{"arxiv_id":"2604.08815","last_updated":"2026-04-09T23:09:38Z","snapshot_observed_at":"2026-08-11T16:02:34.586337Z","submitted_at":"2026-04-09T23:09:38Z","title":"Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:56:16.568462Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2604.08815"},"observation_digest":"sha256:75a4c0d1fd37dd1cf5196bcbb52ccfe1e6b631e625562dc48225df1bd5b7398a","observation_id":"b0deed74-a62a-4262-88ec-2aa75474bd77","resolution":{"observed_at":"2026-05-11T07:50:59.382029Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2504.21051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-06-29T22:23:59.931932Z","title":"& Tang, H","venue":null,"work_id":"4288ede7-ce69-442f-a90c-61310090d490","year":2025},"citing_paper":{"arxiv_id":"2604.25296","last_updated":"2026-04-28T07:05:26Z","snapshot_observed_at":"2026-08-13T01:18:53.795740Z","submitted_at":"2026-04-28T07:05:26Z","title":"Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T16:23:11.717906Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2604.25296"},"observation_digest":"sha256:b03d78f96dd97c0dce25b7382aa05d1cc805584a15cd0da9ce5d10a7f4ecbb2d","observation_id":"b89ae31c-0151-439d-bc16-04d1e74d27ba","resolution":{"observed_at":"2026-05-11T23:41:20.415369Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2504.21051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-06-29T22:23:59.931932Z","title":"& Tang, H","venue":null,"work_id":"4288ede7-ce69-442f-a90c-61310090d490","year":2025},"citing_paper":{"arxiv_id":"2605.26320","last_updated":"2026-05-25T20:35:48Z","snapshot_observed_at":"2026-07-06T23:36:11.031436Z","submitted_at":"2026-05-25T20:35:48Z","title":"MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:22:53.215257Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2605.26320"},"observation_digest":"sha256:f8a92ae739cc3b07efb25d8681db39975d414868adf629789654437fda0ea672","observation_id":"59cde944-f041-4a73-aaef-15a8e88ef5d9","resolution":{"observed_at":"2026-06-29T22:23:59.933375Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21051","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"Multimodal large language models for medicine: A comprehensive survey.arXiv preprint arXiv:2504.21051, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-08-12T13:35:16Z","snapshot_observed_at":"2026-08-15T23:12:09.543579Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":289,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2504.21051","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:d1f035ef89e85e3d376fdfadf78fd8c4ad180e5fb66592914bfbdc0e51c72e63","observation_id":"3fe786c5-186c-4422-8c08-79dc0d85c7e3","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.21051/citation-record","integrity":"/paper/2504.21051/integrity","json":"/paper/2504.21051/citation-record.json","paper":"/paper/2504.21051"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.942078Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.942078Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:b72fb6b62ee0716c9e779c271ad9bf2095828bf774aa2620689cf30b44122070","observation_id":"b02b54c9-7375-4968-9b1e-1f58aceca3f6","resolution":{"observed_at":"2026-08-16T05:32:53.942078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T05:32:53.947704Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.947704Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:d5e1e3b011418c8b20725894c6e7718f9420092cea7d9933eff2892875e4e53d","observation_id":"9890b2f7-4663-441a-b8b9-926969b07fca","resolution":{"observed_at":"2026-08-16T05:32:53.947704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.951933Z","title":"Scaling instruction- finetuned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.951933Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e5241493e8fd8cd700ea775dad1a7e937dc04348892f27fa0498fbf986d15592","observation_id":"5226809d-b755-48c2-a3c1-a916d333a711","resolution":{"observed_at":"2026-08-16T05:32:53.951933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T05:32:53.960050Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.960050Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:fdc417a8e85e56b2a233f03b8d378d7973b13e699e656827ba0d62166713fe41","observation_id":"5976a78e-4343-4a26-b610-06c3fed67bcc","resolution":{"observed_at":"2026-08-16T05:32:53.960050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.964200Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.964200Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:75bff0e5027f97b4819d233a04258b5f16837566f8d42d9034ce97e763efa485","observation_id":"c4e89d92-2668-4ba3-a0a0-309cdc910cff","resolution":{"observed_at":"2026-08-16T05:32:53.964200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.968373Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.968373Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:9312f89456442ce2d1c1e81a591ded886f326d78b5113f16aa3566370765c0c5","observation_id":"625530d0-e302-41f8-94b0-ce498dff4e3c","resolution":{"observed_at":"2026-08-16T05:32:53.968373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.972132Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.972132Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:67f37ca1a609400ed8fc4e07d65b865c708b6cc877d972a7b7228d79dde5fe5d","observation_id":"dfb2b430-350f-4666-a319-a4e02f6a90ca","resolution":{"observed_at":"2026-08-16T05:32:53.972132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.975825Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.975825Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:779e8640405463eea5ab165bcee1ed467628b02d65e3b0bbf30d21e5e6a298c8","observation_id":"943f9e94-8ade-449a-b05a-e9e3eb1ce2bb","resolution":{"observed_at":"2026-08-16T05:32:53.975825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.979666Z","title":"A maximum likelihood approach to continuous speech recognition,","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.979666Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:923477c16a7a3e2894a1f1eabb5f73710c144825c899273147502d3887142c4d","observation_id":"408b5d8a-81e6-48b0-a7b7-3727fb4a0be8","resolution":{"observed_at":"2026-08-16T05:32:53.979666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.983461Z","title":"Interpolated estimation of markov source parameters from sparse data,","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.983461Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:8b733f003bea15b96538f17e7ba592616b179818a04c0314100ef9d3c9904995","observation_id":"58b7455e-814e-4a72-b993-6337e405bac8","resolution":{"observed_at":"2026-08-16T05:32:53.983461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.987664Z","title":"Recurrent neural network based language model","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.987664Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:7e85ce595bca87534df875ba0e72a0bc3d1722879cf4ca10ef02732701fbb578","observation_id":"b553516a-ecfe-4a81-b045-215453e294b8","resolution":{"observed_at":"2026-08-16T05:32:53.987664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T05:32:53.992060Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.992060Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:7035761a3dedfe31ec0627c33b43ce0d1b1b1afef303967bdfd902e0cc8a327f","observation_id":"523eae02-5d6b-4243-857b-71f1596ba214","resolution":{"observed_at":"2026-08-16T05:32:53.992060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:53.995864Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.995864Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:5f28fc818979689573f620a185a85eba14ef6bda437d0014bce375d405f0e816","observation_id":"e507ba10-a529-4714-9188-1d176a50b562","resolution":{"observed_at":"2026-08-16T05:32:53.995864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T05:32:53.999800Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:53.999800Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ffbc35df855771a2a38f099788bdf4d48e358d11e69446e580f45950297f32c4","observation_id":"34e561d2-5da5-478f-a49a-f6f3659fb6e5","resolution":{"observed_at":"2026-08-16T05:32:53.999800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.004958Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.004958Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:375f7419629b5b0c810955ced116ec6dc2515ca48a5afa366aefa86fdf299a29","observation_id":"7dcb756a-eb31-4367-9180-4ea86b97e77e","resolution":{"observed_at":"2026-08-16T05:32:54.004958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.013209Z","title":"Chatdoctor: A medical chat model fine-tuned on a large language model meta-ai (llama) using medical domain knowledge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.013209Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ed93971d942fca0e63b5fef103f12029540e5baac2b5a6dd5335f7ad1104a94a","observation_id":"6564ec59-f1ba-40de-b6bf-6c6b68778e62","resolution":{"observed_at":"2026-08-16T05:32:54.013209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-16T13:39:01.243847Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-16T05:32:54.016989Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.016989Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:baf4b9bd4135c464e1b219b847ea5e27d7275c6b7441f8a4c607b4de93d8a6f5","observation_id":"5c792d77-8aff-41a4-a8b1-48e9d6d2cec6","resolution":{"observed_at":"2026-08-16T05:32:54.016989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05654","last_updated":"2024-01-11T04:25:06Z","snapshot_observed_at":"2026-08-16T14:28:21.479244Z","submitted_at":"2024-01-11T04:25:06Z","title":"Towards Conversational Diagnostic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05654","snapshot_observed_at":"2026-08-16T05:32:54.021368Z","title":"Towards conversational diagnostic ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.021368Z"},"links":{"cited_paper":"/paper/2401.05654","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:75efb8b76570f08608890b2ae5487ecd5abd60979399f744a90577e08413d726","observation_id":"18e6c3c3-e5b3-4edd-b30a-2aba248d67de","resolution":{"observed_at":"2026-08-16T05:32:54.021368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.033329Z","title":"Towards generalist biomedical ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.033329Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e5714527c05caaf70923c043b455ad4d92a113d3b8712921ee6ea33ed1da0c41","observation_id":"649a2298-1f2a-464d-8c14-b7cd2667357b","resolution":{"observed_at":"2026-08-16T05:32:54.033329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10691","last_updated":"2023-06-08T10:32:56Z","snapshot_observed_at":"2026-08-16T15:38:50.284969Z","submitted_at":"2023-04-21T01:17:09Z","title":"SkinGPT-4: An Interactive Dermatology Diagnostic System with Visual Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10691","snapshot_observed_at":"2026-08-16T05:32:54.037374Z","title":"Skingpt-4: an interactive dermatology di- agnostic system with visual large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.037374Z"},"links":{"cited_paper":"/paper/2304.10691","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:28876a2f0fa6e3ac9f049302373d56143fa21248b2673d47136d1dbad1185587","observation_id":"4dad5495-b8fa-494f-a1e6-244345dedc20","resolution":{"observed_at":"2026-08-16T05:32:54.037374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.045453Z","title":"The unified medical language system (umls): in- tegrating biomedical terminology,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.045453Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:053c7f07e423be5192d5529594c1e51a4a080dee3cfa4ebc687dde8640758933","observation_id":"ab6c229a-bba8-4ae3-bb78-6e0f3792abd0","resolution":{"observed_at":"2026-08-16T05:32:54.045453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.048976Z","title":"The shaky foundations of large language models and foundation models for electronic health records,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.048976Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:29ebb7bd53c7b53027d8aa1854bd6a0ee435506b2aceb01d25db946a44bcfac8","observation_id":"9ebf7303-855f-4fd4-b50d-62ebd1925de3","resolution":{"observed_at":"2026-08-16T05:32:54.048976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.052854Z","title":"Large language models in medicine,","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.052854Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:fcc6c5537af1a16abc0237fa2797a7863eb232c79f1f9aa8fb422f4f9c82ccda","observation_id":"dae42ef4-e9a4-486e-8584-057a1cc23055","resolution":{"observed_at":"2026-08-16T05:32:54.052854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.056365Z","title":"Clinical text summarization: adapting large lan- guage models can outperform human experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.056365Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:95a6a03fcb5ec0cc2fbe8025e06843657ad12871ee7f276903eb0ccf465d5058","observation_id":"59100511-0caa-4946-84b6-7d6d760359ef","resolution":{"observed_at":"2026-08-16T05:32:54.056365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.059831Z","title":"Xraygpt: Chest radiographs summarization using large medical vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.059831Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:5e727c5c2065bc084e629e82fea23d5125a554ea0ebc81b6396a8df441d490c2","observation_id":"daeacc83-14a2-42c2-927f-e06077483ec0","resolution":{"observed_at":"2026-08-16T05:32:54.059831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.068546Z","title":"Gpt-driven radiology re- port generation with fine-tuned llama 3,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.068546Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:d80d98b2f5e31fe1766c6a621a8ef8a071cd18a8ad4b81e77d5acb8b07db593c","observation_id":"efe2592c-e701-4dc6-81d5-82f63041fbd7","resolution":{"observed_at":"2026-08-16T05:32:54.068546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.081192Z","title":"Enhanc- ing radiological reporting in head and neck cancer: Converting free-text ct scan reports to structured reports using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.081192Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:064ae3674fba1f85e7cded564bdbf6e055c79dbb62e5170c9a925a18d51afde3","observation_id":"ec823c4a-82e4-41b4-a9d8-ba11a013cd16","resolution":{"observed_at":"2026-08-16T05:32:54.081192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02228","last_updated":"2023-04-03T09:57:51Z","snapshot_observed_at":"2026-08-16T16:04:10.929982Z","submitted_at":"2023-01-05T18:55:09Z","title":"MedKLIP: Medical Knowledge Enhanced Language-Image Pre-Training in Radiology","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02228","snapshot_observed_at":"2026-08-16T05:32:54.084870Z","title":"Medklip: Medical knowledge enhanced language-image pre-training in radiology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.084870Z"},"links":{"cited_paper":"/paper/2301.02228","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:1fab73bdce67aee50320a6a04c050785917bb4251627551ac65583d1352519cb","observation_id":"9ddb7b39-0ece-4a95-8c1d-5343a7eebc8d","resolution":{"observed_at":"2026-08-16T05:32:54.084870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14948","last_updated":"2024-10-19T02:35:35Z","snapshot_observed_at":"2026-08-16T13:07:52.115711Z","submitted_at":"2024-10-19T02:35:35Z","title":"SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14948","snapshot_observed_at":"2026-08-16T05:32:54.092151Z","title":"Semihvision: Enhancing medical multimodal models with a semi-human annotated dataset and fine-tuned instruction generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.092151Z"},"links":{"cited_paper":"/paper/2410.14948","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:484579313b1ea882631993946fd4a2179bd2be7d1ba70a53a382283f4c32fac1","observation_id":"607ea925-c882-493a-906f-9eb1c1e7c350","resolution":{"observed_at":"2026-08-16T05:32:54.092151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.099888Z","title":"The radiology report—are we IEEE TRANSACTIONS ON PATTERN ANAL YSIS AND MACHINE INTELLIGENCE 14 getting the message across?","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.099888Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:d794ea7a7a3f6efedcfd7099ca71abce76944df6cf75652f5b277584231a7b0b","observation_id":"48630401-e911-4397-8353-c58d2884a348","resolution":{"observed_at":"2026-08-16T05:32:54.099888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-16T15:55:21.008454Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-16T05:32:54.103554Z","title":"Chatcad: Interactive computer-aided diagnosis on medical image using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.103554Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:abd73a005f0a2df15794bcba6e1e6b178071a50b5d7f95c878c713018422e62b","observation_id":"81a897d6-5083-4b7e-bdbb-b266d8ad76e6","resolution":{"observed_at":"2026-08-16T05:32:54.103554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.107671Z","title":"Making the most of text semantics to improve biomedical vision–language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.107671Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:45686cca49cd0e1ea9c5500e3bf3879d737646658e85fa7322ff87e144e5ed9c","observation_id":"b4e6117d-76bb-4197-9940-2917a91ebe30","resolution":{"observed_at":"2026-08-16T05:32:54.107671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.111489Z","title":"A deep learning approaches and fastai text classification to predict 25 medical diseases from medical speech utterances, transcription and intent,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.111489Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:1264cf21b4ef64cd97c3c22c7b18d310dba0ba9b941e1c87a1a3ae2fa2cb6f79","observation_id":"a642a3d8-f685-4e14-8f00-16f722614c58","resolution":{"observed_at":"2026-08-16T05:32:54.111489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.115493Z","title":"Automatic documentation of professional health interactions: A systematic review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.115493Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:dfeee256658a4200b18439db1b4d115c50fa22c5d1450d700ab41d9cd78d4be6","observation_id":"1cc82550-8aaa-478a-8634-8b53c53eebfe","resolution":{"observed_at":"2026-08-16T05:32:54.115493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.119807Z","title":"Medical report generation based on segment-enhanced contrastive representa- tion learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.119807Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:950b8c5b3b935f0e87ecb20cb947299b7c31fe5330f15d626ffb6d07edbe5443","observation_id":"1825bf4a-3ad1-48ba-b6be-766672d96353","resolution":{"observed_at":"2026-08-16T05:32:54.119807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12174","last_updated":"2023-06-22T01:31:10Z","snapshot_observed_at":"2026-08-16T21:48:01.074327Z","submitted_at":"2023-06-21T11:09:48Z","title":"OphGLM: Training an Ophthalmology Large Language-and-Vision Assistant based on Instructions and Dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12174","snapshot_observed_at":"2026-08-16T05:32:54.128068Z","title":"Ophglm: Training an ophthalmology large language-and-vision assistant based on instructions and dialogue,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.128068Z"},"links":{"cited_paper":"/paper/2306.12174","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:0e1191f6e42f72737d7231f404bc71fc91ba24bc47dc871b0a602379057e306f","observation_id":"8788c48d-1341-47f7-94ec-930c3369fd1c","resolution":{"observed_at":"2026-08-16T05:32:54.128068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-16T05:32:54.132093Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.132093Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:42ef4e9dbf98b90ce5f47c75ea2819fcd585f7beb17369c1a3c559ffe6d70320","observation_id":"064b318b-b111-40d0-a7cf-c81d2d910489","resolution":{"observed_at":"2026-08-16T05:32:54.132093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06419","last_updated":"2023-08-29T17:44:28Z","snapshot_observed_at":"2026-08-16T15:04:51.320887Z","submitted_at":"2023-08-29T17:44:28Z","title":"Radiology-Llama2: Best-in-Class Large Language Model for Radiology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06419","snapshot_observed_at":"2026-08-16T05:32:54.136268Z","title":"Radiology-llama2: Best-in-class large language model for radiology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.136268Z"},"links":{"cited_paper":"/paper/2309.06419","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:670ea03e5a27e69bbfb850e8aed5aad4e96a6a814c663c84042895c36af7e3ac","observation_id":"d9c84f58-9351-4efa-9487-65dd215e895e","resolution":{"observed_at":"2026-08-16T05:32:54.136268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T05:32:54.140147Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.140147Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:42ded4ddb1bd8387dfc0c9aac7b75da5c5f09a667c04bbd85d14c47c5e19ec6f","observation_id":"f7f5a518-3397-49be-8f16-20fb93fae955","resolution":{"observed_at":"2026-08-16T05:32:54.140147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.147834Z","title":"Sigphi-med: A lightweight vision-language assistant for biomedicine,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.147834Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ed18fbf5e2318d0312f93e694f6cf87ae1bbecdd84daf207b2fcd51f47869813","observation_id":"7c836320-51fc-43de-82f3-8f6041586409","resolution":{"observed_at":"2026-08-16T05:32:54.147834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.151838Z","title":"Phi- 2: The surprising power of small language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.151838Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:86f33ebb2482513dd91e53cb93396c7e2164452efa85de39728f7312d67cfead","observation_id":"405e2218-e8c0-46a4-bbd8-327c73f77f1a","resolution":{"observed_at":"2026-08-16T05:32:54.151838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.155885Z","title":"Train- ing language models to follow instructions with human feed- back,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.155885Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:692a79e02b8cf04b46d4216d65c4adadce0b2456e4b21b8b183e885882c59eb3","observation_id":"c87378c6-d36e-4880-a8ec-1b310331c997","resolution":{"observed_at":"2026-08-16T05:32:54.155885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.159785Z","title":"Medblip: Bootstrapping language-image pre-training from 3d medical images and texts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.159785Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:33872e2a81f4230eaa912d3b75190dfd87f2a97e54f7eeb71d241618c0fdca5a","observation_id":"748ba5e8-89cd-4c7c-8e47-4db4f101a28c","resolution":{"observed_at":"2026-08-16T05:32:54.159785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18421","last_updated":"2024-03-27T10:18:21Z","snapshot_observed_at":"2026-08-16T14:05:57.478013Z","submitted_at":"2024-03-27T10:18:21Z","title":"BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18421","snapshot_observed_at":"2026-08-16T05:32:54.163638Z","title":"Biomedlm: A 2.7 b parameter language model trained on biomedical text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.163638Z"},"links":{"cited_paper":"/paper/2403.18421","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:511cf8ddf96e063f9b1472799547312a2810ddf6c8294234df5e73edb92e685c","observation_id":"0b0a49fa-60b8-4494-858d-8ed46c40ca57","resolution":{"observed_at":"2026-08-16T05:32:54.163638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.167477Z","title":"Pclmed at image- clefmedical 2023: Customizing general-purpose foundation mod- els for medical report generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.167477Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:799aa553ab746e40564d9028f96c846b8b21338cad6a6dc6aa060a21e7ce3f27","observation_id":"f306ba51-7bf9-4179-a003-9df31815105e","resolution":{"observed_at":"2026-08-16T05:32:54.167477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-16T05:32:54.171093Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.171093Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e6251864f2ccb8b8d149931190ffa6fcbae9645d77a555a554dee3011ff67fae","observation_id":"95f6676b-a279-48c9-9a92-8d1d0ce170b2","resolution":{"observed_at":"2026-08-16T05:32:54.171093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.174997Z","title":"Pmc-llama: toward building open-source language models for medicine,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.174997Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:441115c4b7a0e96c79a5f3fad2dabaae610b517d6168906c8d4a575976e83f62","observation_id":"6d5f53da-905d-4628-95ac-3eb8cca5b9d9","resolution":{"observed_at":"2026-08-16T05:32:54.174997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.178972Z","title":"Pathasst: A generative foundation ai assistant towards artificial general intelligence of pathology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.178972Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:1115eb619bdbdc3c755f460c48590e4571263b13e430a782e9a7740b3cca70d8","observation_id":"dc163e74-7fde-4a87-b0df-61b5b5ab6d8e","resolution":{"observed_at":"2026-08-16T05:32:54.178972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.182680Z","title":"Chatcad+: Towards a universal and reliable interactive cad using llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.182680Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:808ac212f84b7e18c202580d515562d25d89e11c6a58b94902aefa5f6ec600b5","observation_id":"48c3fdfe-67a0-46a9-8b57-83e79d682891","resolution":{"observed_at":"2026-08-16T05:32:54.182680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.186170Z","title":"Chatgpt: Optimizing language models for dialogue,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.186170Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:aca5fc81daa42f5435e997dbb8f4be2a7d610d5e6ded32bf249dc8e4b7ad3341","observation_id":"d852e4a9-0b65-46cc-9939-70531ac37839","resolution":{"observed_at":"2026-08-16T05:32:54.186170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.193318Z","title":"R2gengpt: Radiology report generation with frozen llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.193318Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ce126caf87505b368b77ff9b2bd1814cee8b9e469d03685e00afae4cf570e06e","observation_id":"63287279-5de5-4c29-be02-d05d1ebfbc72","resolution":{"observed_at":"2026-08-16T05:32:54.193318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.197776Z","title":"Cxr-llava: A multimodal large language model for interpreting chest x-ray images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.197776Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:8fe49dd8c19d4cd1e275ae07999403f1008a6735cd4159dfb391ca50445d6dc8","observation_id":"ec3754cf-b285-4b62-be15-84ef24752c32","resolution":{"observed_at":"2026-08-16T05:32:54.197776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13668","last_updated":"2024-04-26T16:29:54Z","snapshot_observed_at":"2026-08-16T14:41:03.529198Z","submitted_at":"2023-11-22T19:45:40Z","title":"MAIRA-1: A specialised large multimodal model for radiology report generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13668","snapshot_observed_at":"2026-08-16T05:32:54.201455Z","title":"Maira-1: A specialised large multimodal model for radiology report generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.201455Z"},"links":{"cited_paper":"/paper/2311.13668","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c54a18efbad5c9870c3a721c2fa933d330f7e1752ea32b71e59b39e9ddaaa744","observation_id":"24dfccef-720b-4aca-b314-8f1ba07f7bc6","resolution":{"observed_at":"2026-08-16T05:32:54.201455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02797","last_updated":"2025-01-16T02:31:20Z","snapshot_observed_at":"2026-08-16T14:29:37.108331Z","submitted_at":"2024-01-05T13:22:12Z","title":"PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02797","snapshot_observed_at":"2026-08-16T05:32:54.205374Z","title":"Pefomed: Parameter efficient fine-tuning of multimodal large language models for medical imaging,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.205374Z"},"links":{"cited_paper":"/paper/2401.02797","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:0ccccdc2e6082bad7b232cef269dd4049f32c403985e625a82ed9e8bf2853944","observation_id":"797cb954-ef35-4985-9844-eee3a43fba77","resolution":{"observed_at":"2026-08-16T05:32:54.205374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-16T05:32:54.209472Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi- task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.209472Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:5f45bde0a88cd2ef4c4723bbb03b28094fd69dbb0bb411ca72e5caee6af0dc0e","observation_id":"4732958a-0ca1-4f94-922b-1eafcc9aa202","resolution":{"observed_at":"2026-08-16T05:32:54.209472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10237","last_updated":"2024-09-01T16:39:31Z","snapshot_observed_at":"2026-08-17T07:11:58.077943Z","submitted_at":"2024-04-16T02:35:17Z","title":"Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10237","snapshot_observed_at":"2026-08-16T05:32:54.217452Z","title":"Moe-tinymed: Mixture of experts for tiny medical large vision-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.217452Z"},"links":{"cited_paper":"/paper/2404.10237","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:07573e16897be1f0b2d942948edc5e0b5e0b04bbf9caa22ad7aef760d4fd96e8","observation_id":"c9c9e27d-d3a4-433a-a02f-b2a1d36b4e71","resolution":{"observed_at":"2026-08-16T05:32:54.217452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16386","last_updated":"2024-03-25T03:02:51Z","snapshot_observed_at":"2026-08-16T14:06:51.253314Z","submitted_at":"2024-03-25T03:02:51Z","title":"Dia-LLaMA: Towards Large Language Model-driven CT Report Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16386","snapshot_observed_at":"2026-08-16T05:32:54.221413Z","title":"Dia-llama: Towards large language model-driven ct report generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.221413Z"},"links":{"cited_paper":"/paper/2403.16386","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:edcd19a146fe7b590a1ae28667f3a31b1308ab10dc0fa269cb4ab24af0a51ba4","observation_id":"8e5ccbad-cc9d-42b8-a524-0ed77dfe20e5","resolution":{"observed_at":"2026-08-16T05:32:54.221413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04449","last_updated":"2024-09-20T17:17:43Z","snapshot_observed_at":"2026-08-16T13:45:22.852039Z","submitted_at":"2024-06-06T19:12:41Z","title":"MAIRA-2: Grounded Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04449","snapshot_observed_at":"2026-08-16T05:32:54.224990Z","title":"Maira-2: Grounded radiology report generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.224990Z"},"links":{"cited_paper":"/paper/2406.04449","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:856c1fb38a96508e6c40de44da384bed54cfe65d60a07ccdc2028cefe162dc09","observation_id":"1f186398-44ec-4818-9ae1-225c267df072","resolution":{"observed_at":"2026-08-16T05:32:54.224990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04106","last_updated":"2024-07-04T18:21:10Z","snapshot_observed_at":"2026-08-16T13:36:58.197969Z","submitted_at":"2024-07-04T18:21:10Z","title":"MiniGPT-Med: Large Language Model as a General Interface for Radiology Diagnosis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04106","snapshot_observed_at":"2026-08-16T05:32:54.228767Z","title":"Minigpt-med: Large language model as a general interface for radiology diagnosis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.228767Z"},"links":{"cited_paper":"/paper/2407.04106","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:17b7cf77e7997166a3f023faf4e61bf92a7105884f4d0877250bfb4c3eefe3c6","observation_id":"7e64b621-880b-4454-a4a0-15322eca995c","resolution":{"observed_at":"2026-08-16T05:32:54.228767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07981","last_updated":"2024-08-15T07:00:20Z","snapshot_observed_at":"2026-08-16T13:26:19.822980Z","submitted_at":"2024-08-15T07:00:20Z","title":"LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07981","snapshot_observed_at":"2026-08-16T05:32:54.233090Z","title":"Llava-surg: Towards multimodal surgical assistant via structured surgical video learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.233090Z"},"links":{"cited_paper":"/paper/2408.07981","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:07e235e0684764b91d95425c24bdabb101173a8d5313a0d1d5992952e5f5d9c3","observation_id":"03ccfa01-75c8-48c9-bfbf-2718d3603e82","resolution":{"observed_at":"2026-08-16T05:32:54.233090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T05:32:54.237098Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.237098Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ab82105ce04e252a19d6025d9327808095e15d60403be87cd775d039c27b768e","observation_id":"01129ed2-f32c-4a9d-a8fe-318618060e98","resolution":{"observed_at":"2026-08-16T05:32:54.237098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07410","last_updated":"2024-08-14T09:34:19Z","snapshot_observed_at":"2026-08-16T13:26:32.890678Z","submitted_at":"2024-08-14T09:34:19Z","title":"Aquila2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07410","snapshot_observed_at":"2026-08-16T05:32:54.245233Z","title":"Aquila2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.245233Z"},"links":{"cited_paper":"/paper/2408.07410","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:b91c0eb0354143754686a5f9c957fe3ca30497b5b6c110c3d80d477116cece69","observation_id":"8adacce6-0e11-43ab-add8-53f3701fb2b7","resolution":{"observed_at":"2026-08-16T05:32:54.245233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.249166Z","title":"Vision- biollm: Large vision language model for visual dialogue in biomedical imagery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.249166Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:eca217c66896c15283aaca82f80786d1171ab9d6143b289f245962694405851a","observation_id":"dffa3494-94a5-41fd-8965-eed8eefabace","resolution":{"observed_at":"2026-08-16T05:32:54.249166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.253129Z","title":"Openbiollms: Advancing open- source large language models for healthcare and life sciences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.253129Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:11b77583318f8a7eda59f375a8d43c2f1d48b58f59ccd180ff15e04733611d97","observation_id":"717423f8-bf8e-4ad4-a5b9-a517793ffef9","resolution":{"observed_at":"2026-08-16T05:32:54.253129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01196","last_updated":"2023-12-02T21:05:22Z","snapshot_observed_at":"2026-08-16T15:43:07.047307Z","submitted_at":"2023-04-03T17:59:09Z","title":"Baize: An Open-Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01196","snapshot_observed_at":"2026-08-16T05:32:54.257047Z","title":"Baize: An open-source chat model with parameter-efficient tuning on self-chat data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.257047Z"},"links":{"cited_paper":"/paper/2304.01196","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c1afdd823d3d9ea4a89d5421d038018154c615e0e6e1195c1164cd373ab65f47","observation_id":"4a912939-5798-4299-b504-cc76532a4945","resolution":{"observed_at":"2026-08-16T05:32:54.257047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.261159Z","title":"Gpt-4v (ision) unsuitable for clinical care and education: a clinician-evaluated assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.261159Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:84666237c4c3c1928fc846ebd4578205d42e2934537a349b59c2ccd8b629304f","observation_id":"4070784a-d52f-49f1-b4b3-84faaf06a617","resolution":{"observed_at":"2026-08-16T05:32:54.261159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.264639Z","title":"Nadarzynski, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.264639Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:f7f92d991d568d2fbb27ec1c4bd866794c1ad05e4d206313f91e1da678965eec","observation_id":"3c3dd66a-e3ef-4978-8035-f58513cf7a99","resolution":{"observed_at":"2026-08-16T05:32:54.264639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.268336Z","title":"Investigating public perception on use of chatgpt in initial consultations prior to healthcare provider consultations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.268336Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:1b7942624fffd61c88dbc752e0376d4d1be1b2ca9d3a0069c73978cb186b2b98","observation_id":"e956b3b7-eb54-4999-a6ab-333489c74411","resolution":{"observed_at":"2026-08-16T05:32:54.268336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.272151Z","title":"Mental health problems of contem- porary youth,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.272151Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:076fba18acded0d3d6354fcac944f1c01ed323d435d4813265b253fe6da3f36d","observation_id":"2b5c56b0-3c5f-4f8b-a57e-836bae846921","resolution":{"observed_at":"2026-08-16T05:32:54.272151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.275714Z","title":"No health without mental health,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.275714Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:3c3d1e440eaf182efe3c25beda661d76d884b091258224dfe84ffaa94611f6ff","observation_id":"3feb792d-1656-4e19-85ef-529ac82a6d7e","resolution":{"observed_at":"2026-08-16T05:32:54.275714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.279594Z","title":"University counseling service for improving students’ mental health","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.279594Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:38ee551a0421466717d55e66b5f301df9f29c64b6737fa2563776602d394e8db","observation_id":"24232a8b-ae7e-4521-a6a2-173b7e46c0a6","resolution":{"observed_at":"2026-08-16T05:32:54.279594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.283487Z","title":"Validity of chatbot use for mental health assessment: experimen- tal study,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.283487Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:f3726211569ffad3cb0051dde287d39e39713550e8d120b9bd2520df5ef0c8f5","observation_id":"92d28842-7d2b-4ea0-80da-6ec4449f01ac","resolution":{"observed_at":"2026-08-16T05:32:54.283487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.287122Z","title":"Effectiveness and safety of using chatbots to improve mental health: systematic review and meta-analysis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.287122Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c94633fe75cb34d778f93e1e7e34376e2e1cf7186082662200a85d6a00560f37","observation_id":"54f316f7-dc44-4207-92e3-bdc938b25ddf","resolution":{"observed_at":"2026-08-16T05:32:54.287122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.290721Z","title":"Tell me, what are you most afraid of? exploring the effects of agent representation on infor- mation disclosure in human-chatbot interaction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.290721Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c47f8f2d06e2fff3261f78ee8c1bba4d6a74edd2956880c3b2786299d4543ca4","observation_id":"b7d8a23b-1f5a-4352-94fb-b3349baadc04","resolution":{"observed_at":"2026-08-16T05:32:54.290721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.294368Z","title":"How should my chatbot inter- act? a survey on social characteristics in human–chatbot interac- tion design,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.294368Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:677401fc2b67a74a005d0b8807a05f3573ed45b4d4b04751f6edfa08a1775c28","observation_id":"45ce1260-1899-4701-814a-98fe8f4c953a","resolution":{"observed_at":"2026-08-16T05:32:54.294368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.298073Z","title":"Soulchat: Improving llms’ empathy, listening, and comfort abili- ties through fine-tuning with multi-turn empathy conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.298073Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:d5f10e3f064e5ba430dff04ae8ad5f6fbf9b9a16b4aa84f3c34f5d307d3be0c5","observation_id":"73126c91-30cb-4728-a290-40ffa308c2ca","resolution":{"observed_at":"2026-08-16T05:32:54.298073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.302449Z","title":"Psychat: A client-centric dialogue system for mental health support,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.302449Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e14af70569bf9cf59058783bcb8e92e77f3677dd2418c0c8399424892cd1cb15","observation_id":"dd301c2d-4cac-40bd-848f-522c9085f6c3","resolution":{"observed_at":"2026-08-16T05:32:54.302449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00450","last_updated":"2024-10-04T12:00:21Z","snapshot_observed_at":"2026-08-16T15:36:41.987535Z","submitted_at":"2023-04-30T11:26:10Z","title":"SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Support","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00450","snapshot_observed_at":"2026-08-16T05:32:54.306307Z","title":"Smile: Single-turn to multi-turn inclusive language expansion via chatgpt for mental health support,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.306307Z"},"links":{"cited_paper":"/paper/2305.00450","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ba12dc0e33b32c319f5b1293b1573f10a6ea38a2fb9b50bb95ed02968d1a07b3","observation_id":"dd493475-6b30-44e0-b8c2-a9147022a669","resolution":{"observed_at":"2026-08-16T05:32:54.306307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14952","last_updated":"2024-10-28T13:25:49Z","snapshot_observed_at":"2026-08-16T13:40:49.856298Z","submitted_at":"2024-06-21T08:03:33Z","title":"ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14952","snapshot_observed_at":"2026-08-16T05:32:54.310378Z","title":"Esc-eval: Evaluating emotion support conversations in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.310378Z"},"links":{"cited_paper":"/paper/2406.14952","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ec3f62e071a2edfd96ff0256a50287922f2aa07abab8817b52beda7993c9d123","observation_id":"f72ce4e1-1de1-4805-8acc-f2d11fe654d0","resolution":{"observed_at":"2026-08-16T05:32:54.310378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16433","last_updated":"2024-06-10T11:43:48Z","snapshot_observed_at":"2026-08-16T13:49:22.974931Z","submitted_at":"2024-05-26T05:18:00Z","title":"CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16433","snapshot_observed_at":"2026-08-16T05:32:54.314355Z","title":"Cpsycoun: A report-based multi-turn dialogue reconstruction and evaluation framework for chinese psychological counseling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.314355Z"},"links":{"cited_paper":"/paper/2405.16433","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:3588958200a01f9bc302977f73876a7e6a96f2889b15ffdeaa0809a497a2c609","observation_id":"24fb4332-57d0-45fb-8262-659433df511e","resolution":{"observed_at":"2026-08-16T05:32:54.314355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.318151Z","title":"Speech emotion recognition and sentiment analysis based therapist bot,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.318151Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:ea871791948878f264d3d2f9d902d62d1b3e931d10e83411f2fbd408b641fe1c","observation_id":"4da6dd24-8519-4803-89ca-1b7a67196aa4","resolution":{"observed_at":"2026-08-16T05:32:54.318151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.321701Z","title":"Emoada: A multimodal emotion interaction and psychologi- cal adaptation system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.321701Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:508fbaec9ad006f29443b888ed0d93efca3ad6a0ede6a79d618a2b083eb26629","observation_id":"d917765a-e54d-40ce-aa73-c4e833689939","resolution":{"observed_at":"2026-08-16T05:32:54.321701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.329070Z","title":"Computer-assisted surgery,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.329070Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:775a44326013b4b0ba87ad37952c025b215a055353d2138ee35a56a113f8b78f","observation_id":"2732b5a5-7001-46b1-9946-6b76a2a1155e","resolution":{"observed_at":"2026-08-16T05:32:54.329070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.332937Z","title":"Cas—a navigation support for surgery,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.332937Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e1fa2b50a9385b4228d2b02b216c5965e8ea768af04d28d8bb9540a9438fb79d","observation_id":"505633f3-a73c-456d-8b9c-a87c7efb4fc6","resolution":{"observed_at":"2026-08-16T05:32:54.332937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.336585Z","title":"Surgical- vqa: Visual question answering in surgical scenes using trans- former,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.336585Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:086c5bbe80050148527342537e393028f1abaf0b1ed6b58aefcbf93ded0e4fbe","observation_id":"db06c91a-d99b-4734-a9f1-8103caf4a40a","resolution":{"observed_at":"2026-08-16T05:32:54.336585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.344429Z","title":"Surgicalgpt: end-to-end language-vision gpt for visual question answering in surgery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.344429Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:034d4a26710aa9fb93ef1e6631378957c22ac1850018d00b238c921c2075f43c","observation_id":"c5be110c-2f3a-4797-b0d5-dae69c4a77db","resolution":{"observed_at":"2026-08-16T05:32:54.344429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.347935Z","title":"Advancing surgical vqa with scene graph knowl- edge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.347935Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:042dd746366a56059ff0319aedbd7816c760cadef3c6108e2fbe9d6bf3fa9f02","observation_id":"c74b9282-7951-4417-826d-bc97a41b4c18","resolution":{"observed_at":"2026-08-16T05:32:54.347935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.351948Z","title":"Global- reasoned multi-task learning model for surgical scene under- standing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.351948Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:b8a7a829be3ff616053c987b7ebce477527f6965fb5832378ac858893058c568","observation_id":"d0dae82c-e4f7-4d31-b14c-28b66a59ad0b","resolution":{"observed_at":"2026-08-16T05:32:54.351948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.355589Z","title":"Surgical-vqla++: Adversarial contrastive learning for calibrated robust visual question-localized answering in robotic surgery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.355589Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:19f5bd9c0f68dba328d5ed16d8213424643cbe688a8f2c234519184f727348d1","observation_id":"c0fc1488-95dd-48aa-8330-32afd2055628","resolution":{"observed_at":"2026-08-16T05:32:54.355589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.359113Z","title":"Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.359113Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e51f12200714ed79c265a8cfe12c81959e90202dd55a2b5d7fd94d10a1bafb3e","observation_id":"ffb47fe0-4949-4235-b4b3-b2a86720c112","resolution":{"observed_at":"2026-08-16T05:32:54.359113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.363008Z","title":"Sgt: Scene graph-guided transformer for surgical report generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.363008Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c876d9ac2d647ca5922f622c65ecc30c5f4d000b679196e85faf3e69b129fd79","observation_id":"0ef33e11-7401-422d-8095-60bb57008bce","resolution":{"observed_at":"2026-08-16T05:32:54.363008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15220","last_updated":"2025-06-16T19:07:50Z","snapshot_observed_at":"2026-08-16T15:12:40.416464Z","submitted_at":"2023-07-27T22:38:12Z","title":"Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15220","snapshot_observed_at":"2026-08-16T05:32:54.366608Z","title":"Learning multi-modal representations by watching hundreds of surgical video lectures,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.366608Z"},"links":{"cited_paper":"/paper/2307.15220","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:1e7a1722dd7196be256a3bff8d11ccc5c4f01580844d0f4c8b931c56e5a4856f","observation_id":"d6787a7f-93d9-4de5-8ad0-606e5e2158c5","resolution":{"observed_at":"2026-08-16T05:32:54.366608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.370098Z","title":"Drinet for medical image segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.370098Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:0e40e2c8e52fb9e7ee3bd4a4a2c59bede0392a9e20e9caf401b30841296018ba","observation_id":"42c554d4-19b0-4463-ae96-e878db069a6d","resolution":{"observed_at":"2026-08-16T05:32:54.370098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.373782Z","title":"Deep learning and medical image analysis for covid-19 diagnosis and prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.373782Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:f7761b212bb7b6d09d4a7e337b6fe050aa6b2fa9e2ec25a537d1dd8c279a7e34","observation_id":"246595ac-1dda-471b-8a7f-5a6fc787492d","resolution":{"observed_at":"2026-08-16T05:32:54.373782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16684","last_updated":"2024-07-30T02:15:03Z","snapshot_observed_at":"2026-08-16T13:31:40.514674Z","submitted_at":"2024-07-23T17:50:00Z","title":"AutoRG-Brain: Grounded Report Generation for Brain MRI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16684","snapshot_observed_at":"2026-08-16T05:32:54.377652Z","title":"Autorg-brain: Grounded report generation for brain mri,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.377652Z"},"links":{"cited_paper":"/paper/2407.16684","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:94e88007efb87ca7c613327f7a547555c61b6d903abd9b1619004a0716e0b16b","observation_id":"ce17825d-027e-4a19-abf3-30f082ce677a","resolution":{"observed_at":"2026-08-16T05:32:54.377652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.381579Z","title":"Exploring chat generated pre-trained transformer-3 ability to interpret mri knee images and generate reports,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.381579Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:d5342c0070e7d9f7924b50f950732ef056d02c7960c32c64c137d1b429cd36ec","observation_id":"f4890df4-3c30-4624-a6aa-786825c292d8","resolution":{"observed_at":"2026-08-16T05:32:54.381579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.385399Z","title":"Flexible fu- sion network for multi-modal brain tumor segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.385399Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:882b2b225dc504aea31d7627ca8151b7c2c679f8e26266593fdbd9e9f406fec4","observation_id":"27c7409e-c679-4be4-9f5a-10c0f740b26e","resolution":{"observed_at":"2026-08-16T05:32:54.385399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01317","last_updated":"2023-09-07T23:07:51Z","snapshot_observed_at":"2026-08-16T15:11:15.690414Z","submitted_at":"2023-08-02T17:59:45Z","title":"ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01317","snapshot_observed_at":"2026-08-16T05:32:54.388621Z","title":"Elixr: Towards a general purpose x-ray artificial intelligence system through alignment of large language models and radiology vi- sion encoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.388621Z"},"links":{"cited_paper":"/paper/2308.01317","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:5457af28ab15074100d6bc54a712e2309db55fd26fb48b498712b6b65ee8bd0b","observation_id":"d910cf89-f56f-4f18-b69b-1c9a3d2f3663","resolution":{"observed_at":"2026-08-16T05:32:54.388621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16213","last_updated":"2024-08-29T02:12:58Z","snapshot_observed_at":"2026-08-02T05:05:13.711617Z","submitted_at":"2024-08-29T02:12:58Z","title":"M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16213","snapshot_observed_at":"2026-08-16T05:32:54.392667Z","title":"M4cxr: Exploring multi-task potentials of multi-modal large language models for chest x-ray interpretation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.392667Z"},"links":{"cited_paper":"/paper/2408.16213","citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:c9d39365c66b932de5549cfd67dc4d3f5d28614c7c8abd3731937bce08d9548e","observation_id":"a552f538-bfc5-4236-8c2b-3ccd8d148820","resolution":{"observed_at":"2026-08-16T05:32:54.392667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:32:54.396482Z","title":"Boneclip- xgboost: A multimodal approach for bone fracture diagnosis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:54.396482Z"},"links":{"citing_paper":"/paper/2504.21051"},"observation_digest":"sha256:e9bd17f15fe329ef5547d6980d5a3fa5d488dfc9a7d86fab675f6e1902a714a0","observation_id":"cb5f8735-b900-4147-bd0c-c94147720ade","resolution":{"observed_at":"2026-08-16T05:32:54.396482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.21051","last_updated":"2025-04-29T03:07:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:28:14.985658Z","submitted_at":"2025-04-29T03:07:38Z","title":"Multimodal Large Language Models for Medicine: A Comprehensive Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":273},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 273 outbound references and 7 inbound Pith citation observations for arXiv:2504.21051."}