{"as_of":"2026-08-10T23:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92c8e8e956e37a8a12b1a7b70caf6934e516d0f2b47421eb12b27dadfeff580c","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:43:33.938358Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09142/citation-record","integrity":"/paper/2607.09142/integrity","json":"/paper/2607.09142/citation-record.json","paper":"/paper/2607.09142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.688712Z","title":"Digital health market statistics 2026: Market size, investment and user adoption, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.688712Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:88a55928b3fd07f77f04d16b5c9de6ecefaa5f30a3a19822591902e70c156e78","observation_id":"6a1ad8a4-881d-46b2-8649-94a2b439bebc","resolution":{"observed_at":"2026-08-02T07:43:25.688712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.786509Z","title":"Telemedicine and AI in healthcare: Top platforms, trends & 2026 outlook","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.786509Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:aa861f321c3c0713846c94159d99adf3f50019520c2d5319be0c6dc8043c8abf","observation_id":"eee4d6a4-b9de-4afc-ae16-2833153e5602","resolution":{"observed_at":"2026-08-02T07:43:25.786509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:25.910724Z","title":"Annual results announcement for the year ended december 31, 2025.HKEXnews,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:25.910724Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1c7f81f70c5d25eeeeba3e9cf3f188969ff409b2d13526bd27a5f110ed0557d4","observation_id":"876d928c-fc1c-4adf-9ce4-4963652761ec","resolution":{"observed_at":"2026-08-02T07:43:25.910724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.122716Z","title":"Jd health introduces groundbreaking LLM-powered suite for comprehensive online and in-hospital healthcare scenarios","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.122716Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:809534cbd76d54733315001f37d83175172984260a450af03cb2c44d7bcba327","observation_id":"73599099-f7c4-40ec-b3a6-f37940c1d36d","resolution":{"observed_at":"2026-08-02T07:43:26.122716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.257849Z","title":"Large language models in medicine.Nature Medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.257849Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:a31d0d3407f259c5f05b67c71fcaba8a33afe9c137d9b69f786c9bc2030e4e17","observation_id":"ff60bbc3-5ecb-4029-8655-37e3fc8bcbc0","resolution":{"observed_at":"2026-08-02T07:43:26.257849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.413588Z","title":"The effect of using a large language model to respond to patient messages.The Lancet Digital Health, 6(6):e379–e381, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.413588Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:ea9f22a5301be698beabcbafff44783737578affe4d81b47c5dbea1a79a607b5","observation_id":"432496d1-5fcf-4220-99ca-6085f0d7f763","resolution":{"observed_at":"2026-08-02T07:43:26.413588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.523483Z","title":"Sara Mahdavi, Sushant Prakash, Anupam Pathak, Christopher Semturs, Shwetak Patel, Dale R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.523483Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:043f54b81476a461094d02fddbb9809f1d02ecacdb67520ba96fa53a16c1e6c5","observation_id":"181fbc43-a92c-4a1f-afac-30ed9ebc589b","resolution":{"observed_at":"2026-08-02T07:43:26.523483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-02T07:43:26.664483Z","title":"Cohen, and Xinghua Lu","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.664483Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:14ca094fa2a8673ca2ddfe8354fe4909de1db4cf285fbb9c27c909c97177e6b6","observation_id":"0918ed26-4579-4a86-a3b7-4623dd1e138a","resolution":{"observed_at":"2026-08-02T07:43:26.664483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-06T03:17:52.286711Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-02T07:43:26.823891Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.823891Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:3680f5e21fe12004a39e8635ce7bdddc80c0d06b84fee34b4a6ca57e1d27f1b5","observation_id":"e177c21c-8e1e-4394-a07f-0a66afc3b90b","resolution":{"observed_at":"2026-08-02T07:43:26.823891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-10T19:09:39.267277Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-02T07:43:26.937401Z","title":"MedMCQA: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.937401Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:81ccbe9cc3784eb7846e965215c4611b2a0806f33cf092854eec87de63d6571d","observation_id":"183fe46d-a841-4df4-9fc0-51fcf547f4ae","resolution":{"observed_at":"2026-08-02T07:43:26.937401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-08-10T10:08:12.828010Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-02T07:43:27.075346Z","title":"Sara Mahdavi, Jason Wei, Hyung Won Chung, Nathan Scales, Ajay Tanwani, Heather Cole-Lewis, Stephen Pfohl, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.075346Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:43d9b78da314839701266c4b1bd7756c8f274e9833b9bd08b45ef98d871bf821","observation_id":"f508afda-9752-4fa1-aa52-4d8214ec7c63","resolution":{"observed_at":"2026-08-02T07:43:27.075346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-02T07:43:27.233202Z","title":"Pfohl, Heather Cole-Lewis, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.233202Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:242538df696e7a247657181233e8a032aab602b6948268ab99f460c7fde41692","observation_id":"1870a552-4732-4b07-9ad8-5c25893fe155","resolution":{"observed_at":"2026-08-02T07:43:27.233202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08087","last_updated":"2022-03-07T09:14:20Z","snapshot_observed_at":"2026-08-01T20:36:18.568223Z","submitted_at":"2021-06-15T12:25:30Z","title":"CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08087","snapshot_observed_at":"2026-08-02T07:43:27.362450Z","title":"CBLUE: A chinese biomedical language understanding evaluation benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.362450Z"},"links":{"cited_paper":"/paper/2106.08087","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:e25c9282960ff7320fabbf56892394847310e1a7057aa94998c845e4a7e76158","observation_id":"fbb0743a-4cbf-4d02-9609-232b224dcf38","resolution":{"observed_at":"2026-08-02T07:43:27.362450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14151","last_updated":"2023-10-22T02:20:38Z","snapshot_observed_at":"2026-08-09T14:22:25.339219Z","submitted_at":"2023-10-22T02:20:38Z","title":"PromptCBLUE: A Chinese Prompt Tuning Benchmark for the Medical Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14151","snapshot_observed_at":"2026-08-02T07:43:27.511156Z","title":"PromptCBLUE: A chinese prompt tuning benchmark for the medical domain","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.511156Z"},"links":{"cited_paper":"/paper/2310.14151","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:11c6a728f2937afde096ca86a03d6805024c7acb82914cfbd6e25fcfdbebb90b","observation_id":"c0434527-5519-4fc2-b6b4-94de581d78a6","resolution":{"observed_at":"2026-08-02T07:43:27.511156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03030","last_updated":"2023-10-23T02:55:08Z","snapshot_observed_at":"2026-08-10T17:48:59.990298Z","submitted_at":"2023-06-05T16:48:41Z","title":"Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03030","snapshot_observed_at":"2026-08-02T07:43:27.681801Z","title":"Benchmarking large language models on CMExam – a comprehensive chinese medical exam dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.681801Z"},"links":{"cited_paper":"/paper/2306.03030","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:0d816657bedc328e5107448f756cdb61372f7648c3df088af8b6776ec921cfdd","observation_id":"8294e180-58e9-43c2-a5cb-53108082f788","resolution":{"observed_at":"2026-08-02T07:43:27.681801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08833","last_updated":"2024-04-04T15:16:57Z","snapshot_observed_at":"2026-07-06T16:07:10.648879Z","submitted_at":"2023-08-17T07:51:23Z","title":"CMB: A Comprehensive Medical Benchmark in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08833","snapshot_observed_at":"2026-08-02T07:43:27.798869Z","title":"CMB: A comprehensive medical benchmark in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.798869Z"},"links":{"cited_paper":"/paper/2308.08833","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2de0488c96672eeed5207d2789ce89616c172a3776c80d446319e87f4fff236e","observation_id":"0b73336c-7c26-4e88-b773-3f6ccf58c482","resolution":{"observed_at":"2026-08-02T07:43:27.798869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10990","last_updated":"2024-06-24T02:25:48Z","snapshot_observed_at":"2026-08-05T14:38:16.803841Z","submitted_at":"2024-06-24T02:25:48Z","title":"MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10990","snapshot_observed_at":"2026-08-02T07:43:27.951292Z","title":"MedBench: A comprehensive, standardized, and reliable benchmarking system for evaluating chinese medical large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:27.951292Z"},"links":{"cited_paper":"/paper/2407.10990","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:962e0618f0ebfc51badb4911f0d4d2ad7373ff3e1b4be54cdb307459b36fa69c","observation_id":"cde0045c-0945-4411-bed9-9f84f6eb9ca6","resolution":{"observed_at":"2026-08-02T07:43:27.951292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:28.100984Z","title":"MedBench v4: A robust and scalable benchmark for evaluating chinese medical language models, multimodal models, and intelligent agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.100984Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:a437f5b1c7170762703899e042c786e1727a8a9cdc8b0ea67e13dad940cadc3d","observation_id":"9341c942-ee09-4468-99a3-3675518a7e40","resolution":{"observed_at":"2026-08-02T07:43:28.100984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03329","last_updated":"2020-07-07T22:15:10Z","snapshot_observed_at":"2026-08-09T19:42:41.362340Z","submitted_at":"2020-04-07T13:07:09Z","title":"MedDialog: Two Large-scale Medical Dialogue Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03329","snapshot_observed_at":"2026-08-02T07:43:28.248603Z","title":"MedDialog: Two large-scale medical dialogue datasets","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.248603Z"},"links":{"cited_paper":"/paper/2004.03329","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:28cc17bc14fca2b1fce4ec69d27bf773d85b753f37a11ee61be12d6021b82d07","observation_id":"462b7725-9db1-45be-a48c-cc1c18e7da5d","resolution":{"observed_at":"2026-08-02T07:43:28.248603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07497","last_updated":"2022-07-31T06:04:16Z","snapshot_observed_at":"2026-07-06T10:04:39.356284Z","submitted_at":"2020-10-15T03:34:33Z","title":"MedDG: An Entity-Centric Medical Consultation Dataset for Entity-Aware Medical Dialogue Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07497","snapshot_observed_at":"2026-08-02T07:43:28.362118Z","title":"MedDG: An entity-centric medical consultation dataset for entity-aware medical dialogue generation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.362118Z"},"links":{"cited_paper":"/paper/2010.07497","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:aa10de8c053a93e7d05b60f98f0b191d9323ec0fbcd97f66fca3cb1e7b656e17","observation_id":"d7c0bf2f-8490-46d8-a4f5-388493ca024b","resolution":{"observed_at":"2026-08-02T07:43:28.362118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14204","last_updated":"2024-10-18T06:38:22Z","snapshot_observed_at":"2026-08-06T16:23:39.365388Z","submitted_at":"2024-10-18T06:38:22Z","title":"MediTOD: An English Dialogue Dataset for Medical History Taking with Comprehensive Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14204","snapshot_observed_at":"2026-08-02T07:43:28.563988Z","title":"MediTOD: An english dialogue dataset for medical history taking with comprehensive annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.563988Z"},"links":{"cited_paper":"/paper/2410.14204","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:bd078dc2e32fbcc73208317d9ca4d5be9b65b226a2d0ed725174f7efbffc954b","observation_id":"ed20a62f-3db0-48d9-9903-f9a7e420320e","resolution":{"observed_at":"2026-08-02T07:43:28.563988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02077","last_updated":"2023-09-05T09:24:48Z","snapshot_observed_at":"2026-08-10T03:39:47.321832Z","submitted_at":"2023-09-05T09:24:48Z","title":"An Automatic Evaluation Framework for Multi-turn Medical Consultations Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02077","snapshot_observed_at":"2026-08-02T07:43:28.746413Z","title":"An automatic evaluation framework for multi-turn medical consultations capabilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.746413Z"},"links":{"cited_paper":"/paper/2309.02077","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:f59c7fa21b780f2b046a54564258a0fda818b4b90c6f2bb0e7961d52c234edc2","observation_id":"e3f088dc-644e-4366-b52e-6ba78e64699b","resolution":{"observed_at":"2026-08-02T07:43:28.746413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00922","last_updated":"2024-11-07T18:59:30Z","snapshot_observed_at":"2026-08-10T03:44:52.858614Z","submitted_at":"2024-06-03T01:32:52Z","title":"MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00922","snapshot_observed_at":"2026-08-02T07:43:28.926838Z","title":"Ilgen, Emma Pierson, Pang Wei Koh, and Yulia Tsvetkov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:28.926838Z"},"links":{"cited_paper":"/paper/2406.00922","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:c85617559317d9c6dac2b2def89181107bbbd7dcf762bb5955ac2dfc1d8d81e6","observation_id":"310599d4-a556-4d3c-9593-20d0146ef02c","resolution":{"observed_at":"2026-08-02T07:43:28.926838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-02T07:43:29.119519Z","title":"AgentClinic: A multimodal agent benchmark to evaluate ai in simulated clinical environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.119519Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:924dd28e1da229159e201dbf6e34b28e00234a44b341237b53ec006763456664","observation_id":"3979da11-9bc2-4c55-992e-7e00b5a2271c","resolution":{"observed_at":"2026-08-02T07:43:29.119519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.236433Z","title":"The dialogue that heals: A comprehensive evaluation of doctor agents’ inquiry capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.236433Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:bcf9d1a077308eca42d9759f7cae2766a9d609a65b39adab93c49b2ba1adb537","observation_id":"e5d4cf8c-894c-4615-ac3a-d8e70632fee0","resolution":{"observed_at":"2026-08-02T07:43:29.236433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.366837Z","title":"MedConsultBench: A full-cycle, fine-grained, process-aware benchmark for medical consultation agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.366837Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2949b313cb3a790aa2133a5511400c34d8b4ae5aa7e5603aeaa11bc96f87d12d","observation_id":"ad75dbaa-267b-446c-91a2-c19939d35b20","resolution":{"observed_at":"2026-08-02T07:43:29.366837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06846","last_updated":"2026-04-08T09:09:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:09:08Z","title":"MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06846","snapshot_observed_at":"2026-08-02T07:43:29.543299Z","title":"MedDialBench: Benchmarking llm diagnostic robustness under parametric adversarial patient behaviors","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.543299Z"},"links":{"cited_paper":"/paper/2604.06846","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:f9a4b4576b0f447a3a22888e2e6a978a848b93494e2363d52900d310d0102889","observation_id":"b918b6c6-5b1a-485e-a607-543c27840528","resolution":{"observed_at":"2026-08-02T07:43:29.543299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-02T07:43:29.669791Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.669791Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:0b84a771bbef98cb7e6fdee8d7d34451dc90eb507b375f715c94317df84b00d4","observation_id":"5c28d1b3-da97-4557-b02f-1ee05f199559","resolution":{"observed_at":"2026-08-02T07:43:29.669791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.782033Z","title":"MedDialogRubrics: A comprehensive benchmark and evaluation framework for multi-turn medical consultations in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.782033Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:71d8ab1509636abaa3f2f12a7fafba3d69f4df0d595a633b7604491a1897de84","observation_id":"a3b41ff3-cf2a-498a-841c-860de381de38","resolution":{"observed_at":"2026-08-02T07:43:29.782033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27470","last_updated":"2026-04-30T06:13:01Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:13:01Z","title":"HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27470","snapshot_observed_at":"2026-08-02T07:43:29.880526Z","title":"Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.880526Z"},"links":{"cited_paper":"/paper/2604.27470","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:fc0e07f4b13aed5432f147eddd01660225dcbafb9cda62592b70308be0389239","observation_id":"03862263-cc3a-4a61-8712-b34e585cd437","resolution":{"observed_at":"2026-08-02T07:43:29.880526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:29.950426Z","title":"LiveMedBench: A contamination-free medical benchmark for llms with automated rubric evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:29.950426Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:7420e4edb1a690feae2ead6b599c3bd5da5762d48f30387f25ccc47b5803fd2f","observation_id":"e3c44edf-094f-4393-b43d-1117baa87024","resolution":{"observed_at":"2026-08-02T07:43:29.950426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12435","last_updated":"2020-10-06T00:36:55Z","snapshot_observed_at":"2026-08-09T15:51:10.951402Z","submitted_at":"2020-10-06T00:36:55Z","title":"Pathological Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12435","snapshot_observed_at":"2026-08-02T07:43:30.054286Z","title":"Pathological visual question answering","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.054286Z"},"links":{"cited_paper":"/paper/2010.12435","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:4cbc506d94ccbc662365cb83469311901ed085fc69f2d10efcc73bb7afb84a40","observation_id":"ba18ef32-8a30-44b3-8a64-c2b74b4e3b4e","resolution":{"observed_at":"2026-08-02T07:43:30.054286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09542","last_updated":"2021-02-18T18:44:50Z","snapshot_observed_at":"2026-08-10T19:28:21.235368Z","submitted_at":"2021-02-18T18:44:50Z","title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09542","snapshot_observed_at":"2026-08-02T07:43:30.225146Z","title":"SLAKE: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.225146Z"},"links":{"cited_paper":"/paper/2102.09542","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:87bf016316d54c68edfbe6e17e03bfb1845031bec1dfcf7ad660200405b0679a","observation_id":"369af46b-79f9-4318-a36d-a07bcb501226","resolution":{"observed_at":"2026-08-02T07:43:30.225146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-02T07:43:30.424951Z","title":"PMC-VQA: Visual instruction tuning for medical visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.424951Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2110dc65e74dbcbc1d99551bf38dd55e8b91e84b78196bb3988e75dfa60a9f33","observation_id":"f258a7b8-4738-47c0-b000-21122bbb8a47","resolution":{"observed_at":"2026-08-02T07:43:30.424951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09181","last_updated":"2024-04-21T09:51:58Z","snapshot_observed_at":"2026-08-10T14:08:15.238514Z","submitted_at":"2024-02-14T13:51:56Z","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09181","snapshot_observed_at":"2026-08-02T07:43:30.666324Z","title":"OmniMedVQA: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.666324Z"},"links":{"cited_paper":"/paper/2402.09181","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:b9b2aeb5a2acc04713a4f51ffb086f660f25d95929eca90763fcfa727ed9ff51","observation_id":"b3bd1d15-802d-4ec8-9978-b111521d6969","resolution":{"observed_at":"2026-08-02T07:43:30.666324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03361","last_updated":"2024-10-21T04:26:41Z","snapshot_observed_at":"2026-08-06T14:10:56.030769Z","submitted_at":"2024-08-06T17:59:21Z","title":"GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03361","snapshot_observed_at":"2026-08-02T07:43:30.865915Z","title":"GMAI-MMBench: A comprehensive multimodal evaluation benchmark towards general medical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:30.865915Z"},"links":{"cited_paper":"/paper/2408.03361","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:397a6c2557af052c667009323dfe81c24df047269a07f55b66bb424c793587c1","observation_id":"3021863a-813b-46d5-95f9-a8515395b7e7","resolution":{"observed_at":"2026-08-02T07:43:30.865915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.006709Z","title":"3MDBench: Medical multimodal multi-agent dialogue benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.006709Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:63acd47baac1eef5fac583995ec65fc7a98b344519712efd7bae4f5e852968e9","observation_id":"3b39bde9-9457-408e-8b54-358d48810fcd","resolution":{"observed_at":"2026-08-02T07:43:31.006709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.110964Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.110964Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:fd542775dd77d34564843013bd845b3b77d46c06562468a78a17fb933335fbe8","observation_id":"354b8dcf-1fa4-42c8-97f1-151abf94012e","resolution":{"observed_at":"2026-08-02T07:43:31.110964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.410371Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.410371Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:a70c6476120bf69cbe87b1d043c75dd6770875261d61e968eac27cf4486f980d","observation_id":"d18b794b-8000-48aa-b3d7-4d279717bb7b","resolution":{"observed_at":"2026-08-02T07:43:31.410371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15161","snapshot_observed_at":"2026-08-02T07:43:31.569388Z","title":"Rahmani, and Emine Yilmaz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.569388Z"},"links":{"cited_paper":"/paper/2601.15161","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1dfa03b9f1d0113ad103dd92676ae3c8cabbb05b9f4a89ff018723c152b64a6f","observation_id":"06ee9cf1-7695-493b-bb5d-11eacaead115","resolution":{"observed_at":"2026-08-02T07:43:31.569388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.765489Z","title":"Deid-gpt: Zero-shot medical text de-identification by gpt-4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.765489Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:05c1d34f8f49e4dc2f20ad3b16fc80728dea56321c2cc29bf7cdf1bfd35f2bbd","observation_id":"c2fb55a3-c897-4da8-a337-a77d5b0a6f0d","resolution":{"observed_at":"2026-08-02T07:43:31.765489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-02T07:43:31.943930Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.943930Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:fe1df6f4c47258df2934b0def4a102f2c6c5c6518ddd82c473157d826e65d9c0","observation_id":"c416349b-22aa-4f58-9327-06a7940f1254","resolution":{"observed_at":"2026-08-02T07:43:31.943930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.184738Z","title":"Claude 4 Opus (versions 4.6 and 4.7)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.184738Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:31472deb62a7683406f3bc70bd04368fe3f38ffdde3689ad3be0816a9766385d","observation_id":"b4e77de7-b0ea-483e-b1da-89d4c3ce8286","resolution":{"observed_at":"2026-08-02T07:43:32.184738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T07:43:32.274199Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.274199Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:6c8b0a3a87aa9958bf4dde3e147f10e692853eccd99693394c96c37682452d58","observation_id":"f335b87c-5989-4339-99ad-8c944f2be03d","resolution":{"observed_at":"2026-08-02T07:43:32.274199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.428880Z","title":"Evaluation and mitigation of the limitations of large language models in clinical decision-making.Nature Medicine, 30(9):2613–2622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.428880Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:38548aabc216c1e43e8bb770d0ceb21442f7ba19b7366d8e42e5d15820c9ae75","observation_id":"4477c2c2-fcd2-49a8-b58b-b394231ec60b","resolution":{"observed_at":"2026-08-02T07:43:32.428880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.524263Z","title":"Computing inter-rater reliability and its variance in the presence of high agreement.The British Journal of Mathematical and Statistical Psychology, 61(Pt 1):29–48, May 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.524263Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:03553be6f036bc46176a2eed2096b035a27323f413be2a8013b59acbee1036fa","observation_id":"8e2217cf-6a56-44d0-a323-8ebf1191b520","resolution":{"observed_at":"2026-08-02T07:43:32.524263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T07:43:32.654513Z","title":"Openai gpt-5 system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.654513Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2dc35da8e66ab341b5092f7720a7a1e9a7ed3fd6ac32f52dc09c595c8bfb8105","observation_id":"4483cad1-d5f7-449f-9481-80bd33ee5731","resolution":{"observed_at":"2026-08-02T07:43:32.654513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:32.828616Z","title":"Kimi K2.6: Open-weight trillion-parameter MoE agent model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.828616Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:b6ca41f7e6d612b607f14baa8a5d1cacfb3861484b7d58d1a7420df134a04a3a","observation_id":"e264408a-9830-4863-818a-3dbf2d558523","resolution":{"observed_at":"2026-08-02T07:43:32.828616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T07:43:32.919875Z","title":"Kimi k2.5: Visual agentic intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:32.919875Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:dc578f59b8c6b03a9c5ad95c56573f09e27df1ca93d656c27340a531eed875f2","observation_id":"afe5a4f5-1d7d-4b54-98e0-74245ae93649","resolution":{"observed_at":"2026-08-02T07:43:32.919875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.082950Z","title":"Qwen3.6-27B and Qwen3.6-35B-A3B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.082950Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:aede8b79e258bae0db42a0b350d2d75e62cc652efd6dfeb4f46482a1c217fa32","observation_id":"970a2151-1b35-43bd-97e3-5f929883a890","resolution":{"observed_at":"2026-08-02T07:43:33.082950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T07:43:33.163310Z","title":"Glm-5: from vibe coding to agentic engineering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.163310Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:bf6eb5e8f1e62d27e1589de6c6d69540aa3a139675b7293304fa8786da53a200","observation_id":"0082b4cb-43a1-4ea4-952d-5adb8e7403fc","resolution":{"observed_at":"2026-08-02T07:43:33.163310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.294868Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.294868Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:a54b253c96c92407fc3309f6a2e3f57c7577e0d8b44df087587bcf662bdb7228","observation_id":"b5a2e2d9-9b8f-414f-9671-8936850fe550","resolution":{"observed_at":"2026-08-02T07:43:33.294868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-07T23:53:34.814339Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-08-02T07:43:33.376539Z","title":"Medgemma technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.376539Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:816394d94944e5875fdd28f5542c1325d3bc986d40c6a2c1a69df397eee21ce8","observation_id":"6913a623-f7c6-4faa-a95e-6d8849a9926b","resolution":{"observed_at":"2026-08-02T07:43:33.376539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-07-06T21:38:34.998414Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-08-02T07:43:33.468367Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.468367Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:2cc2fa7782ff01db390bf294e04676fa361f337d93f1897658e4007f6c5cd92d","observation_id":"6a4e171b-9759-4461-9e21-9b52c520e620","resolution":{"observed_at":"2026-08-02T07:43:33.468367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.592310Z","title":"HuatuoGPT-3-32B large language model repository","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.592310Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:08e966c9a892e1ec230af0665a60f44ec938f05604523b71a982a2b3e5e6c139","observation_id":"36c637cd-853b-4147-8cb6-3d6cbb375d55","resolution":{"observed_at":"2026-08-02T07:43:33.592310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.700922Z","title":"AntAngelMed medical large language model repository","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.700922Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:e97a45ec0afcf6da44faee0181b9fb3cac28588e6827ed581014ee8b22bb9131","observation_id":"d7d60289-1b8a-44f2-825d-fb59cdb324b6","resolution":{"observed_at":"2026-08-02T07:43:33.700922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:33.813874Z","title":"Baichuan-m3: Modeling clinical inquiry for reliable medical decision-making","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.813874Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:3469e0ef4b10e00c25850ab09c509c9b491fd725b64a2a7c40588f0240dc868c","observation_id":"b90d72ee-6280-46d1-ae02-f1cfaf8a4bf7","resolution":{"observed_at":"2026-08-02T07:43:33.813874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-05T11:50:10.014003Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02208","snapshot_observed_at":"2026-08-02T07:43:33.938358Z","title":"criterion_id","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:33.938358Z"},"links":{"cited_paper":"/paper/2509.02208","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:b60248467eea827754a8087082f386e035f9dae0135ec1d7094c147484c6b629","observation_id":"43ace38b-6942-4848-ac4b-abb59379089c","resolution":{"observed_at":"2026-08-02T07:43:33.938358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:31.271033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.271033Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:5c92be86d2a3762427e6e12163fc2ab0932db9203aee50983f3a8c7e287c6f06","observation_id":"d307073a-6f3b-4733-b603-53b7b3bc5a33","resolution":{"observed_at":"2026-08-02T07:43:31.271033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:43:26.014553Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.014553Z"},"links":{"citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:4bea1d1d7d991841c28a53759ed9b3e24aae7bcc595ad668d5b0c0daf7440ca6","observation_id":"a08c4839-7f50-40b1-8dca-8061cac79deb","resolution":{"observed_at":"2026-08-02T07:43:26.014553Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.09142."}