{"as_of":"2026-08-14T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:399ee46eb4b00fdd950829e9ca533a2223b043a12a51011db2cc87bc18506f1f","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:55:57.054222Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:18:04.903375Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-06T21:27:53.792124Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02975","last_updated":"2025-06-30T18:00:52Z","snapshot_observed_at":"2026-08-10T15:00:48.764003Z","submitted_at":"2025-06-30T18:00:52Z","title":"Introducing Answered with Evidence -- a framework for evaluating whether LLM responses to biomedical questions are founded in evidence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:53.792124Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2507.02975"},"observation_digest":"sha256:270f72509f688135548f1a9e5e487e4844b2308ddecc5ea0d7e5236af80c2380","observation_id":"45f4b5c5-feec-4703-b60f-3914bc00a949","resolution":{"observed_at":"2026-08-06T21:27:53.792124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-06T10:46:10.515710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23486","last_updated":"2025-08-13T08:51:25Z","snapshot_observed_at":"2026-08-12T13:14:40.144988Z","submitted_at":"2025-07-31T12:10:00Z","title":"A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:46:10.515710Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2507.23486"},"observation_digest":"sha256:09f440d2984e66e37949e5262af6fbbcd3f95a5343464a68bfec76352367cc7d","observation_id":"4cd591a4-3e82-4aee-904a-b4e9ae152850","resolution":{"observed_at":"2026-08-06T10:46:10.515710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-04T11:34:03.183686Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04033","last_updated":"2026-06-22T22:02:33Z","snapshot_observed_at":"2026-08-13T12:47:04.185539Z","submitted_at":"2025-10-05T04:52:26Z","title":"A global log for medical AI","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:34:03.183686Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2510.04033"},"observation_digest":"sha256:23496f6ca05138e8b29342546d6535f323b63e5929bd961445fd07a2512d404b","observation_id":"11e99d4d-feee-4287-ac54-ff0cd2a5ef8f","resolution":{"observed_at":"2026-08-04T11:34:03.183686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2512.19691","last_updated":"2026-04-13T08:00:46Z","snapshot_observed_at":"2026-07-31T18:31:36.321575Z","submitted_at":"2025-12-22T18:59:34Z","title":"Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T20:21:40.867354Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2512.19691"},"observation_digest":"sha256:e526642e5831f9e01fa948e19509696e39c7c7631b9e4865e0c7d858616fe3d1","observation_id":"cc95d819-ab69-4289-91ed-443b94ba985f","resolution":{"observed_at":"2026-05-16T20:23:23.364363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2512.20983","last_updated":"2026-04-07T04:41:41Z","snapshot_observed_at":"2026-08-11T02:10:43.823704Z","submitted_at":"2025-12-24T06:17:21Z","title":"Automatic Replication of LLM Mistakes in Medical Conversations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T20:25:24.722562Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2512.20983"},"observation_digest":"sha256:db8e8f8c146902fb9fce8cf4aa9d8af2fda0297b3de2327cd9d4e657c17dc0e7","observation_id":"fddf0ff6-8b95-4fdb-ae1e-8ecceac2429b","resolution":{"observed_at":"2026-05-16T20:28:24.177713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2604.02359","last_updated":"2026-03-20T04:31:03Z","snapshot_observed_at":"2026-08-13T20:39:38.275039Z","submitted_at":"2026-03-20T04:31:03Z","title":"Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T09:06:33.531027Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2604.02359"},"observation_digest":"sha256:11bc60471b6a973313902d59c82417e2e7f5d1aa1f702067615588c9ae3c8502","observation_id":"efeacace-d7dc-428f-b398-55a72c9469c7","resolution":{"observed_at":"2026-05-15T09:09:53.374917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2604.11133","last_updated":"2026-04-15T02:31:20Z","snapshot_observed_at":"2026-08-01T02:09:41.306280Z","submitted_at":"2026-04-13T07:44:41Z","title":"How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:21.704608Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2604.11133"},"observation_digest":"sha256:4275eb79e18d39653c0dc583c4e27453dc2b0eaae1244e6623f05f67582087d6","observation_id":"176be442-07bd-44c1-a6a2-1d62c26af238","resolution":{"observed_at":"2026-05-11T10:01:03.373551Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2604.24700","last_updated":"2026-04-27T17:04:17Z","snapshot_observed_at":"2026-08-11T03:23:03.664761Z","submitted_at":"2026-04-27T17:04:17Z","title":"Green Shielding: A User-Centric Approach Towards Trustworthy AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T03:43:54.896449Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2604.24700"},"observation_digest":"sha256:2d669fbefab20fbe8fc66c5d4078caddef69f40dc0ccbbd7defc2764d9d5b1fe","observation_id":"327c5508-4d08-437b-88e3-682553db506d","resolution":{"observed_at":"2026-05-11T21:56:24.527571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.04012","last_updated":"2026-05-10T21:01:37Z","snapshot_observed_at":"2026-08-02T05:52:52.199459Z","submitted_at":"2026-05-05T17:36:12Z","title":"SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:17:39.923337Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.04012"},"observation_digest":"sha256:b2c0879e6e5d950a047c46261c0e9f5a01f219f2ac7d8f307fdb91112769c4ed","observation_id":"6e0e4844-4077-49ab-a851-21f86558be09","resolution":{"observed_at":"2026-05-11T23:46:53.503600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.04012","last_updated":"2026-05-10T21:01:37Z","snapshot_observed_at":"2026-08-02T05:52:52.199459Z","submitted_at":"2026-05-05T17:36:12Z","title":"SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:21:16.825681Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.04012"},"observation_digest":"sha256:1244b50656634abd396c9604294a95cf1a4bd3ac2e2f4dd360f4820e5cff96d7","observation_id":"d561dc02-1a1b-4291-9152-86bdca298f24","resolution":{"observed_at":"2026-05-12T07:41:42.864862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.08445","last_updated":"2026-05-08T20:12:14Z","snapshot_observed_at":"2026-08-11T22:26:39.127469Z","submitted_at":"2026-05-08T20:12:14Z","title":"Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:26:28.419570Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.08445"},"observation_digest":"sha256:2c14958bed42ed821b32f87799e02f3ddcf00e70768dafc1625d7961d617af69","observation_id":"1cb41f50-496a-47e3-abb4-b9fbe9bf493a","resolution":{"observed_at":"2026-05-12T07:56:36.287260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.08685","last_updated":"2026-05-09T04:49:56Z","snapshot_observed_at":"2026-08-02T14:44:33.851541Z","submitted_at":"2026-05-09T04:49:56Z","title":"Event Fields: Learning Latent Event Structure for Waveform Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:48.039349Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.08685"},"observation_digest":"sha256:7194498727e43beb8f784b38b2707a9572231df0951df336e2b5a6d33bf6aa62","observation_id":"e8838776-c841-4e93-b451-6ca2540bee98","resolution":{"observed_at":"2026-05-12T08:06:31.984899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.09584","last_updated":"2026-05-10T14:51:31Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:51:31Z","title":"CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:32:16.930291Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.09584"},"observation_digest":"sha256:a8b2eb8bfeaab598a5483b6e303e3bf03a5af2f814baca6ddd798ca06deee8cf","observation_id":"aad9683c-c57b-4bdb-b23b-a2ceec53f2c0","resolution":{"observed_at":"2026-05-12T06:11:23.506120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.09675","last_updated":"2026-05-10T17:45:01Z","snapshot_observed_at":"2026-08-13T19:14:46.496767Z","submitted_at":"2026-05-10T17:45:01Z","title":"CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:41.650948Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.09675"},"observation_digest":"sha256:a6dba644452359ac7e0593b7f2fb4c69ab69a87167823b8ec63f156766789cae","observation_id":"5a1ce8a6-9fc1-44fc-a5ce-6d63febeb983","resolution":{"observed_at":"2026-05-12T07:41:46.226036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.09765","last_updated":"2026-05-10T21:25:41Z","snapshot_observed_at":"2026-08-14T10:24:40.518725Z","submitted_at":"2026-05-10T21:25:41Z","title":"WISTERIA: Learning Clinical Representations from Noisy Supervision via Multi-View Consistency in Electronic Health Records","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:17:54.498339Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.09765"},"observation_digest":"sha256:d8ff6af56899958b5d17b18f6d18f03b191fe91297d7a088b7bb3c1e63ac4bbf","observation_id":"c6de4e66-d417-4eeb-aa60-cd40fb5d06c2","resolution":{"observed_at":"2026-05-12T07:41:45.088746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-14T08:38:33.823747Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-13T03:09:02.902912Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:c8c557e42bf6b17edaa4526ee1da560f324902f6f7ee7d99f38251604489c517","observation_id":"fa76b768-a8be-47a8-b2fb-57d57c8c3083","resolution":{"observed_at":"2026-05-13T03:12:09.414953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-14T08:38:33.823747Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":2},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:02.135970Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:d010f31f20e8f857561c6c00b575d88e68d06da90e87fbddc480b0379a43614f","observation_id":"d81f6e33-e0ee-4a38-82fb-3d17b56c1898","resolution":{"observed_at":"2026-05-14T21:02:58.194611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.16679","last_updated":"2026-05-19T05:51:20Z","snapshot_observed_at":"2026-08-14T02:37:35.642083Z","submitted_at":"2026-05-15T22:34:31Z","title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T17:45:02.896703Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.16679"},"observation_digest":"sha256:53a2e4aeddb02d3d99c6820322d66588c9be490a486ddc75712961bb05898ff1","observation_id":"744597a7-4cad-4739-9e57-cd78a33353af","resolution":{"observed_at":"2026-05-20T17:48:48.910341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2605.17765","last_updated":"2026-05-18T02:32:50Z","snapshot_observed_at":"2026-08-02T07:46:25.913418Z","submitted_at":"2026-05-18T02:32:50Z","title":"AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T12:06:33.875494Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2605.17765"},"observation_digest":"sha256:873af1a0003098b830f6fee4d46c05e101dab01020ff2c8c88e72cb8ffabe8e9","observation_id":"191a7621-23b8-420d-ac62-46b885acc01f","resolution":{"observed_at":"2026-05-20T12:08:15.521584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2606.01961","last_updated":"2026-06-03T05:43:27Z","snapshot_observed_at":"2026-08-07T15:01:13.401479Z","submitted_at":"2026-06-01T09:22:55Z","title":"AutoMedBench: Towards Medical AutoResearch with Agentic AI Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.017263Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2606.01961"},"observation_digest":"sha256:56971d24ed1487af6d0823980a4af2c02a7b1b9860819c9aab62859e481fbcfa","observation_id":"09695644-9950-4a37-a589-a75502a21ca0","resolution":{"observed_at":"2026-07-01T23:06:21.116582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2606.07853","last_updated":"2026-06-05T21:29:39Z","snapshot_observed_at":"2026-08-02T04:31:19.934605Z","submitted_at":"2026-06-05T21:29:39Z","title":"Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:16.052239Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2606.07853"},"observation_digest":"sha256:75d53a71a19d4beefbedad64eb30836ca7e08cc22de102af903ce33d3e6874b0","observation_id":"62754d03-7ef2-4445-b55c-ad591e931ff6","resolution":{"observed_at":"2026-07-02T19:07:17.939001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2606.31608","last_updated":"2026-06-30T12:56:42Z","snapshot_observed_at":"2026-08-12T17:17:52.807634Z","submitted_at":"2026-06-30T12:56:42Z","title":"CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-01T05:33:52.027771Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2606.31608"},"observation_digest":"sha256:62d3c24c8ea6bb156fd23e5215ad1b755e75fe0b117399b2cf2b6caae081cb4d","observation_id":"26c2190a-afd8-435c-a37b-521b4d7a93bf","resolution":{"observed_at":"2026-07-01T10:25:41.545608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2607.02175","last_updated":"2026-07-02T13:46:24Z","snapshot_observed_at":"2026-08-06T06:22:09.080934Z","submitted_at":"2026-07-02T13:46:24Z","title":"A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-03T14:05:58.062268Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2607.02175"},"observation_digest":"sha256:8932e4ca6bfe19954afb9ccff3907aa27b0fd4b0f3580a589d105bf6d4f38f3f","observation_id":"d830393c-29e0-477b-af91-f4f255af879b","resolution":{"observed_at":"2026-07-03T14:08:21.387402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2607.07761","last_updated":"2026-07-08T15:19:37Z","snapshot_observed_at":"2026-08-06T23:41:57.869470Z","submitted_at":"2026-07-08T15:19:37Z","title":"Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning","version":1},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-07-10T18:50:22.827472Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2607.07761"},"observation_digest":"sha256:eb19ef027c7838cf19afc2a39da386ef6ce2846f548e559e271b743d0279f21e","observation_id":"4975a1b2-199d-4813-9899-ab15e37aa937","resolution":{"observed_at":"2026-07-10T18:57:31.509556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":"2505.23802","doi":"10.48550/arxiv.2505.23802","metadata_source":"pith","pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802","venue":"cs.CL","work_id":"10fde960-6858-49b3-a93a-c1429deb1170","year":2025},"citing_paper":{"arxiv_id":"2607.08257","last_updated":"2026-07-09T09:03:42Z","snapshot_observed_at":"2026-08-05T09:43:46.191331Z","submitted_at":"2026-07-09T09:03:42Z","title":"MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T10:30:27.256710Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2607.08257"},"observation_digest":"sha256:9c055ed98a09396b8da524908a924ed5dacad5aaa233a862e59725859a47cc4d","observation_id":"c54336c8-775b-4811-a61c-ccb61518a1c0","resolution":{"observed_at":"2026-07-10T10:37:01.669041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"Medhelm: Holistic evaluation of large language models for medical tasks.arXiv preprint arXiv:2505.23802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-08-12T13:35:16Z","snapshot_observed_at":"2026-08-14T10:14:51.367851Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:ffb3f7bb586f81ad112478e101ae59cb4a51ec2629101be5352f1bb2291da5b1","observation_id":"da873bf5-463f-41dd-8348-386ac3616068","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-01T13:50:41.494173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18999","last_updated":"2026-07-26T15:35:54Z","snapshot_observed_at":"2026-08-06T16:23:45.944884Z","submitted_at":"2026-07-21T11:32:41Z","title":"MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T13:50:41.494173Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2607.18999"},"observation_digest":"sha256:4cf50f4a1c1bf8cf9fecce0ec3aa7ea4e0e95ddc358b4887e9433751c0ef293d","observation_id":"b7b69def-859d-41e1-bfc4-b7e23a9c5660","resolution":{"observed_at":"2026-08-01T13:50:41.494173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-04T05:39:50.996391Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02520","last_updated":"2026-08-03T17:17:29Z","snapshot_observed_at":"2026-08-12T09:26:41.139229Z","submitted_at":"2026-08-03T17:17:29Z","title":"MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T05:39:50.996391Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2608.02520"},"observation_digest":"sha256:41354d7bfbb3ecac86de72520dc485da27bbd6659d8711c470a7a4703d941d3e","observation_id":"98e3ffa5-fa46-45a7-86ad-a53a6fa0da2a","resolution":{"observed_at":"2026-08-04T05:39:50.996391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-11T04:18:04.903375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.903375Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5539d83cb0235ce11c3a0e99d0715bc12a4851c9bbcdd1798fd42373629f81ef","observation_id":"9abbd290-9d57-47a7-b1ab-ed397e779b6f","resolution":{"observed_at":"2026-08-11T04:18:04.903375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23802/citation-record","integrity":"/paper/2505.23802/integrity","json":"/paper/2505.23802/citation-record.json","paper":"/paper/2505.23802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:00.160548Z","title":"https://paperswithcode.com/sota/question-answering-on-medqa-usmle","venue":null,"work_id":"da1b0d9b-eca0-440f-9b5d-354578736ef4","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.037178Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:1a6d84d6b790e39f30094ef9a0b5d62e49940c47428cfcd91f904c2cf8161da8","observation_id":"7b74bc32-96c1-4b7f-8669-1bc0d9968802","resolution":{"observed_at":"2026-08-07T13:56:00.250449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/23333928241234863","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Health Services Research and Managerial Epidemiology11, 23333928241234863 (2024) https://doi.org/10.1177/23333928241234863","venue":"Health Services Research and Managerial Epidemiology","work_id":"a0df5af9-5bd7-4a22-adfe-d86de31db2df","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.109132Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:f1cbccc7c5d930b56fd4c7454b61cb08652b74b9654c75640dbbeada4dd39bdb","observation_id":"568138c2-2b31-4ee5-a09a-b0700b205b85","resolution":{"observed_at":"2026-08-07T13:55:57.476349Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.944848Z","title":"HealthTech Magazines (2024)","venue":null,"work_id":"d1ef780d-a674-40e3-a7c2-c4eabc8f8dba","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.154334Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:0ad31e7c3af9e356074d7661d9529f10902063752f5a243d2b0d9957861db15d","observation_id":"7b3a2322-be3d-46d0-924c-858f51700a29","resolution":{"observed_at":"2026-08-07T13:56:00.063684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/bju.16676","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"BJU International (2025) https://doi.org/10.1111/bju.16676","venue":"British Journal of Urology","work_id":"4da498e0-a058-42c5-b7a7-040743e5d29f","year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.201731Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:968290d15c9daa924c1c18dfb773ae6d62fb4ea6634b1d960296e4de4f383c3e","observation_id":"7d2b719d-8dc4-45c8-8fe1-b5924d099dd6","resolution":{"observed_at":"2026-08-07T13:55:57.288067Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-13T08:33:17.178696Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-07T13:55:55.235160Z","title":"https://arxiv.org/abs/2303.13375","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.235160Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:21e95cd4f52c7fe1759c071cbf0bd3ad89f4bb56a12b8cd5bf4b7e20036f152b","observation_id":"61c56e8e-d78d-48f4-b1d8-87f74ddf7fc9","resolution":{"observed_at":"2026-08-07T13:55:55.235160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:55.293538Z","title":"NEJM AI2(2) (2025) https://doi.org/10.1056/AIe2401235","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.293538Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:e313e46952b7496f2c930b463dbf25e7bf6780dba54ab8ab883a8db5b9ac9adb","observation_id":"61ba22e9-9f08-4106-a1fe-02714bf0ac59","resolution":{"observed_at":"2026-08-07T13:55:55.293538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.739058Z","title":null,"venue":null,"work_id":"c9d6f24d-d854-4e57-b8d0-90a8f1e968b9","year":2022},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.401905Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:c529ed93cdc9e7be41764a901d712d271399221e5c7ffb3fb16dfdc3ba82e175","observation_id":"69ff72cd-ced6-40ec-aeea-fdba3dc77e35","resolution":{"observed_at":"2026-08-07T13:55:59.861448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:55.482216Z","title":"JAMA333(4), 319–328 (2025) https://doi.org/10.1001/jama.2024.21700","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.482216Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:fd77727d89c7bf395d54072bdc92c8af2655ec52523ae151dd54f6fa6802f95f","observation_id":"1b78878b-a970-4333-b291-6e3e91eb25ca","resolution":{"observed_at":"2026-08-07T13:55:55.482216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.455068Z","title":"Nature Medicine30, 2613–2622 (2024)","venue":null,"work_id":"8484001f-13bc-440a-a948-d72d52626ed3","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.559160Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:66c739577b18bccd4b37b5d0366529b47055f8b11b9d83055d6bcdc6783eb31e","observation_id":"0764be9c-7c4e-4c8e-bd99-f59e60c3cc90","resolution":{"observed_at":"2026-08-07T13:55:59.596835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.206873Z","title":"https://cdn.openai.com/pdf/ 27 bd7a39d5-9e9f-47b3-903c-8b847ca650c7/healthbench_paper.pdf","venue":null,"work_id":"0119231e-34c9-4e11-b750-c20be82949d2","year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.647958Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:4f9eee3131791a2ff9b7459082177c6db7eabe6a63a80febe9202ef8e8b3f9b4","observation_id":"53de62e3-c945-498e-a4cf-6801f6846bde","resolution":{"observed_at":"2026-08-07T13:55:59.328508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.934447Z","title":"Transactions on Machine Learning ResearchTMLR(2023)","venue":null,"work_id":"cd7ba71c-d8e8-448e-afcf-90baa8b7b86d","year":2023},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.729671Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:2c95fc8cd1458ca8192072fde3b0f26cbaaeb834400b8102890de289aac46913","observation_id":"ee5a201a-ea4d-4a08-898e-a9ed49716b6a","resolution":{"observed_at":"2026-08-07T13:55:59.077154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:55.813709Z","title":"medRxiv (2025) https://doi.org/10.1101/2025.04.22.25326219","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.813709Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:1f037cac669ab54bbebcf88716a779849829c65e9f00a6093f53a4bb5e4bac68","observation_id":"97519918-38ee-4b73-a07e-8445f8444089","resolution":{"observed_at":"2026-08-07T13:55:55.813709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-13T01:26:47.642290Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-07T13:55:55.898652Z","title":"https://arxiv.org/abs/2009.13081","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.898652Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:24a945a38317d4ec237c15d574c609bb0260b2509b06065087a21c6f7868ac0a","observation_id":"f6d0eac4-e0cd-498c-bd2c-e20e8168f87f","resolution":{"observed_at":"2026-08-07T13:55:55.898652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16178","last_updated":"2025-03-18T18:04:32Z","snapshot_observed_at":"2026-08-13T01:39:44.783017Z","submitted_at":"2024-12-09T21:58:27Z","title":"Context Clues: Evaluating Long Context Models for Clinical Prediction Tasks on EHRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16178","snapshot_observed_at":"2026-08-07T13:55:55.988534Z","title":"https://arxiv.org/abs/2412.16178","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:55.988534Z"},"links":{"cited_paper":"/paper/2412.16178","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:89a8aaadf769ea204810b8f46c4f5775fe527b6993b1c38a74ebae361d4dc3ac","observation_id":"c9a08a34-5230-429a-84b7-f606d98e64af","resolution":{"observed_at":"2026-08-07T13:55:55.988534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T13:55:56.095187Z","title":"https://arxiv.org/abs/2206.04615","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.095187Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:c92a97f7c2638223bf40a9211701670a195139dc5d176aba52884ca346226d7d","observation_id":"4555d654-60d5-4db3-8eee-3727717d765a","resolution":{"observed_at":"2026-08-07T13:55:56.095187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00716","last_updated":"2024-10-16T09:18:58Z","snapshot_observed_at":"2026-08-13T00:22:11.357948Z","submitted_at":"2024-04-25T15:51:06Z","title":"Large Language Models in the Clinic: A Comprehensive Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00716","snapshot_observed_at":"2026-08-07T13:55:56.187110Z","title":"arXiv preprint arXiv:2405.00716 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.187110Z"},"links":{"cited_paper":"/paper/2405.00716","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:5d6d9a09d8ce274b956ac85d1127ca67515d2b1900335ce7c9dbac62bdb7c1d5","observation_id":"39d9ae3e-d96b-486d-8980-1520ef343181","resolution":{"observed_at":"2026-08-07T13:55:56.187110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.723644Z","title":"Nature Communications15(1), 8384 (2024)","venue":null,"work_id":"bf3361ce-5709-49e1-8bd9-65d65ccf1879","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.253770Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:d05b29728d5d07c62f690d69b02768bc15739315c6b5ebc57951cec2c48dcd61","observation_id":"8be8adeb-4f02-43d0-82ef-6a01a5923047","resolution":{"observed_at":"2026-08-07T13:55:58.835599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15076","last_updated":"2022-06-30T07:15:45Z","snapshot_observed_at":"2026-08-13T15:13:43.396371Z","submitted_at":"2022-06-30T07:15:45Z","title":"BigBIO: A Framework for Data-Centric Biomedical Natural Language Processing","version":1},"cited_work":{"arxiv_id":"2206.15076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.15076","snapshot_observed_at":"2026-08-07T13:55:57.591404Z","title":"BigBIO: A Framework for Data-Centric Biomedical Natural Language Processing","venue":"cs.CL","work_id":"e0633c12-bfbf-482d-855d-f0b9523e8fba","year":2022},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.334863Z"},"links":{"cited_paper":"/paper/2206.15076","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:39b3ede0ef06f95cffba2556e82d1efbbcfe78d79990aa41b0e4e9cdb4bfeee6","observation_id":"dedf2ba1-a605-4bae-82a4-68ccf9f18939","resolution":{"observed_at":"2026-08-07T13:55:57.676197Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T13:55:56.416173Z","title":"https://arxiv.org/abs/2411.15594","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.416173Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:55071d2650414a6f88fdd4faa36ee0812ba18ee169523e29a2de2217acce70a6","observation_id":"292e2100-bec1-4525-b1d0-377a389f695c","resolution":{"observed_at":"2026-08-07T13:55:56.416173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.552464Z","title":"Evidently AI","venue":null,"work_id":"6c35bcdf-9641-47b7-b879-e115a170e780","year":2025},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.521765Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:8f45da4d07c785f3ddf97010ed775e6d637c72b4c168b58278bf3ea758710a76","observation_id":"5cfad890-8fb4-4fca-b335-0d262294c47f","resolution":{"observed_at":"2026-08-07T13:55:58.629428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T13:55:56.617692Z","title":"https://arxiv.org/abs/2406.10229","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.617692Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:d6b8321eba88ea203f850b4d00192c1e6457b562aa16cc13d312bb5c75849da0","observation_id":"bc38713e-f5ab-4a85-86d9-645a25d093ce","resolution":{"observed_at":"2026-08-07T13:55:56.617692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.308410Z","title":"https://arxiv.org/abs/2404","venue":null,"work_id":"a176241a-f770-4283-911e-9a2bb7c5b5c2","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.705585Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:182219ebebbd30a1d18cd8c978286adcaa64a7a5ae1c5ba6dc9b8abbbfb7c907","observation_id":"92e6df23-cbb8-4759-af2d-1c5dc548eb64","resolution":{"observed_at":"2026-08-07T13:55:58.423463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.078727Z","title":"https: //github.com/confident-ai/deepeval","venue":null,"work_id":"8ee68ae8-f38e-4a3e-a9ed-ca4b2aab4077","year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.770801Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:bdaa6a873138c362733bf02a483fd7fee16b19779ec487599e1b426357946538","observation_id":"24f9a1af-fbe8-479d-bf54-d98ce4e236d5","resolution":{"observed_at":"2026-08-07T13:55:58.184629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-07T13:55:56.873804Z","title":"https: //arxiv.org/abs/2303.08896","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.873804Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:3e4bde62deec7e8958b9863485ae3c7a5a89201a3f8deebad38836945a574cbf","observation_id":"64b6275b-cf4b-4de5-9aed-525cc8e0aa02","resolution":{"observed_at":"2026-08-07T13:55:56.873804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-13T11:35:21.266527Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-08-07T13:55:56.937334Z","title":"https://arxiv.org/abs/ 2305.14251","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.937334Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:120b999db8e1cbfad041abaa43fe66de13589d7e1abce0a4f801df3efdbded73","observation_id":"4e2ebdfd-c285-49c6-9ae9-70387e27c35c","resolution":{"observed_at":"2026-08-07T13:55:56.937334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:57.886777Z","title":"MPRA Paper No","venue":null,"work_id":"8902f5e1-6b64-4c41-8e64-109a8cbfe5fa","year":2016},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.982200Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:16ac61a337e2cdec18d4a929d981c3ffab5ce11e07ea22bce9569bddfc01b30d","observation_id":"6d7d5f55-4cf7-4690-8208-b40292fd357d","resolution":{"observed_at":"2026-08-07T13:55:57.961204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:57.054222Z","title":"Nature Medicine30(4), 1134–1142 (2024) https://doi.org/ 10.1038/s41591-024-02855-5 31","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.054222Z"},"links":{"citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:27e7ac3ac806d27d5f59711f59d2a0ea4d072de7a594f9b99a340fda50d38a01","observation_id":"d093a4a1-64ad-4481-bf40-2ec07e16a1a7","resolution":{"observed_at":"2026-08-07T13:55:57.054222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 29 inbound Pith citation observations for arXiv:2505.23802."}