{"as_of":"2026-08-14T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee5a7502495d916a3ab6e8b1d240bebb45511ba6eedf7b62d130b143b1aad619","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:18:05.098538Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07796/citation-record","integrity":"/paper/2608.07796/integrity","json":"/paper/2608.07796/citation-record.json","paper":"/paper/2608.07796"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.872899Z","title":"Sara Mahdavi, Jason Wei, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.872899Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e654cec9aaaa48a6cb260ec28af70385ab14e48c625556ec8b0c5b66294038ba","observation_id":"1e0a3630-579d-4c3c-8570-9287b20f47fd","resolution":{"observed_at":"2026-08-11T04:18:04.872899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-13T08:33:17.178696Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-11T04:18:04.878937Z","title":"Ca- pabilities of gpt-4 on medical challenge problems.ArXiv, abs/2303.13375, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.878937Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:d1b4561f6ee0e20d156762f7eefdf5a5936636f63ff0012e0e480d34140d3ede","observation_id":"aab619da-872e-4be0-98e0-0d27bc464a96","resolution":{"observed_at":"2026-08-11T04:18:04.878937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27470","last_updated":"2026-04-30T06:13:01Z","snapshot_observed_at":"2026-08-12T02:05:26.771562Z","submitted_at":"2026-04-30T06:13:01Z","title":"HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27470","snapshot_observed_at":"2026-08-11T04:18:04.885119Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.885119Z"},"links":{"cited_paper":"/paper/2604.27470","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:52742fa2e236e5c1a41085a5493b321771c2d08c3119ac26d5b8004ee0de00cb","observation_id":"f6492e97-6de6-4f42-94b9-e659bbb1d730","resolution":{"observed_at":"2026-08-11T04:18:04.885119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-11T04:18:04.890556Z","title":"Agentclinic: a multimodal agent benchmark to evaluate ai in simulated clinical environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.890556Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:d565f25e47d128f022164c537616932ae658f06a1c20f50c19fa332967ba5102","observation_id":"07b02a82-0118-4cf2-ac1b-cd63121a7d95","resolution":{"observed_at":"2026-08-11T04:18:04.890556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.896416Z","title":"Chen, Nigam H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.896416Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5961b0e5a6d8510000900172e4c624be33b4d68d9ce5ea2835a6e482a23a8eb6","observation_id":"df2d0518-e5a3-4c9c-8c85-e2176edae503","resolution":{"observed_at":"2026-08-11T04:18:04.896416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23802","snapshot_observed_at":"2026-08-11T04:18:04.903375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.903375Z"},"links":{"cited_paper":"/paper/2505.23802","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5539d83cb0235ce11c3a0e99d0715bc12a4851c9bbcdd1798fd42373629f81ef","observation_id":"9abbd290-9d57-47a7-b1ab-ed397e779b6f","resolution":{"observed_at":"2026-08-11T04:18:04.903375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.192668Z","title":"Fleming, Alejandro Lozano, William J","venue":null,"work_id":"19b8614e-c91c-4795-9333-793aa62ee2fc","year":null},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.909228Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:988685791ebb900ee5c1806761bbcde2dfb0b0a51bcdea6855e5148ac7352b05","observation_id":"c5bde9eb-c446-48e1-946e-b745809603d1","resolution":{"observed_at":"2026-08-11T04:18:06.198086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.176407Z","title":"EHRSHOT: An EHR benchmark for few-shot evaluation of foundation models","venue":null,"work_id":"f71fa218-d897-44cf-943f-b990079cf0ac","year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.918906Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:cb3bfed94ab6f351bc1bf84873ff529ed93f5263856a3044bf42bf50d2372264","observation_id":"07bd9161-6fe1-43f7-af31-a2fb4f17a51a","resolution":{"observed_at":"2026-08-11T04:18:06.181502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.923496Z","title":"Goodell, Yeasul Kim, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.923496Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:d84022630e384d64e3ceaf1efdda9176c3ea7ecb13b0edc87abad8d7eeacea3e","observation_id":"9fc8edf0-8ac5-4637-8985-5c8ec1048307","resolution":{"observed_at":"2026-08-11T04:18:04.923496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.150501Z","title":"FactEHR: A dataset for evaluating factuality in clinical notes using LLMs","venue":null,"work_id":"de06fc1c-a1c8-4dfb-be15-5264d894105c","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.928683Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:97639748b0dbd6071a87b6ba516c710772e2fc728641365fe4ac73cf1add21cb","observation_id":"28be1f8b-b501-487b-bec8-33411c68ae4e","resolution":{"observed_at":"2026-08-11T04:18:06.155944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.933388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.933388Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:9b21c502b62d1d6391b903d9da75bf5400290e68ed52df5185c7e574c6e72bb3","observation_id":"44ac507f-0bc8-47db-b8ff-0c6ed09f91e7","resolution":{"observed_at":"2026-08-11T04:18:04.933388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22771","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.876536Z","title":"Clindet-bench: Beyond abstention, evaluating judgment determinability of llms in clinical decision-making, 2026","venue":null,"work_id":"2bcd0d3b-c52b-469f-8ce8-89e54f7d0a59","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.938574Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ab618bc5f065c85268afb9bde4011cf18b0135c10f9a06bb929b4e41343f733a","observation_id":"48d680b0-10d3-4656-a690-5e0bd669d758","resolution":{"observed_at":"2026-08-11T04:18:05.884784Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.944313Z","title":"Knowing when to abstain: Medical llms under clinical uncertainty, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.944313Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:6a4a1b76988debb5e42372bb1e84bedd4ef22d8e7461d8a8e9809912b6ebb46f","observation_id":"b87c3d64-7ad3-4b52-be38-aebffb0afbfa","resolution":{"observed_at":"2026-08-11T04:18:04.944313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.948961Z","title":"MIMIC-IV.PhysioNet, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.948961Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:7e8f9724763b5db739dd0ac235e7ba480c4d0c0a44071aef2a20c8ada2546744","observation_id":"43ebba98-c420-43b3-abce-26910a08dcb7","resolution":{"observed_at":"2026-08-11T04:18:04.948961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.134618Z","title":"KDIGO clinical practice guideline for acute kidney injury.Kidney International Supplements, 2012","venue":null,"work_id":"a132e6c9-20d0-4c24-ae9c-a4335f677303","year":2012},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.953657Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:f73f8129dc985e08045fdc0d56daa81a52490a3c06db0e5e261536bfd34d173c","observation_id":"4f2122d6-4597-4aa2-8c45-a525dc7f9221","resolution":{"observed_at":"2026-08-11T04:18:06.139753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.119366Z","title":"Severe Sepsis and Septic Shock: Management Bundle Measure, 2020","venue":null,"work_id":"d9439498-fc37-4fd9-ae46-0759ed9dbc4f","year":2020},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.959306Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:025280566144bd616efaa7dd9bd45ca95a43c4ed08f00ba4f1ba11db5fdbf839","observation_id":"63e41441-645c-43ef-8576-de6f6b47927d","resolution":{"observed_at":"2026-08-11T04:18:06.124403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.12914","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.727110Z","title":"Carson, Simon J","venue":null,"work_id":"7d7423a0-24a9-4fe4-a8be-b6fec49e9d02","year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.964050Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:bfc5daeea4c0c3cd784bd2937ae1c68ccaa6e70db46ed155b9a5c0b94f27271b","observation_id":"8ea8b5d6-34d4-46ce-8c3e-3417f3e87546","resolution":{"observed_at":"2026-08-11T04:18:05.734652Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.968627Z","title":"Heidenreich, Biykem Bozkurt, David Aguilar, Larry A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.968627Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:b9bd6fe8dca3f3cc8e4b9b1b4938a0e8c3b947f1c38ef3dbb8a14fe01a2a5bc9","observation_id":"43ea4972-1390-4d7f-953b-53c4afbdd40c","resolution":{"observed_at":"2026-08-11T04:18:04.968627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.973607Z","title":"Evaluation and mitigation of the limitations of large language models in clinical decision-making.Nature medicine, 30(9):2613–2622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.973607Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:acd6849496aca9ded4c796a9ee93a016eb871dfe4f86ef34499aa38418b06184","observation_id":"413471c8-e0e3-4a25-8e47-333050d2c868","resolution":{"observed_at":"2026-08-11T04:18:04.973607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.084523Z","title":"Fidelity of medical reasoning in large language models.JAMA Network Open, 8(8):e2526021, 2025","venue":null,"work_id":"0d6b3eb1-147a-4bf3-80c4-f05d5700d55e","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.978555Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:7d045e3041fa54e2b7a4f9d2cfe61ea463f7ac9dfd22cc41d11a292fb9178638","observation_id":"70c2a474-1a14-4750-826f-08c1dc62dfd3","resolution":{"observed_at":"2026-08-11T04:18:06.089696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.983880Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.983880Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:9741f8094187e94618a677f214019ce359ea1e105a705d40052ab83135c6b292","observation_id":"04dd78d5-80a0-4c71-8eac-22daac6fd771","resolution":{"observed_at":"2026-08-11T04:18:04.983880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-11T04:18:04.988879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.988879Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:5dbe85199956d00f58ec11f105a0671241736f99f9436d61641e6ff7bf227939","observation_id":"04999547-2dfa-44c5-b2c1-ec4e214fdd19","resolution":{"observed_at":"2026-08-11T04:18:04.988879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.058570Z","title":"Rethinking clinical trials for medical ai with dynamic deployments of adaptive systems.npj Digital Medicine, 8(1):252, 2025","venue":null,"work_id":"971316b4-cc0f-4b3f-848f-26ec5257a659","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.993827Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:6c820747d2e355b9ec9ba2c1f25bdffdc5545bfa1bdecf32885682949f113da0","observation_id":"1c4cc808-7caa-4e87-bd11-7b4b10872e77","resolution":{"observed_at":"2026-08-11T04:18:06.063784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.041366Z","title":"Towards autonomous medical artificial intelligence agents.Nature, 2026","venue":null,"work_id":"7cab1e8f-79ab-4819-a282-c07fa32ca296","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.998701Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:3bb3e64c048ef867b503b140310903feb22fc063d5c7408fc4af1f402a6f2e89","observation_id":"64495769-61c8-48ea-bcaf-0da28849d1b8","resolution":{"observed_at":"2026-08-11T04:18:06.046887Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02568","last_updated":"2026-06-01T17:56:26Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:56:26Z","title":"ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents","version":1},"cited_work":{"arxiv_id":"2606.02568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.02568","snapshot_observed_at":"2026-08-11T04:18:05.618155Z","title":"ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents","venue":"cs.AI","work_id":"5d71129c-b020-4718-acd7-bed3345beb1a","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.004089Z"},"links":{"cited_paper":"/paper/2606.02568","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:09a10895184f9f584d3c4fa32877a129fd0d56e10e99440613ed630bd307b662","observation_id":"16eb80e7-2185-4d13-acf7-9c796a78c584","resolution":{"observed_at":"2026-08-11T04:18:05.623460Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.024589Z","title":"Ehrsql: A practical text-to-sql benchmark for electronic health records.Advances in Neural Information Processing Systems, 35:15589–15601, 2022","venue":null,"work_id":"ee90530e-5a53-419a-be27-e8fe3bfeef48","year":2022},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.009350Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:80a1fe7302e8160131ce7c752be57e9917f04f11a22ea70e11fac38b5d8ea3bc","observation_id":"63f2cc37-0d82-413c-8ee8-6f3967f1a688","resolution":{"observed_at":"2026-08-11T04:18:06.029635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.014524Z","title":"Ho, Carl Yang, and May Dongmei Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.014524Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ab7bc6854722747f0434b85ef5ac5158dc36e5bf1b1ad61fdb08cfefbd0b3bbb","observation_id":"2830aba6-c384-4e0d-b95e-c7d53dafa8eb","resolution":{"observed_at":"2026-08-11T04:18:05.014524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.993225Z","title":"Medagentbench: A virtual ehr environment to benchmark medical llm agents.NEJM AI, page AIdbp2500144, 2025","venue":null,"work_id":"bb1c2fc6-410c-4031-9142-7d8505d500f5","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.025743Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:2db1cb082c81103f2844a76264ec337d1874d49e8ac2531ec2206fd198e3367a","observation_id":"dab0d231-083f-4cdf-a0f6-f371171c61f7","resolution":{"observed_at":"2026-08-11T04:18:05.998772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.030913Z","title":"Pollard, Alistair Johnson, Edward Choi, Yugang Jia, and Jong Ha Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.030913Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:ff18ddc3c78dc146cca195fee6b613edfe6e27bcc033ce3e28c65ce62d1a403a","observation_id":"6543a633-4088-4e13-9b1a-90de44551bc0","resolution":{"observed_at":"2026-08-11T04:18:05.030913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23301","last_updated":"2026-06-22T13:14:21Z","snapshot_observed_at":"2026-08-14T01:02:15.436944Z","submitted_at":"2026-06-22T13:14:21Z","title":"EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23301","snapshot_observed_at":"2026-08-11T04:18:05.035371Z","title":"Ehr-complex: Benchmarking medical agents for complex clinical reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.035371Z"},"links":{"cited_paper":"/paper/2606.23301","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e3d8841b0b35ea3e7baedc26621b377b636ce50aa862bb9c15a5691a8fa00287","observation_id":"7597a7bb-d11b-4fe2-9576-b8adb4ae01ea","resolution":{"observed_at":"2026-08-11T04:18:05.035371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02240","last_updated":"2026-05-04T05:32:25Z","snapshot_observed_at":"2026-08-11T12:30:29.467786Z","submitted_at":"2026-05-04T05:32:25Z","title":"PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02240","snapshot_observed_at":"2026-08-11T04:18:05.040639Z","title":"Mohiuddin, Austin J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.040639Z"},"links":{"cited_paper":"/paper/2605.02240","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e82cde20110bb1f3a04dc10fadbdc297b0a7cd6688054e6547f18bffa61a4964","observation_id":"224a539f-3ed6-4e74-aa62-ab36c6f20964","resolution":{"observed_at":"2026-08-11T04:18:05.040639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09322","last_updated":"2026-07-10T12:04:31Z","snapshot_observed_at":"2026-08-14T12:46:48.254424Z","submitted_at":"2026-07-10T12:04:31Z","title":"LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making","version":1},"cited_work":{"arxiv_id":"2607.09322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09322","snapshot_observed_at":"2026-08-11T04:18:05.490656Z","title":"LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making","venue":"cs.AI","work_id":"c51bd84b-17ba-46d6-9723-ecfb96556bf7","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.046139Z"},"links":{"cited_paper":"/paper/2607.09322","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:c15a0244f88e7073c6f30e28648a10d4071ef7e225aec4496fa42bd657eaeffb","observation_id":"6b953d02-81ef-47eb-b079-2255cc91aa7c","resolution":{"observed_at":"2026-08-11T04:18:05.497141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41597-026-06639-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.172426Z","title":"A dataset for addressing patient’s information needs related to clinical course of hospitalization.Scientific Data, 13:523, 2026","venue":null,"work_id":"aa451062-c9a6-44e7-b180-a93291d14180","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.051798Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e98a5c8870c43a055be6081badda93125f71fa5153f3ce56df59e36f66f8859e","observation_id":"f3d495fd-766c-4781-be2e-9aef8dab3563","resolution":{"observed_at":"2026-08-11T04:18:05.177807Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.056931Z","title":"Clicare: Grounding large language models in clinical guidelines for decision support over longitudinal cancer electronic health records, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.056931Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:23bd728d3bd0fb5fb002a0ee3a5a745434291d5b50a27f50e20a965341d90d36","observation_id":"97419ff7-0b50-48a1-994e-49e842533e43","resolution":{"observed_at":"2026-08-11T04:18:05.056931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.clinicalnlp-1.62","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.153028Z","title":"Overview of the EHRSQL 2024 shared task on reliable text-to-SQL modeling on electronic health records","venue":null,"work_id":"d1732ea2-6460-4342-8010-5b25110b640e","year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.062472Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:8746106604b958fb2b9891cbacaf77577fe1662c7b4a8a0c82be6f27cc374f75","observation_id":"c9f1cc4a-fb8b-46c7-a679-da8517229624","resolution":{"observed_at":"2026-08-11T04:18:05.160643Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.067246Z","title":"Agents’ last exam.arXiv preprint arXiv:2606.05405, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.067246Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:e863bc063e4d75910a299129a3f3119ced1d0df4a35ce746b19cb51152448cdc","observation_id":"f98dbefe-c8ee-4f47-9840-35396d12cd74","resolution":{"observed_at":"2026-08-11T04:18:05.067246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.977882Z","title":null,"venue":null,"work_id":"82d1bdd4-35d0-4afa-9ecc-cc604ad193cd","year":2025},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.072050Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:7db0f1c226372bf5b1a1bd504fd5ac12b65fa970c9bb03bda56832a944ed9c3a","observation_id":"523c0aea-efeb-4c12-93b7-959dce59732f","resolution":{"observed_at":"2026-08-11T04:18:05.982709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.961281Z","title":"A framework for formalizing LLM agent security, 2026","venue":null,"work_id":"5502dd92-f3a2-4c4a-a89e-35a2e3a656b4","year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.077041Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:9f9290938796fd40e9701948c056beb88f9979bba7efb790b7a9ee41e70c978e","observation_id":"aa71fc2c-dba8-4781-b4ed-742ae9b7e12e","resolution":{"observed_at":"2026-08-11T04:18:05.967333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09937","last_updated":"2026-04-10T22:33:39Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-10T22:33:39Z","title":"HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09937","snapshot_observed_at":"2026-08-11T04:18:05.082534Z","title":"Steinberg, Michael Wornow, Taeil Kim, Haroun Zakaria Ahmed, Peter V","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.082534Z"},"links":{"cited_paper":"/paper/2604.09937","citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:352ea422fe182b5fc6401e7b04a6985e7d35fe19ec7c618cb60632ccaf689d87","observation_id":"6575a0b8-3a97-420a-a90f-4e59ba85e904","resolution":{"observed_at":"2026-08-11T04:18:05.082534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.088248Z","title":"MIMIC-IV-Note: Deidentified free-text clinical notes.PhysioNet, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.088248Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:76157bda9cdc4ba88e4d87819d900615eb5b2549a4494487d2bb61283ed78adc","observation_id":"615a1e2e-7273-4776-9865-ac2b14d826e1","resolution":{"observed_at":"2026-08-11T04:18:05.088248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.093469Z","title":"MIMIC-IV-ED.PhysioNet, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.093469Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:9b04f1af2413ad597ac0b09ab8b4000a1ff23dc959a73c44b45e86e59a839d9b","observation_id":"99436196-b298-47f4-9d8f-b72483c8c32c","resolution":{"observed_at":"2026-08-11T04:18:05.093469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7620.7160","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:05.316622Z","title":"first qualifying","venue":null,"work_id":"e90b2f22-1300-43f4-8b6f-187bfdd63aef","year":2020},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.098538Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:8a56c7f787d6996f8d64f61799274ce4a556625563fc04e2fb8efe0225eedfc1","observation_id":"2eee86b0-6ca5-44c6-a42f-bafa41da513d","resolution":{"observed_at":"2026-08-11T04:18:05.326837Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:06.009145Z","title":null,"venue":null,"work_id":"7853303c-c65a-4752-88ec-2b211c9a4e70","year":2024},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":1245,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:05.020114Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:06f88a09a6a37cc37b949993572e6ba546df1d6908b686b7b91c5ca61a2bbe56","observation_id":"50c5bbdf-3c8e-417e-9b51-c07d6e7a63d9","resolution":{"observed_at":"2026-08-11T04:18:06.014145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:04.913940Z","title":"URLhttps://doi.org/10.1609/aaai.v38i20.30205","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:04.913940Z"},"links":{"citing_paper":"/paper/2608.07796"},"observation_digest":"sha256:4ba8898fbd72016e35df1d8c7e98e0e8bfbe8277f7f222472925523b185010b9","observation_id":"58681bb1-a230-4263-b6a9-a4499413e61c","resolution":{"observed_at":"2026-08-11T04:18:04.913940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07796","last_updated":"2026-08-07T22:39:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T10:36:41.368811Z","submitted_at":"2026-08-07T22:39:13Z","title":"CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":6,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.07796."}