{"as_of":"2026-08-09T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:022abbf5a11764a19c0cd35e46f58803b17b73144569a0eac26ce40d2e2e3e14","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:47:08.786613Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28677/citation-record","integrity":"/paper/2607.28677/integrity","json":"/paper/2607.28677/citation-record.json","paper":"/paper/2607.28677"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:05.752339Z","title":"Performance of a large language model on the reasoning tasks of a physician","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:05.752339Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:8fd5722a6f190a5a9aff4cac473132506a75ffa3ec5b2870fb14d19de6efa245","observation_id":"de96c79e-4a40-40a5-8179-5e64eac28911","resolution":{"observed_at":"2026-08-03T00:47:05.752339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:05.840374Z","title":"Reliability of LLMs as medical assistants for the general public: a randomized preregistered study","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:05.840374Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:b7e66f38a9e70d9c4abe5290cfcc9f48f803b4fc0996fcc0fe0ce5c158fe9965","observation_id":"b74099ce-fab3-4452-b685-1b63fff2d913","resolution":{"observed_at":"2026-08-03T00:47:05.840374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:05.945108Z","title":"Measuring what Matters: Construct Validity in Large Language Model Benchmarks2025 November 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:05.945108Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:89c5b6c42af78df4d5b0caad97bf1a25a85a5ce3431c63c65014b0f4d5fff014","observation_id":"7b945728-8bc2-4755-9509-9281d59801e5","resolution":{"observed_at":"2026-08-03T00:47:05.945108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.111582Z","title":"On the robustness of medical term representations in locally deployable language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.111582Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:786d2396d1d017431c8a6fcc25fa58e49e8b2b243eb3aae79ba6309af39295a4","observation_id":"fce241fd-572f-4cc1-9c1d-660504b4d9fd","resolution":{"observed_at":"2026-08-03T00:47:06.111582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.220549Z","title":"Health AI needs meaningful human involvement: lessons from war","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.220549Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:22eff07d3e9d22cda14f5a0bad0c55108a9379859ad4192aeff5acc88b7a8c1e","observation_id":"f2784f09-c73c-48ff-b9bf-53c9ba25b0d8","resolution":{"observed_at":"2026-08-03T00:47:06.220549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.389839Z","title":"From Concept to Clinic: Real World Evidence for Autonomous AI Deployment in Primary Care Telemedicine","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.389839Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:c74881db090274c1d143088d2473ce9024b2332d3983d5b5513a5191ff74d21a","observation_id":"ecee4c67-07d8-45fd-bd8a-8b4fe65eb86f","resolution":{"observed_at":"2026-08-03T00:47:06.389839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.486690Z","title":"Towards autonomous medical artificial intelligence agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.486690Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:6ab3d653213659941b8ed387b9ee83814a0bc517962486271098509e1aa691c1","observation_id":"d5498374-9fa5-4b33-a0d7-26f93bedc42d","resolution":{"observed_at":"2026-08-03T00:47:06.486690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.542200Z","title":"A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.542200Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:4a6edc4e59641a5428d7384ce65fac28a366785a0802cfa0afa57726689f6f15","observation_id":"bfb0457c-5416-4141-822b-4a2cc3be5c05","resolution":{"observed_at":"2026-08-03T00:47:06.542200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.666268Z","title":"Safety of a large language model-based clinical decision support system in African primary healthcare","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.666268Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:829ecda1bff9eab8dfd73cca72d7d22886ed78bcf9ccaca591480249979548fd","observation_id":"a2dccb91-62a7-4e8d-932a-6e10c5fb2df4","resolution":{"observed_at":"2026-08-03T00:47:06.666268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16947","last_updated":"2025-07-22T18:37:33Z","snapshot_observed_at":"2026-08-06T14:57:48.262604Z","submitted_at":"2025-07-22T18:37:33Z","title":"AI-based Clinical Decision Support for Primary Care: A Real-World Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16947","snapshot_observed_at":"2026-08-03T00:47:06.754803Z","title":"AI-based Clinical Decision Support for Primary Care: A Real-World Study2025 22 Jul 2025; (arXiv:2507.16947v1 [cs.CL])","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.754803Z"},"links":{"cited_paper":"/paper/2507.16947","citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:afa81779ac04f5ca1f34861eb2b3ae5e4f7b4150c319613935f4a33645dbd094","observation_id":"20518bf9-356d-4738-a5ad-8f65ee5cae15","resolution":{"observed_at":"2026-08-03T00:47:06.754803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.851847Z","title":"Medical errors in large language models revealed using 1,000 synthetic clinical transcripts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.851847Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:9ae07045275a74817727d30b577b88c3f2c7380694417ef384d2c31dba3b66d7","observation_id":"035c0676-8880-4aaf-bec3-b24b63b55bd4","resolution":{"observed_at":"2026-08-03T00:47:06.851847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:06.907210Z","title":"Large Language Models lack essential metacognition for reliable medical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:06.907210Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:e9cc29ee1917083b9c512d3f7427a76a3cfcd596bc5d5e1a3cef8f5bd003c73c","observation_id":"c00148ae-0141-4595-8dba-67898da83f87","resolution":{"observed_at":"2026-08-03T00:47:06.907210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.069220Z","title":"Towards conversational diagnostic artificial intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.069220Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:106e50424712a81d4a8f56a5801850ec8d2a0da1eb19a12d5e01fb5a035d4726","observation_id":"d85b0cde-3c7c-4c81-b0ec-817a1e640eee","resolution":{"observed_at":"2026-08-03T00:47:07.069220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.234978Z","title":"Towards Conversational AI for Disease Management","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.234978Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:ed5a69ba373f8bde65e5e004abfd65da2ddadeb3eca6fd24d0134774318349fd","observation_id":"8dbb94b9-03f0-4e4f-a837-c683fd606076","resolution":{"observed_at":"2026-08-03T00:47:07.234978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.401396Z","title":"Testing and Evalua- tion of Health Care Applications of Large Language Models: A Systematic Review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.401396Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:b77c1f30ed7e50bbb0a77849dd5f74217f6963f3da2394eaff02beb787bd146a","observation_id":"0b016d29-21a5-4973-a476-dc71e2ed4388","resolution":{"observed_at":"2026-08-03T00:47:07.401396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.513681Z","title":"LLM-assisted systematic review of large language models in clinical medicine","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.513681Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:91a94ca6a212e78309caf4da50e022802c0c3f9a008a7a4d9366cf5b9e8faeb9","observation_id":"b74fbffc-c8cd-4bce-a7db-44304f367166","resolution":{"observed_at":"2026-08-03T00:47:07.513681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.674935Z","title":"Multi-model assurance analysis showing large language models are highly vulnerable to adversarial hallucination attacks during clinical decision support","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.674935Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:cb9f9a8adbc7344d6cf1b5218469938eb123233afafb8b817096101d71eb43fe","observation_id":"0a5bcce6-3244-4658-b3c3-83e1f25ad143","resolution":{"observed_at":"2026-08-03T00:47:07.674935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.840702Z","title":"MedMisBench: Measuring Epistemic Resilience of LLMs Under Misleading Medical Context","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.840702Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:1b55524e46fe4cf4bdb3f5e3830aa84243c69360fcaee64af5d57abee722491a","observation_id":"471de8cb-5145-4435-8013-9643d29439e8","resolution":{"observed_at":"2026-08-03T00:47:07.840702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:07.900627Z","title":"Training language models to be warm can reduce accuracy and increase sycophancy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:07.900627Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:82737f24321c8c287707351b15ba7bb135735c9a5819516c6c56266ba2b05315","observation_id":"b5515b52-0bcc-4319-bd09-816bbdb412ef","resolution":{"observed_at":"2026-08-03T00:47:07.900627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.008719Z","title":"Competing Biases underlie Overconfidence and Underconfidence in LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.008719Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:1a8b751095bb0cc26b7f72ff28bfc6d2518673e3c517dc224e78bc3bc115031a","observation_id":"a4b24a9d-51dc-4923-96b4-ea1e1d9911cb","resolution":{"observed_at":"2026-08-03T00:47:08.008719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.039934Z","title":"Assessment of Large Language Models in Clinical Reasoning: A Novel Benchmarking Study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.039934Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:74ad24fb39afc2581549864851baadc88ba0fdf633b36d8fa138c357824ea09a","observation_id":"4a28b52e-1033-4391-bfe9-df546d31a1dc","resolution":{"observed_at":"2026-08-03T00:47:08.039934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.117061Z","title":"First, do NOHARM: towards clinically safe large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.117061Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:2a48fb77e96c9524ee83682f883192e681dce32e1ef9ae1bbf5ccb8634a6e5b4","observation_id":"511ac63f-afcc-442a-a47c-4b86c6f4099d","resolution":{"observed_at":"2026-08-03T00:47:08.117061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.177007Z","title":"MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.177007Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:8f6ff90a68c1325c603d2070780d729ff6ac953c2e527fa3e079af0516a6e117","observation_id":"14f78564-fe69-4c59-bb6f-5d2f97640ba6","resolution":{"observed_at":"2026-08-03T00:47:08.177007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.285001Z","title":"SymptomAI: Toward a Con- versational AI Agent for Everyday Symptom Assessment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.285001Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:696310228addfa7419d392fa52f3fdb6c12caed921bea67f8a1bcbadf72ada10","observation_id":"827f14c3-925e-4fe8-af3f-f3090208de68","resolution":{"observed_at":"2026-08-03T00:47:08.285001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.396535Z","title":"A POMDP Formulation of Preference Elicitation Problems","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.396535Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:9620ccc69f82551f755bfbbfbd3af29cca3a535efc8b58877191491eb991f299","observation_id":"91c4f6c5-71d2-4782-9134-7b3028b411a7","resolution":{"observed_at":"2026-08-03T00:47:08.396535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.504867Z","title":"A clinical environment simulator for dynamic AI evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.504867Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:a1a57980a895b5faba52bae8b93f63ad2e750885a0e29fb8a3ad170f5f250499","observation_id":"c7d11616-466c-4f77-8618-b75311bf09eb","resolution":{"observed_at":"2026-08-03T00:47:08.504867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09396","last_updated":"2025-09-11T12:25:41Z","snapshot_observed_at":"2026-08-07T11:42:09.155993Z","submitted_at":"2025-09-11T12:25:41Z","title":"LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09396","snapshot_observed_at":"2026-08-03T00:47:08.564508Z","title":"LLMs Don’t Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations2025 2025-09-11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.564508Z"},"links":{"cited_paper":"/paper/2509.09396","citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:e88d2ddf5d63a42109f86f53c42d6aaea031f406772cb18aa01924295ac0d909","observation_id":"993d9874-d12c-4727-b5dd-74d99e6f52a2","resolution":{"observed_at":"2026-08-03T00:47:08.564508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.624687Z","title":"AI, Health, and Health Care Today and Tomorrow: The JAMA Summit Report on Artificial Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.624687Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:fa1b715d7e6876fb0906241f7bf222ad889baa288e2f9202f12f427415fa7e42","observation_id":"d50a2074-7081-42a9-9b88-1b298f12bbc8","resolution":{"observed_at":"2026-08-03T00:47:08.624687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:47:08.786613Z","title":"Nature Medicine","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T00:47:08.786613Z"},"links":{"citing_paper":"/paper/2607.28677"},"observation_digest":"sha256:78fce0628d0275053e04a8a938eb525975d11b1b8dd5480536f596ee8e51633a","observation_id":"abf90368-e3e8-47f5-b310-f25a8c54446e","resolution":{"observed_at":"2026-08-03T00:47:08.786613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28677","last_updated":"2026-07-29T07:12:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:42:59.861665Z","submitted_at":"2026-07-29T07:12:46Z","title":"Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.28677."}