{"as_of":"2026-08-18T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd3b0d4ec6a7af7c45a4bd41c493901e40ec03ea059b19c329c7b0fc1eaff377","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:38:11.263118Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:27:18.623344Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2509.22258","last_updated":"2026-04-04T13:15:46Z","snapshot_observed_at":"2026-08-14T23:52:12.294455Z","submitted_at":"2025-09-26T12:20:01Z","title":"Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T13:26:58.309566Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2509.22258"},"observation_digest":"sha256:aab47204e1e5a8f408fd3709923df7d67bef7d5a64ccfe244b5ed4c82a30b8dd","observation_id":"09047aae-f843-40e3-85b4-cf933f609390","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2602.12705","last_updated":"2026-04-07T11:35:36Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T08:19:38Z","title":"MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T22:52:30.992054Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2602.12705"},"observation_digest":"sha256:535a7f6e4dea01d58275d7c14a41e565af7488538d7d9c1b62544b50e67db5c5","observation_id":"b7ec127c-9cc0-44a7-94c9-86527838c0db","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2604.06262","last_updated":"2026-04-07T01:59:40Z","snapshot_observed_at":"2026-08-17T13:22:01.702962Z","submitted_at":"2026-04-07T01:59:40Z","title":"From Exposure to Internalization: Dual-Stream Calibration for In-context Clinical Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:19:15.053725Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2604.06262"},"observation_digest":"sha256:e6e65609833b20b5207c5dd0b1d2e504b08c679bd50f2479f3fa9fa8d1902e6e","observation_id":"56606448-0adb-4b38-bf1b-6c8a2b8894c4","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-12T14:09:59.846019Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:34.773345Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:bfc12b3ba5297757ac879972490d0380991c15938878836c45a19268d82114ab","observation_id":"eb509866-ada7-44b7-a024-1d689965352d","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-12T14:09:59.846019Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:25:31.662152Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:581327afc53b58c7e5ac08698820df2b7cae52118e68d8dff0c85ceab9cc6be7","observation_id":"4c17d835-2f8e-4172-ae51-856250113229","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.30637","last_updated":"2026-05-28T22:38:26Z","snapshot_observed_at":"2026-08-15T02:58:19.749294Z","submitted_at":"2026-05-28T22:38:26Z","title":"EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-06-29T06:41:06.828814Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.30637"},"observation_digest":"sha256:892e1d8679508cd0bea2f22e45ff258fb881f7045e184674fdd75c19354bfe08","observation_id":"7eb391fb-79aa-4e59-ba84-88b6f2ba5083","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2606.07853","last_updated":"2026-06-05T21:29:39Z","snapshot_observed_at":"2026-08-16T08:17:11.618542Z","submitted_at":"2026-06-05T21:29:39Z","title":"Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:16.052239Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2606.07853"},"observation_digest":"sha256:d26dcfe22dbb7b9bf0304c24f39c15299a8977d212afdc406aa8e510ec2e885b","observation_id":"96c78045-c903-4f3b-afa0-f6f2d46e03af","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-18T02:15:33.670502Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2607.00147","last_updated":"2026-06-30T20:25:53Z","snapshot_observed_at":"2026-08-15T08:18:09.699862Z","submitted_at":"2026-06-30T20:25:53Z","title":"RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-02T19:21:44.653877Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.00147"},"observation_digest":"sha256:33fd5b1a945a4399423d683cab2f24bce2fe1dfdf35885538099ff1887216b9b","observation_id":"d98ffec1-12da-4a37-ab73-142cbea8de42","resolution":{"observed_at":"2026-08-18T02:15:33.670502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-02T13:38:11.263118Z","title":"URL: https://arxiv.org/abs/2505.14107","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22555","last_updated":"2026-05-19T12:55:39Z","snapshot_observed_at":"2026-08-07T01:22:20.977020Z","submitted_at":"2026-05-19T12:55:39Z","title":"DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T13:38:11.263118Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.22555"},"observation_digest":"sha256:013f1d3e49b8b469e58b0bb6cada9566f468b37392981765e29fa89c1d9f117b","observation_id":"fbbe7ad0-62de-42bd-a871-203c3e9afd2d","resolution":{"observed_at":"2026-08-02T13:38:11.263118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-01T01:07:59.356644Z","title":"arXiv [cs.CL](2025).2505.14107","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25933","last_updated":"2026-07-28T16:19:03Z","snapshot_observed_at":"2026-08-15T22:32:25.443333Z","submitted_at":"2026-07-28T16:19:03Z","title":"Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T01:07:59.356644Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.25933"},"observation_digest":"sha256:0143f96c881244db2fd68f7212392f6bf233ce19a65525ca40010a34357d1c30","observation_id":"3530e665-cd62-480a-96b0-5471f5a47e1d","resolution":{"observed_at":"2026-08-01T01:07:59.356644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14107/citation-record","integrity":"/paper/2505.14107/integrity","json":"/paper/2505.14107/citation-record.json","paper":"/paper/2505.14107"},"outbound":[],"paper":{"arxiv_id":"2505.14107","last_updated":"2026-08-17T08:06:21Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T05:16:36.249998Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2505.14107."}