{"as_of":"2026-08-14T19:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:992eea3ec0fa23f0057dfc3affa093b1ca1aff3f9b7aaa2316d6213a6d8660e3","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:21:49.124883Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:13:26.156464Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"cited_work":{"arxiv_id":"2509.02594","doi":"10.48550/arxiv.2509.02594","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenAI’s HealthBench in action: evaluating an LLM-based medical assistant on realistic clinical queries","venue":"ArXiv.org","work_id":"37a0526d-346d-47d0-994f-39f1c849b8c9","year":2025},"citing_paper":{"arxiv_id":"2604.16346","last_updated":"2026-04-22T13:56:30Z","snapshot_observed_at":"2026-08-12T14:57:50.253639Z","submitted_at":"2026-03-16T13:09:14Z","title":"DR. INFO at the Point of Care: A Prospective Pilot Study of Physician-Perceived Value of an Agentic AI Clinical Assistant","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T10:33:20.149592Z"},"links":{"cited_paper":"/paper/2509.02594","citing_paper":"/paper/2604.16346"},"observation_digest":"sha256:60327e4bd54a5a12b25e96717cedb2c4a75b8d57ce8a2159c476ca530af31933","observation_id":"e86579b6-042c-4532-831e-1997ffce9ee8","resolution":{"observed_at":"2026-07-28T03:23:19.351167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"cited_work":{"arxiv_id":"2509.02594","doi":"10.48550/arxiv.2509.02594","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenAI’s HealthBench in action: evaluating an LLM-based medical assistant on realistic clinical queries","venue":"ArXiv.org","work_id":"37a0526d-346d-47d0-994f-39f1c849b8c9","year":2025},"citing_paper":{"arxiv_id":"2605.24699","last_updated":"2026-05-23T18:36:58Z","snapshot_observed_at":"2026-08-09T07:45:55.861801Z","submitted_at":"2026-05-23T18:36:58Z","title":"MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T13:13:26.156464Z"},"links":{"cited_paper":"/paper/2509.02594","citing_paper":"/paper/2605.24699"},"observation_digest":"sha256:6954ca25cfa871c432a1ad85347d049d2300cbd1bc5d7e5f4d928b3587645a19","observation_id":"2123923a-01e5-4e2e-b43c-1c4145388c74","resolution":{"observed_at":"2026-07-28T03:23:19.351167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"cited_work":{"arxiv_id":"2509.02594","doi":"10.48550/arxiv.2509.02594","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenAI’s HealthBench in action: evaluating an LLM-based medical assistant on realistic clinical queries","venue":"ArXiv.org","work_id":"37a0526d-346d-47d0-994f-39f1c849b8c9","year":2025},"citing_paper":{"arxiv_id":"2605.30529","last_updated":"2026-05-28T20:06:43Z","snapshot_observed_at":"2026-08-13T19:47:58.745809Z","submitted_at":"2026-05-28T20:06:43Z","title":"Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T07:27:03.060416Z"},"links":{"cited_paper":"/paper/2509.02594","citing_paper":"/paper/2605.30529"},"observation_digest":"sha256:847358d8a6addfc106252f81db4d03fd93ea596ab7bf6d8d65ed95bc573a0715","observation_id":"89d6a204-5f3c-47cd-bef8-a5549cc475ba","resolution":{"observed_at":"2026-07-28T03:23:19.351167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02594/citation-record","integrity":"/paper/2509.02594/integrity","json":"/paper/2509.02594/citation-record.json","paper":"/paper/2509.02594"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:46.712398Z","title":"A systematic review of large language model (LLM) evaluations in clinical medicine","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:46.712398Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:b73dc610f735127c044604e94df2cf1c80a4a6fb2d3bcaeb11409aa1e649e751","observation_id":"d991f462-9a44-4780-8137-5e8a7f5e21eb","resolution":{"observed_at":"2026-08-05T14:21:46.712398Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:46.901628Z","title":"Scientific Evidence for Clinical Text Summarization Using Large Language Models: Scoping Review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:46.901628Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:7ed4142fce1ba6dbae06315199da218f844672c496451fad30306a5978072700","observation_id":"b79ed5a8-d09e-40b7-aef8-362eb4c21ff7","resolution":{"observed_at":"2026-08-05T14:21:46.901628Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:51.954833Z","title":"AI Consult: Real-World Evaluation of Large Language Model-Based Clinical Decision Support in Primary Care","venue":null,"work_id":"22e8b405-cdf0-4748-aefd-3d30518dca42","year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.097613Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:8de3ad907da7beb9c117adbb8259557a5b06de4fe4a08dfce0c0a7ec53ffa927","observation_id":"290ee266-ba18-49c9-abab-4ea3e5857813","resolution":{"observed_at":"2026-08-05T14:21:52.173666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-13T08:33:17.178696Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-05T14:21:47.221633Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.221633Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:dda7f623b7f1dad42a3abc6394d17756101ae08a9a63c877e7e2932f7e980084","observation_id":"33444acb-a9b2-424e-a8c7-e527cfae02e1","resolution":{"observed_at":"2026-08-05T14:21:47.221633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:47.334773Z","title":"Large Language Models Encode Clinical Knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.334773Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:76ab869a146aa3e2ad1e72ba1b42221b7279a523b5b28a5484b01be56edc07df","observation_id":"b7b98faa-fdc4-4107-9ed2-3157428ed2d3","resolution":{"observed_at":"2026-08-05T14:21:47.334773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1001/jamainternmed.2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:49.954745Z","title":"Clinical Reasoning of a Generative Artificial Intelligence Model Compared With Physi- cians","venue":null,"work_id":"7dad762a-0004-4bed-9835-700eac21a677","year":2024},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.434845Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:ee2162ab4a4bda8e3832f0a24b68d668faf8602fd5b825516aac9343c0bb28fa","observation_id":"829959f1-622c-4ff3-9bdb-b8d9d3171c2e","resolution":{"observed_at":"2026-08-05T14:21:50.104772Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:47.634240Z","title":"What disease does this patient have? A large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.634240Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:7b6d77aa7fe6f07f5bcf50a3abd28471bb6f8c3ec554f8fd12f403d2a7710e89","observation_id":"8b0c8d4e-4550-48d2-a392-92ea17dd261d","resolution":{"observed_at":"2026-08-05T14:21:47.634240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:51.704828Z","title":"MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","venue":null,"work_id":"686e9f5e-7cd3-42ea-bbc3-ea414e469ee1","year":2022},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.744755Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:d0f0375602ea6eda2bf9c7abf88fd5d780172f0321d0fa8458cd2c91471650e9","observation_id":"9e983042-da58-4197-b2d2-682e58a4a3ca","resolution":{"observed_at":"2026-08-05T14:21:51.804168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-08-13T18:54:55.815938Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-05T14:21:47.847549Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.847549Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:907d7c632d1c7d9b3efeb0a8b192ec12a13dad63c3a5fac01bbdc4e6708570c0","observation_id":"f448757c-4fb3-4412-b70c-cc824f6ded0a","resolution":{"observed_at":"2026-08-05T14:21:47.847549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22405","last_updated":"2025-07-02T17:58:37Z","snapshot_observed_at":"2026-08-06T22:01:41.066952Z","submitted_at":"2025-06-27T17:27:26Z","title":"Sequential Diagnosis with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22405","snapshot_observed_at":"2026-08-05T14:21:47.914758Z","title":"Sequential Diagnosis with Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.914758Z"},"links":{"cited_paper":"/paper/2506.22405","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:5963edae6f682e269bc1cb3783d351df79875395ead23530b674d6290c1aef2e","observation_id":"e3df4048-aebb-460e-bbe9-103af12f27e8","resolution":{"observed_at":"2026-08-05T14:21:47.914758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-05T14:21:48.024778Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.024778Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:2bf9115b826b02bec0bdb06ba492637094cb57a5f4206149a54cb4d595fc7aa1","observation_id":"90590ceb-b958-4354-9ca7-36c4b8b5aa1e","resolution":{"observed_at":"2026-08-05T14:21:48.024778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:51.441217Z","title":"Dr.INFO: Agentic Clinical Assistant","venue":null,"work_id":"ef826445-e5c2-4b03-8f72-3b0f4a6f8ac7","year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.166153Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:30d4c217107b5f7b7576aa771f0c3d61d4248d88ea7bd1a6d6bd824cc087e71d","observation_id":"b5c23685-9364-4969-ba23-1a77bd1666b3","resolution":{"observed_at":"2026-08-05T14:21:51.566636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41746-025-01651-w","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Leveraging long context in retrieval augmented language models for medical question answering","venue":"npj Digital Medicine","work_id":"6cb9d0bf-b85a-4ba7-bbd8-656c0bdc1972","year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.307072Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:4dae750bbf08f5a21d06f7609d8fb75eb31f49ffbce00d23738e0ee19840b5bd","observation_id":"9c2cb5cc-37b6-4b91-9024-227d766dda89","resolution":{"observed_at":"2026-08-05T14:21:49.691711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:51.177835Z","title":"VISTA: A Rubric-based Visual Task Assessment Instruction-Specific Task Assessments","venue":null,"work_id":"18b956e0-5d29-46da-a85d-0b4ed891be62","year":null},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.490522Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:e3b90f9be0602facbf76104803171c57afe593d2d4228e937707216eabb2779c","observation_id":"45e1f2df-3ae4-4b01-8c72-e8685e9bafae","resolution":{"observed_at":"2026-08-05T14:21:51.285419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T14:21:48.654747Z","title":"PaperBench: A Rubric-based Benchmark for Scientific Paper Summarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.654747Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:a93777f62cb3b3f582701f542d7ddf413e1002e477e09e5997b3131103a69684","observation_id":"b1c8718a-f500-42f2-80f9-5492d1609b8e","resolution":{"observed_at":"2026-08-05T14:21:48.654747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-12T23:48:02.751889Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-05T14:21:48.754749Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.754749Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:71a936688587de5d719decdf6dd438656e4cafc7062323585c4bd10d972d83ae","observation_id":"cd8a3431-2352-4886-9242-4b74c792ef2d","resolution":{"observed_at":"2026-08-05T14:21:48.754749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:48.834137Z","title":"Autonomous medical evaluation for guideline adherence of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.834137Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:2da3e53226cc7b17f6a843ac4f3ef108a58451f56ea5c61c96b937155dba9f79","observation_id":"cf7133c9-94f5-43dc-822f-5eb75b4da0f0","resolution":{"observed_at":"2026-08-05T14:21:48.834137Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17399","last_updated":"2025-03-06T04:41:56Z","snapshot_observed_at":"2026-08-10T04:40:42.053539Z","submitted_at":"2025-01-29T03:29:24Z","title":"MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17399","snapshot_observed_at":"2026-08-05T14:21:48.990246Z","title":"MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.990246Z"},"links":{"cited_paper":"/paper/2501.17399","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:5db216f929e737e26a19b463a04815a5610d9f3c4648b9dd07607ed2b09ddc57","observation_id":"57df649d-5060-47bc-9a32-08469a0b455a","resolution":{"observed_at":"2026-08-05T14:21:48.990246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:50.973446Z","title":"Introducing GPT-5","venue":null,"work_id":"95d32101-4443-40ab-bbe8-e87c3363cd8e","year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:49.124883Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:f42ed275f446c878135aac3329bb97c5cd3e0be3a2ccbb854dcf1efd1f6169ce","observation_id":"1a6b30a2-6cc9-4ca2-ab04-21ac5fc7e70c","resolution":{"observed_at":"2026-08-05T14:21:51.069150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:50.669695Z","title":null,"venue":null,"work_id":"6d1ddde6-59e7-4b25-8471-1eb61a8fe66e","year":2024},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":295,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:47.509445Z"},"links":{"citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:22ee28e58a5cc928ebd486e05b8c56d8be2fb29b72be4d5562e288e362ab7bf9","observation_id":"1a42e871-2b06-46fe-be0b-3a73808e7376","resolution":{"observed_at":"2026-08-05T14:21:50.817815Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","latest_version":3,"primary_category":"q-bio.QM","snapshot_observed_at":"2026-08-13T12:50:59.038811Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 3 inbound Pith citation observations for arXiv:2509.02594."}