{"as_of":"2026-08-13T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba26b1f9c81184efc9035b099a46a2a86ba4c35b7fd8ea40e3e63fcbce8c0c08","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:31:03.576676Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:11:20.481528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T10:38:36.176606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-11T11:11:20.481528Z","title":"Automating expert-level medical reasoning evaluation of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.481528Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:9c0aeb703dffd4fb99065b995fab6959c30e26dc114ea6911b6afb77d0321b0d","observation_id":"89338951-d8e3-47ff-a305-7f5e7bfd8d5d","resolution":{"observed_at":"2026-08-11T11:11:20.481528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.07988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-05T10:38:36.176606Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","venue":"cs.CL","work_id":"be4387ab-dd83-42ba-9e24-82b19adf0db5","year":2025},"citing_paper":{"arxiv_id":"2509.04534","last_updated":"2025-09-04T04:18:45Z","snapshot_observed_at":"2026-08-06T05:31:52.923420Z","submitted_at":"2025-09-04T04:18:45Z","title":"Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:31.601683Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2509.04534"},"observation_digest":"sha256:8ab48f1bb2044a497bc055177fb4ea41f2a23177505bc84edd182aba67d7aee4","observation_id":"3cfe754e-cd08-4ea8-9c04-f57d9a221b4f","resolution":{"observed_at":"2026-08-05T10:38:36.213313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-01T12:04:28.955923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19678","last_updated":"2026-07-22T02:27:51Z","snapshot_observed_at":"2026-08-09T16:17:16.844011Z","submitted_at":"2026-07-22T02:27:51Z","title":"Reference-Free Evaluation of Reasoning in Open-Ended Question Answering","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T12:04:28.955923Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2607.19678"},"observation_digest":"sha256:44e9f7185c23b9721a0764bc59f5fffee7904a262d9346d20095d476d3e35763","observation_id":"e3612936-29d2-4b45-b3ec-42657fc5a18b","resolution":{"observed_at":"2026-08-01T12:04:28.955923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07988/citation-record","integrity":"/paper/2507.07988/integrity","json":"/paper/2507.07988/citation-record.json","paper":"/paper/2507.07988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.597459Z","title":null,"venue":null,"work_id":"d15c242a-417b-496f-934c-3f5af2f1eb7b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.538335Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:a38b1311c89e63a2166f142a6f1df38f06d620d90acf1874c93dad40a08501e0","observation_id":"fea62828-9d94-41fa-8edb-b65d3f7ba34e","resolution":{"observed_at":"2026-08-06T18:31:09.602141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.580657Z","title":null,"venue":null,"work_id":"ac342635-3ebb-4776-a2da-2c67937bb666","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.605075Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f70c8ac977a70026f0e515c4fcadb14345067fd6857c5f65ae331a0fbea83a14","observation_id":"82c86c53-cff5-4b11-9e22-becdd6e7bb11","resolution":{"observed_at":"2026-08-06T18:31:09.584943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.563798Z","title":null,"venue":null,"work_id":"78a64f9e-6512-43e9-879c-7441fc878d77","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.699546Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:915501f706a8307df5a330e5a991ec9f71ae4d2ba36e16913c8b29f07150705a","observation_id":"d024cad4-2a9f-4d7e-8650-c479bdefc270","resolution":{"observed_at":"2026-08-06T18:31:09.569216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.545141Z","title":null,"venue":null,"work_id":"36a286e9-c858-4e6d-ad1b-640bf51e7b10","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.775519Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:18fbfbf0198fdb337a94063106ff7d8f5e8bfe4db91953c637e3f12ac41869e1","observation_id":"b1fa0974-30b9-4dc5-8a72-2a64f4e7e327","resolution":{"observed_at":"2026-08-06T18:31:09.550385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.524796Z","title":null,"venue":null,"work_id":"26f327d8-b28e-4cc2-a5d6-89a966339695","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.849681Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:57404d9b999661c622be0391f2b900d59940fbefa0361662a60961e66abdcee3","observation_id":"9938ec45-ea59-4fd7-9f6a-7656b396dd7d","resolution":{"observed_at":"2026-08-06T18:31:09.532446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.505219Z","title":null,"venue":null,"work_id":"65f269c8-7051-43ca-af0d-aae709d7d05b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:57.926277Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:56c58f95ad0feb049be135db87a5b42c58e297152fb12f49f8b4c28b57befcbd","observation_id":"2a1ea739-43f7-4404-acc5-266adaefde6a","resolution":{"observed_at":"2026-08-06T18:31:09.510289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.485344Z","title":null,"venue":null,"work_id":"97685f06-1f66-42fe-9142-b92814b02a58","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.030842Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6b8c0267eda8b16ef9aba24242387692d200485104c4977f0dc487dd67b41606","observation_id":"cf93f74a-3642-4262-a184-22013c439aa7","resolution":{"observed_at":"2026-08-06T18:31:09.490531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.464525Z","title":null,"venue":null,"work_id":"98134130-3826-4690-8bc0-ca9d359b5e31","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.126704Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:8ce7cbe49d283b79bd51829d62de26b54d5def15d1ebe28bcba15e1496fb6715","observation_id":"b8ea57cd-4e6e-42c7-a217-dee22dfa13c9","resolution":{"observed_at":"2026-08-06T18:31:09.469292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.449084Z","title":null,"venue":null,"work_id":"e1c53b63-55c3-4776-905e-24e8b7a25476","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.206001Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6aa7d75dbb25113863d1d873f2445037099dee5a37ded285212b8e398fbb41b7","observation_id":"33371637-d575-458a-aaa0-b0ad6ed691c1","resolution":{"observed_at":"2026-08-06T18:31:09.454065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.431149Z","title":null,"venue":null,"work_id":"0a3b5fc3-af98-4ac1-871d-2f14a9653634","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.279514Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7876f6ab5e0c8ccdc88f38186ebdeab424ac37cf8210894b814071d62947c205","observation_id":"78f6a361-d8f3-4917-b1aa-a90e6b6535bb","resolution":{"observed_at":"2026-08-06T18:31:09.435785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.403031Z","title":null,"venue":null,"work_id":"a4bd0202-7f22-43b2-94bc-6d4fd3b20abf","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.351768Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:572e9ed5c7d6310eed471ac4ad8364444f4fc50ccc4703b2132a1135968e9121","observation_id":"8201bc19-11ec-40d2-987a-27f7010a8402","resolution":{"observed_at":"2026-08-06T18:31:09.410700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15852","last_updated":"2024-03-15T21:04:34Z","snapshot_observed_at":"2026-07-06T15:33:11.344191Z","submitted_at":"2023-05-25T08:43:46Z","title":"Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15852","snapshot_observed_at":"2026-08-06T18:30:58.427520Z","title":"& Vechev, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.427520Z"},"links":{"cited_paper":"/paper/2305.15852","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:4440cca5f2a5feec7de1d76fd570955a73afa9e71ae2487899935a9f752a5c2e","observation_id":"94d06134-d812-4eea-8618-3082cdef62c0","resolution":{"observed_at":"2026-08-06T18:30:58.427520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.381552Z","title":"& Ranisch, R","venue":null,"work_id":"fcc8a08f-f9b0-47d6-bca3-c2714e99abae","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.512040Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:72d39af85abe434674b5a9c1c0e4f383a498cb77279842dca64c6ec09434d8c3","observation_id":"68a926b1-31da-48cb-ae54-ad162f7f71c5","resolution":{"observed_at":"2026-08-06T18:31:09.387708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.355347Z","title":"& Chen, J","venue":null,"work_id":"1a8ffb0b-1215-4a4e-84ea-33d710f18a8f","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.585270Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:64143733f686c0be672f3f8e0e6231bb43ce24bf680083833a98be0c092612f5","observation_id":"0ee57d6b-f59d-4a04-ae2f-9d27b508b54c","resolution":{"observed_at":"2026-08-06T18:31:09.360873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.337226Z","title":null,"venue":null,"work_id":"bd9c0130-9cc7-400e-b284-870d08a0527b","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.645309Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:fd0e2664cae5cf528cab0de30b79ca58e9c971601c2330be8c42c99e7e250579","observation_id":"c410b272-f65c-4388-928f-d10e1bfbef9c","resolution":{"observed_at":"2026-08-06T18:31:09.343527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.309985Z","title":null,"venue":null,"work_id":"eb219b1b-c3ca-43d4-b6cb-d78ce791ef0d","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.703906Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f22135666a47f1d58788f7d30b06e172c8a9266f51fa66e19d7514a7802e5c01","observation_id":"df2e0a39-cbd9-401b-9a47-813ca40e9eb5","resolution":{"observed_at":"2026-08-06T18:31:09.315728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.288684Z","title":null,"venue":null,"work_id":"7d9f2c43-1e65-4bea-9a25-b64daefd9db3","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.787928Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:65dcab0bdeed6f1366a4dbd2e005eccf094803edf4c645637661a70c51cbe8af","observation_id":"2b2ebbac-7dc1-4ffb-989e-a8cd2c496ec7","resolution":{"observed_at":"2026-08-06T18:31:09.296147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.270044Z","title":null,"venue":null,"work_id":"657fd37e-e1cf-4058-bff9-6909d95d0197","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.867942Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:959138b63bf9303b4cbc5869f75c11c93a65b379aa69ee1d2d7da2bed2404e18","observation_id":"b6563a44-3ff1-455f-99b7-d1138c6e2e84","resolution":{"observed_at":"2026-08-06T18:31:09.275469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/preprints.70080","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"2485a4ec-226a-4b17-bd0f-2eb3b02c2604","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.912490Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:54b1395d1e2d17f107971a0eda50946724828779118f77b688aee760b5fd4e44","observation_id":"9780ca1c-fb59-4ce2-a6fd-3f9d7771df50","resolution":{"observed_at":"2026-08-06T18:31:03.894469Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:58.963784Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:58.963784Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:229b4b4fa4d7d3f0858d25fc93b2aa70e9457bc304f61b03f1512dfbae0e63fe","observation_id":"96bcb4f4-9993-4925-8232-c60a00c68819","resolution":{"observed_at":"2026-08-06T18:30:58.963784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.235221Z","title":null,"venue":null,"work_id":"749505a3-0389-4e4e-9431-e0d1770f0fd3","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.028935Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6385fffd4ef9b7fbad5b8241291eb8f73539ef93e058cb5337e9f06b2b71fb10","observation_id":"0edfd9dc-f811-4d8b-b2cb-163399547ac4","resolution":{"observed_at":"2026-08-06T18:31:09.239650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.218122Z","title":"E., Motzfeldt, A","venue":null,"work_id":"b1d23440-b6f8-4e1d-9e8e-952773f3e756","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.088944Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:77c2bf1370984637e498b955acc50d927b14ae341e7ead1a6d09551183afae5e","observation_id":"ce73f86f-a492-49a9-9699-29eccc6f86d7","resolution":{"observed_at":"2026-08-06T18:31:09.223653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.193950Z","title":null,"venue":null,"work_id":"4b9f1418-3519-486a-b995-1b4ee2021d80","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.135672Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:c8a7ff0e3c902308bdcbc07df887153151f4d27343614e4b8ff1f5957a7e44ab","observation_id":"4badec55-5a92-445a-beef-5119c443f365","resolution":{"observed_at":"2026-08-06T18:31:09.199441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.149021Z","title":null,"venue":null,"work_id":"1e0b5238-4c3a-4e43-bf62-bac4bd357453","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.176330Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:19200641194808b4a2bc2a4a1106ccc2ccf3ee2c6b41773877c8c46d1cecb9ec","observation_id":"7920dcd3-97d4-46be-82ea-5322ae45aee7","resolution":{"observed_at":"2026-08-06T18:31:09.155223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.121532Z","title":null,"venue":null,"work_id":"97ed8b11-2f9d-4084-9a5b-575622e5d45b","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.223086Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:9fec1ff8551092dac0f5331eaa950f01c24dd4fb8de5c85e6db636868877a4a7","observation_id":"9715e056-8792-4869-8056-d83e11810222","resolution":{"observed_at":"2026-08-06T18:31:09.135472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:59.270249Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.270249Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:85b60b21cba0c72e91caa5b1aa881b3ca01534ccaa8f7fb3abe99a05171abed2","observation_id":"15b7a50e-c4b9-4033-9ae9-2ee3170bf2e5","resolution":{"observed_at":"2026-08-06T18:30:59.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.089208Z","title":"& Zhang, M","venue":null,"work_id":"2cf7bdbf-6ba5-4f2c-a733-8d56b7b46362","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.323111Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:eccebbe658caba7d1defd70b2bf2d6e0cf18490fc421d060b2331616b53c4a48","observation_id":"654eef0e-e4ea-44f0-818e-9ab4b5b51d0a","resolution":{"observed_at":"2026-08-06T18:31:09.095502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.071263Z","title":null,"venue":null,"work_id":"e19ef5c4-1def-4ec0-a178-9a000a843bee","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.398355Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:cbded73f4315464d9cbb65435f9f0eb91ab2f132d5c5ad385cec0d03238ed30c","observation_id":"595d3d64-676c-47f4-a650-f243b5b26c23","resolution":{"observed_at":"2026-08-06T18:31:09.077073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:30:59.448696Z","title":"& Zhu, W.-J","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.448696Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f15050898df76a0f99fb3b02d54ec36cd7e3c0694a784e23c0271e7239f7094d","observation_id":"513cfb26-1ebe-446f-8783-d749c16559e5","resolution":{"observed_at":"2026-08-06T18:30:59.448696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.051453Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"30f7e615-e720-4143-b46a-9e3934acb9c4","year":2004},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.526033Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6b14096fd26d338a420e33f114cd01526d60c8d25140effebce182ca6707dcde","observation_id":"32742a83-d522-476b-aada-9cafc088dc44","resolution":{"observed_at":"2026-08-06T18:31:09.056931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.024976Z","title":null,"venue":null,"work_id":"50ce9276-cca7-4434-b0da-12ceead83760","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.591080Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1b09dd20d3e6bb5c7acfa599b04435f354062a24c966c7268032c8d939d88de7","observation_id":"cad86f9f-c74a-42b3-8a7d-996eca6af49e","resolution":{"observed_at":"2026-08-06T18:31:09.032771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:09.006776Z","title":null,"venue":null,"work_id":"bf335420-4c31-4568-b0f7-f945c552a5f8","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.647833Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:dfcad8034639a602e0a443c69bd87a91ac85fba83d23a0c02cc06475df47abce","observation_id":"f41df4a2-84cd-4fbf-9d46-856873202ddc","resolution":{"observed_at":"2026-08-06T18:31:09.011481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.987083Z","title":null,"venue":null,"work_id":"86e0f6e6-f966-419e-9205-2ceed2157f17","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.731276Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b2a1d76dcf9f78e0c0465c2d10fa80239c369bad05a3228ec1a7638c69b1a9d7","observation_id":"5325ec03-3582-46f6-96ef-30aba848691c","resolution":{"observed_at":"2026-08-06T18:31:08.992397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.963506Z","title":null,"venue":null,"work_id":"e91de9f1-7d8f-4ba3-8e01-3f479c8e3667","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.816765Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:04565c843121037b95f3d3ee57fa5666ee4c06581ec7cbe76efccd49648f3b5f","observation_id":"2b2bfa33-9464-4c8b-9c7e-74a7161d602b","resolution":{"observed_at":"2026-08-06T18:31:08.970046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.943312Z","title":null,"venue":null,"work_id":"143eac37-d7f7-4c5c-994a-2dc1f80008be","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.927540Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b8cf0fac6821f7c4e2f6fea51c4dabedae6ade4d81a8d32ca39b1400f2c481d1","observation_id":"0924487e-7e62-4d87-bc51-a69a859c37ff","resolution":{"observed_at":"2026-08-06T18:31:08.948488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.928814Z","title":null,"venue":null,"work_id":"c00d9d60-266f-457a-bffa-7dc76c3b1de9","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:30:59.986127Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:5e192067f4a099cfa01950d44086843829503f1ca082e93035262d584e5b4227","observation_id":"7d75a361-2d51-4ec0-b04e-42f68e294ab7","resolution":{"observed_at":"2026-08-06T18:31:08.933069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:00.063157Z","title":"& Yuksel, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.063157Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:0dbcfe3df9fd784ad0c8530437d5ce049af43e095bcc6e85aa97d13d05e1d441","observation_id":"35697907-0a56-492d-9a62-502def21f83f","resolution":{"observed_at":"2026-08-06T18:31:00.063157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.862144Z","title":"& Dredze, M","venue":null,"work_id":"04617df5-5e1c-4f2d-a96d-0cb2b4401919","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.143843Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:789487952d4c9b4dd64022339ff453e8d22bf23a98e66bbb5131f338c55e1a8a","observation_id":"5104ce6d-cde6-4ee8-8a4e-d50de8cbda29","resolution":{"observed_at":"2026-08-06T18:31:08.901236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.607561Z","title":null,"venue":null,"work_id":"1cc9f102-b548-4255-bfaf-b9be52d6acc9","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.227387Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:39751b8b11e90679c829223e45a86f2ed78dacc3b02bb455187b135bba90e968","observation_id":"9c211c11-1538-4043-be55-3e18d6957f65","resolution":{"observed_at":"2026-08-06T18:31:08.711102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T18:31:00.297754Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.297754Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f4adf0b8b82141e8cc8acf0874cba19c29f95b953e1883e666d506473315228e","observation_id":"d77a8f62-3d2a-4da2-8746-98299c88fbc3","resolution":{"observed_at":"2026-08-06T18:31:00.297754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.363743Z","title":null,"venue":null,"work_id":"5dc39c05-09e6-4fc6-a254-944a3a731206","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.380994Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b3f5e910d4179846634767407a1d1f31340f780392e1c573eec7a94082475b17","observation_id":"7a873045-b05b-4cae-b63d-989c30b9dfd5","resolution":{"observed_at":"2026-08-06T18:31:08.436810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:08.159616Z","title":"F., Goel, R., Wen, Z., Martel, J","venue":null,"work_id":"f1b2259c-1bb7-4bbe-9b37-00a79b38a0d7","year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.463207Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f0984388a464b5cd21fb3fb7e642a89afc59fd73b3480c3f73953f4359eaf85a","observation_id":"fc03a2dc-81fd-4c6e-8802-3e8c43caeb5c","resolution":{"observed_at":"2026-08-06T18:31:08.300854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.860949Z","title":"& Dredze, M","venue":null,"work_id":"ec1217e2-65b9-4656-856a-0ef6e65c69ca","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.540262Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:cf225559917cf0e779b4db70d2369bede96f3ef68b8e8b2c179ac69c2adc1c68","observation_id":"dba215f0-da18-488e-a5ef-b838c43c7cee","resolution":{"observed_at":"2026-08-06T18:31:07.990827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T18:31:00.630372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.630372Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b86af3c6b1c4196f754710ee08b793540aecef5d1096d4af2be6f64f3d140425","observation_id":"e012493f-0dd8-46c4-ba8b-5a9496c6af2f","resolution":{"observed_at":"2026-08-06T18:31:00.630372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.700670Z","title":null,"venue":null,"work_id":"6d73a221-3ffc-484b-a750-256b20ab61de","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.760960Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:93f409a859d84ec4ff86b689b9a17d8ff1d1c2c7800cad465599009e573ab168","observation_id":"62b7f041-cf32-42c2-aa67-16cd97084df2","resolution":{"observed_at":"2026-08-06T18:31:07.848943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.380906Z","title":null,"venue":null,"work_id":"15f0d633-693b-484e-bbb0-fea537c469b7","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.867715Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b0c44f4e514b36c786670db0f403bbea608d33c9db1e30a647862b764a407e3c","observation_id":"7d9c4fd0-ba39-41b4-85de-4610ba30e2ff","resolution":{"observed_at":"2026-08-06T18:31:07.530259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-13T01:26:47.642290Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-06T18:31:00.962024Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:00.962024Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:33334450e4c4e45cdc0bc82242205cd050f2493160f78596336480c065f3ac91","observation_id":"8c4aa8a8-8ab3-47c2-9ff8-51943695fa21","resolution":{"observed_at":"2026-08-06T18:31:00.962024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:07.066961Z","title":null,"venue":null,"work_id":"e58cc68e-b4c6-43ea-9f52-f0e81eb094cf","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.052752Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:24fbbe9cad55be60e0fe7d1380eb1219d1dbdb1f4251830dd6eb3726c33ee955","observation_id":"3e22655b-e182-4afb-b696-df244c612cce","resolution":{"observed_at":"2026-08-06T18:31:07.176482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.928709Z","title":null,"venue":null,"work_id":"4dcb77e5-ecdc-472c-a89d-a9ef1595cf73","year":2022},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.146944Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:d1f506eb7c655219076e75734e77c2db6f1e90cdc1a379fbc8d099aca488d00d","observation_id":"a0da6c83-e3ed-4dec-bf93-7866be91e26f","resolution":{"observed_at":"2026-08-06T18:31:06.997332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T18:31:01.239886Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.239886Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7b35d47ef39af2a4521f9e504e10d7c082e4e1d4f2da6285c4cc4847162a7eff","observation_id":"fc27fef7-a5bf-4b47-9e17-25612dec8a60","resolution":{"observed_at":"2026-08-06T18:31:01.239886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.758971Z","title":"& Gómez-Rodríguez, C","venue":null,"work_id":"e9095c67-efb0-4f73-867a-9f640a0b867e","year":2019},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.341500Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:0b69fe9695acf7cdcacd690b962293bdfc936c09f2094e203482b5744100dc5f","observation_id":"d8abe900-b029-4332-ac3d-dda2921d18d6","resolution":{"observed_at":"2026-08-06T18:31:06.835297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.623339Z","title":"& Lavie, A","venue":null,"work_id":"02698457-8b3c-4fd8-bd2f-9eae63d21879","year":2005},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.473941Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:4d224e5eb6b30dd225e636d5c46674e5867d04513a2734fb35ff438a7b92c26e","observation_id":"1cbece59-209a-468e-95be-d351c0166c44","resolution":{"observed_at":"2026-08-06T18:31:06.693457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.426243Z","title":"& Parikh, A","venue":null,"work_id":"2290c4e6-bfba-42fd-ae1b-1c379344bc84","year":2020},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.622469Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:629639f259010ea8e54df1eadc4e6c6fe6c9b07254f39eada98e4064e3998168","observation_id":"bfef7063-a6f8-4e3f-9838-a6b87e8c2f54","resolution":{"observed_at":"2026-08-06T18:31:06.529950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.257481Z","title":null,"venue":null,"work_id":"431cdcee-e8a8-4538-aa90-03a4149c2161","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.723726Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:0414fb19fc52d84a59b795d48f4a6075d0f8066eb60c977da9fdfffd0d9f6f36","observation_id":"cd95447a-adce-4700-a42b-c96546f6f4d2","resolution":{"observed_at":"2026-08-06T18:31:06.332867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:06.102463Z","title":"GPT-4 Technical Report","venue":null,"work_id":"f9e11404-1e87-44a7-8c2d-bacdca354205","year":2023},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.826623Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:baedbe4db0308326306fba9cf521bc19b77475dae4cfccf46a0862fcbd74df80","observation_id":"e13e57a9-178d-4d8b-943d-20462a45e7a8","resolution":{"observed_at":"2026-08-06T18:31:06.153060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.933268Z","title":"GPT-4o System Card","venue":null,"work_id":"902b7f09-2fdb-4727-8477-e97bd876a329","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:01.969972Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:00972f3766c2bdd08de2697ce43ca99367aebdf939982bdd804d855c5a187872","observation_id":"3b6e1b6c-72f4-4171-b9eb-9aaf9216b8d0","resolution":{"observed_at":"2026-08-06T18:31:06.021261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.802752Z","title":null,"venue":null,"work_id":"5dd0551f-5f2c-4f24-a722-c2bf4edaa5b1","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.061257Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:e05fd987c3e1498eb5801e0c2d2a43b824cbba3b5a4ea2048dce8aeec74c9cf6","observation_id":"b93086a9-ac3b-448c-83d1-74cb23b0facc","resolution":{"observed_at":"2026-08-06T18:31:05.868662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.687665Z","title":"claude-3.5-sonnet","venue":null,"work_id":"6e7611c7-69ac-4e9b-bb99-85c7acd03ecf","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.213379Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:7570487718b1b2894ca75a86e65076a8f7f674216562eb38aa574d314c545d67","observation_id":"a0709f7d-6805-4dda-bd90-2cd96bbb9273","resolution":{"observed_at":"2026-08-06T18:31:05.736069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.534091Z","title":null,"venue":null,"work_id":"319ba447-5b77-4f18-bba2-d6d76a0f9308","year":null},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.376098Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:cd332a385015c5292946bb4d59e0f6d0300c887f51bc427c705e1fde783f89fe","observation_id":"ea5f7796-2527-4459-be53-fdab36e7d703","resolution":{"observed_at":"2026-08-06T18:31:05.599003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.386163Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":"0cab026f-bd88-42f7-92b2-270bc0be3cfc","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.462287Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:dfd38c4650e025b0d2ae0137d152f4fa5e77c167d888d75a63221bc3c5cce666","observation_id":"ba711ad0-87ce-41e4-b5d4-656e21e35187","resolution":{"observed_at":"2026-08-06T18:31:05.461146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.233383Z","title":null,"venue":null,"work_id":"61397f19-9ace-4369-a52e-3ed211230f95","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.601521Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:6172648a544cc501d1f34170f4f773e85f2f6ec0522a617513b70fbe52766df9","observation_id":"d7d83259-76cc-46e2-9e34-e33de1a424d1","resolution":{"observed_at":"2026-08-06T18:31:05.317895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:05.124906Z","title":null,"venue":null,"work_id":"7941919c-e2be-4d32-9e9b-b2f04f82aeca","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.743876Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:f5e75c1f40384c7509b6624124307785093ed3147a3cfa2f78cd22796a2aab68","observation_id":"35b2db4c-e65b-448d-8c84-ab6ea47ee2fd","resolution":{"observed_at":"2026-08-06T18:31:05.192439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.956347Z","title":null,"venue":null,"work_id":"9ff7039f-bcec-40df-a465-2b7570f673f9","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:02.896069Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1a2364a7a52d56adba7ab73aa48524f83cd5e9aa7227e5b56db515d6f10c2c6f","observation_id":"78e6ae41-eea0-4b7d-87de-8c495109db28","resolution":{"observed_at":"2026-08-06T18:31:05.019319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.705912Z","title":"K., Raha, T., Khan, S","venue":null,"work_id":"9531e76a-8b6d-40a7-ad94-4729bad6a317","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.071493Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:3cc8616302bab4336008788d227c502c23ae95e7ff1d1a014073c474f7b86bd2","observation_id":"9026ac5f-3925-46e5-ab3c-acc744688791","resolution":{"observed_at":"2026-08-06T18:31:04.840016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14779","last_updated":"2024-04-23T06:36:21Z","snapshot_observed_at":"2026-08-13T00:24:05.435627Z","submitted_at":"2024-04-23T06:36:21Z","title":"Med42 -- Evaluating Fine-Tuning Strategies for Medical LLMs: Full-Parameter vs. Parameter-Efficient Approaches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14779","snapshot_observed_at":"2026-08-06T18:31:03.237211Z","title":"’ement et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.237211Z"},"links":{"cited_paper":"/paper/2404.14779","citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:24cf3843249e25aa1fd97618e8af2f1ab20328154f0a85866a40fe6d544e4e81","observation_id":"cb3674c9-db41-44de-9bfa-6e784ff8c288","resolution":{"observed_at":"2026-08-06T18:31:03.237211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.417003Z","title":null,"venue":null,"work_id":"d22295c3-e213-4d85-89ea-ae6f01e844e2","year":2024},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.443895Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:b2bafcd4799c7c5eb288e22da90626b6f8d282f837a0957112cb8ceabcf3ddb3","observation_id":"c02f3d50-24f3-44ac-9322-865f2fb5b65b","resolution":{"observed_at":"2026-08-06T18:31:04.545657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:31:04.239254Z","title":null,"venue":null,"work_id":"b8409914-2329-48d0-8c06-656bf18eef3a","year":2025},"citing_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:31:03.576676Z"},"links":{"citing_paper":"/paper/2507.07988"},"observation_digest":"sha256:1f0fdcdfe06366cbf43caecfbb20544984d16eff7aeba47134e1403d4140a3f3","observation_id":"8245cac9-65da-4272-af6c-45b915b618dd","resolution":{"observed_at":"2026-08-06T18:31:04.317615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 3 inbound Pith citation observations for arXiv:2507.07988."}