{"as_of":"2026-08-20T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5895ad3f250d0c48ae6bcd51d0266172ac187fdd084daff554ed13cd5a31825","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:30:11.968468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":74,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:e3c6583f060382762c20fddde003a862e9ef842e3821d2d8d1d3577b6f09fdc1","observation_id":"2f7e9616-2e4f-4d7c-b1b4-01deb0198c51","resolution":{"observed_at":"2026-05-13T05:53:21.918410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-11T16:00:18.750265Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10337","last_updated":"2024-12-17T14:57:57Z","snapshot_observed_at":"2026-08-11T15:54:41.233915Z","submitted_at":"2024-12-13T18:32:21Z","title":"Generative AI in Medicine","version":2},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:18.750265Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2412.10337"},"observation_digest":"sha256:c779b2b888d683c47ca98b176d4c1124681e6193e24076826c36286e6a22a467","observation_id":"db488721-0944-4688-9d94-00a1eca8ac48","resolution":{"observed_at":"2026-08-11T16:00:18.750265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-16T11:30:11.968468Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16137","last_updated":"2025-04-29T15:14:35Z","snapshot_observed_at":"2026-08-16T11:24:31.452137Z","submitted_at":"2025-04-21T21:04:01Z","title":"Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:30:11.968468Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2504.16137"},"observation_digest":"sha256:8867369d05728d703ce9b059b22614502ac9978fbb0afa71cff08f5454159b69","observation_id":"5862ba6d-f489-4b73-9b85-4f751c5b5e1f","resolution":{"observed_at":"2026-08-16T11:30:11.968468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-16T10:28:11.115101Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18080","last_updated":"2025-04-25T05:15:31Z","snapshot_observed_at":"2026-08-19T05:45:24.959853Z","submitted_at":"2025-04-25T05:15:31Z","title":"Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:11.115101Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2504.18080"},"observation_digest":"sha256:be02b7069c2d26832e6879328f45d255ca14564563cf320f57942e0454a34403","observation_id":"90ebc75e-2d21-4aa1-ab54-f6d02fbe2b3f","resolution":{"observed_at":"2026-08-16T10:28:11.115101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-15T23:55:01.304609Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03406","last_updated":"2025-05-06T10:31:54Z","snapshot_observed_at":"2026-08-18T13:13:39.859429Z","submitted_at":"2025-05-06T10:31:54Z","title":"Lightweight Clinical Decision Support System using QLoRA-Fine-Tuned LLMs and Retrieval-Augmented Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:55:01.304609Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2505.03406"},"observation_digest":"sha256:4f53502609bb3f30c05c67c9af55ad1723e3a0d7251b3f2b8c0c33de0fb07496","observation_id":"955d472e-6f4c-456d-ad05-4b63e8c5e79e","resolution":{"observed_at":"2026-08-15T23:55:01.304609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-07T12:57:58.938847Z","title":"MedM- CQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answer- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23075","last_updated":"2025-06-20T18:24:46Z","snapshot_observed_at":"2026-08-18T02:53:22.454989Z","submitted_at":"2025-05-29T04:29:22Z","title":"Second Opinion Matters: Towards Adaptive Clinical AI via the Consensus of Expert Model Ensemble","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:57:58.938847Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2505.23075"},"observation_digest":"sha256:23b3e78375de6724a1cc301b3181f9c9dc60225712d958676a6d7dda51af82f7","observation_id":"46809a5b-bd72-4e20-b125-c03e3df43601","resolution":{"observed_at":"2026-08-07T12:57:58.938847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-06T23:28:45.212350Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17951","last_updated":"2025-06-22T09:08:44Z","snapshot_observed_at":"2026-08-13T21:06:47.264750Z","submitted_at":"2025-06-22T09:08:44Z","title":"A Comprehensive Graph Framework for Question Answering with Mode-Seeking Preference Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:45.212350Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2506.17951"},"observation_digest":"sha256:6ab7c6613edf12c38496ab5a4b156f6925c3ff4ac30a4760a28900899912c683","observation_id":"ca05b8fb-138c-4f97-a04b-5782454c4674","resolution":{"observed_at":"2026-08-06T23:28:45.212350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-06T22:56:31.339236Z","title":"MedMCQA :ALarge-scaleMulti-SubjectMulti- Choice Dataset for Medical domain Question Answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-13T01:27:38.995851Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.339236Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f2fb4a6e50b2707a37c557d39d60a220780c46b8e74c944ec9c9c61e114c3fa7","observation_id":"133620ab-795b-4615-978d-344bff241c31","resolution":{"observed_at":"2026-08-06T22:56:31.339236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-07T00:39:59.386921Z","title":"Large Language Models Encode Clinical Knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21578","last_updated":"2025-06-16T07:40:25Z","snapshot_observed_at":"2026-08-08T05:01:37.020825Z","submitted_at":"2025-06-16T07:40:25Z","title":"HealthQA-BR: A System-Wide Benchmark Reveals Critical Knowledge Gaps in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:59.386921Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2506.21578"},"observation_digest":"sha256:46a083f0c200d940cbace7408a69785c7f44f56a79af81cb98ed4df1424d0271","observation_id":"cd1843af-84b1-4d17-b490-0a164acf525b","resolution":{"observed_at":"2026-08-07T00:39:59.386921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-06T21:45:01.978036Z","title":"Medmcqa : A large-scale multi-subject multi-choice dataset for medical domain question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23735","last_updated":"2025-06-30T11:18:56Z","snapshot_observed_at":"2026-08-19T10:58:19.886163Z","submitted_at":"2025-06-30T11:18:56Z","title":"AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:01.978036Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2506.23735"},"observation_digest":"sha256:ff5a49705bee5f19f2762eb9a0a0dd52031c812de4dde95de519df69978e6c8c","observation_id":"6fab41cb-ecc3-4953-aca6-697cfc9ef00b","resolution":{"observed_at":"2026-08-06T21:45:01.978036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T22:01:41.911397Z","title":"Medmcqa : A large- scale multi-subject multi-choice dataset for medical domain question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07681","last_updated":"2025-08-11T06:58:33Z","snapshot_observed_at":"2026-08-17T09:53:42.695953Z","submitted_at":"2025-08-11T06:58:33Z","title":"MORE-CLEAR: Multimodal Offline Reinforcement learning for Clinical notes Leveraged Enhanced State Representation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:41.911397Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2508.07681"},"observation_digest":"sha256:331899b73ecd579dcf5e12babf5961c21fc4ef09af3f3976d53a57a3add7b549","observation_id":"e5ddf721-ee3d-4202-bebe-ae5ea3c61ba3","resolution":{"observed_at":"2026-08-05T22:01:41.911397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T15:09:48.843816Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20416","last_updated":"2025-08-28T04:35:51Z","snapshot_observed_at":"2026-08-16T04:34:26.026223Z","submitted_at":"2025-08-28T04:35:51Z","title":"DentalBench: Benchmarking and Advancing LLMs Capability for Bilingual Dentistry Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:48.843816Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2508.20416"},"observation_digest":"sha256:d34c1da1979b286aab0d2f409a9dfbbdd8ba5798a1b5b255f11e605ce340ba1c","observation_id":"530a79ff-79a5-4603-8c4e-cad1a6d39e70","resolution":{"observed_at":"2026-08-05T15:09:48.843816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2512.20983","last_updated":"2026-04-07T04:41:41Z","snapshot_observed_at":"2026-08-18T04:59:38.472559Z","submitted_at":"2025-12-24T06:17:21Z","title":"Automatic Replication of LLM Mistakes in Medical Conversations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T20:25:24.722562Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2512.20983"},"observation_digest":"sha256:2b052fc31a024566fb5b39df284eae25b87b580dcf9b1f5d0cc89c4c1c53ddaf","observation_id":"841c91e4-9266-4bc8-bd38-626e047fd32e","resolution":{"observed_at":"2026-05-16T20:28:24.184881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2604.10718","last_updated":"2026-04-12T16:28:51Z","snapshot_observed_at":"2026-08-15T11:49:03.806779Z","submitted_at":"2026-04-12T16:28:51Z","title":"SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:34.768853Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2604.10718"},"observation_digest":"sha256:b9afe2f6e20fef6d27cd4beb08cdb5125de463cd7d3df4a2457a08eb86e71734","observation_id":"f11797a3-8542-4150-b492-a333827e5ce6","resolution":{"observed_at":"2026-05-11T09:36:03.488297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2604.11547","last_updated":"2026-04-13T14:37:38Z","snapshot_observed_at":"2026-08-17T16:31:36.476177Z","submitted_at":"2026-04-13T14:37:38Z","title":"Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:32.294359Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2604.11547"},"observation_digest":"sha256:57cbfad28016a3c350028af75842b22d3c7887b0b3492f35a154d094d142b6dc","observation_id":"8175b95d-7498-4734-8a4a-3ee246453849","resolution":{"observed_at":"2026-05-11T10:56:02.535119Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-08-19T03:31:10.194202Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-09T19:02:46.991897Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.01048"},"observation_digest":"sha256:08a6f18feaef56cdcd5539c0c3c3284f8048a8778b40821f2394e71be5cbdde0","observation_id":"5b2b9fb7-52c1-4a24-a3cc-3114297a4c20","resolution":{"observed_at":"2026-05-09T19:05:10.559010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.09315","last_updated":"2026-05-10T04:20:24Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T04:20:24Z","title":"Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:10:31.784413Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.09315"},"observation_digest":"sha256:b7356615d52645832267f11c821ce0f588b261b40db8bb77a4dbd75c01b0d3e9","observation_id":"08b59d2c-5310-4db0-a613-a658352b3faf","resolution":{"observed_at":"2026-05-12T06:31:29.395279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.16679","last_updated":"2026-05-19T05:51:20Z","snapshot_observed_at":"2026-08-16T12:26:18.226673Z","submitted_at":"2026-05-15T22:34:31Z","title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T17:45:02.896703Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.16679"},"observation_digest":"sha256:5108e11d3e97d8aad0f03f1c7726a851b22500fedc7746e5072f375779ee8fc4","observation_id":"26504b20-5715-47f3-978e-88cecd46d512","resolution":{"observed_at":"2026-05-20T17:48:48.807389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.21949","last_updated":"2026-05-21T03:29:50Z","snapshot_observed_at":"2026-08-17T22:55:51.679138Z","submitted_at":"2026-05-21T03:29:50Z","title":"Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T06:59:37.791418Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.21949"},"observation_digest":"sha256:415493e6c74513793a6fc137162395371ec0120c0e3c5f0f907e052b68e50f28","observation_id":"271f9a0f-6a0c-4a5b-b109-b6168fcfc64a","resolution":{"observed_at":"2026-05-22T07:01:11.728913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.22047","last_updated":"2026-05-21T06:34:50Z","snapshot_observed_at":"2026-08-14T19:55:25.185537Z","submitted_at":"2026-05-21T06:34:50Z","title":"Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T06:21:06.821499Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.22047"},"observation_digest":"sha256:03c670bee1bc151e61c19d6fc3f760f66d13880db69d4f7047e60f8b8f275d39","observation_id":"628482a5-77b0-450f-a4f1-67b2668995a4","resolution":{"observed_at":"2026-05-22T06:21:09.868353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.24699","last_updated":"2026-05-23T18:36:58Z","snapshot_observed_at":"2026-08-09T07:45:55.861801Z","submitted_at":"2026-05-23T18:36:58Z","title":"MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:13:26.156464Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.24699"},"observation_digest":"sha256:04bfea238cf25dec2f13eef192cc561feb608592a5065209b1ab0478f7ae7f7d","observation_id":"ed6367b1-5d5d-443b-a444-75f0cbce6f96","resolution":{"observed_at":"2026-06-30T13:14:40.481941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2605.30529","last_updated":"2026-05-28T20:06:43Z","snapshot_observed_at":"2026-08-13T19:47:58.745809Z","submitted_at":"2026-05-28T20:06:43Z","title":"Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T07:27:03.060416Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2605.30529"},"observation_digest":"sha256:7706ab5f47831d5d4ada9ba12229478319dbd38593f046c6c55392ff132665cb","observation_id":"f4d00188-2750-474f-bcdc-11d369407864","resolution":{"observed_at":"2026-06-29T07:33:13.973741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2606.03305","last_updated":"2026-07-01T19:01:29Z","snapshot_observed_at":"2026-08-15T22:59:06.411710Z","submitted_at":"2026-06-02T08:21:22Z","title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T09:48:09.688745Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2606.03305"},"observation_digest":"sha256:a6a96cbee8b507c3f1b19aa13979d3a4f9219197c3ae6d0ba67ded2190290294","observation_id":"84a4ce7c-ddf3-4638-ad2d-0da0a031ec79","resolution":{"observed_at":"2026-07-02T03:36:30.296094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2606.03305","last_updated":"2026-07-01T19:01:29Z","snapshot_observed_at":"2026-08-15T22:59:06.411710Z","submitted_at":"2026-06-02T08:21:22Z","title":"The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-04T00:30:13.665405Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2606.03305"},"observation_digest":"sha256:01b359529da06604ced06a681e1da4d8b62108e9cd28ef3b6608d19e9e050fc9","observation_id":"57af8a87-df42-4ac9-93aa-2e487faa69b7","resolution":{"observed_at":"2026-07-04T00:39:16.475540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2606.19266","last_updated":"2026-06-17T16:42:22Z","snapshot_observed_at":"2026-08-06T06:32:08.880714Z","submitted_at":"2026-06-17T16:42:22Z","title":"Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:00:06.185627Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2606.19266"},"observation_digest":"sha256:c9049cda45ef1b9191ea17ae4675e51e536a22adf41b5f3201e1ae84112c0caf","observation_id":"62684203-6a11-46b6-81bb-a160f60b8936","resolution":{"observed_at":"2026-07-04T00:49:17.789462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":"2203.14371","doi":"10.48550/arxiv.2203.14371","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":"arXiv (Cornell University)","work_id":"45fe1a29-cea0-45f2-b467-46962d2d680e","year":2024},"citing_paper":{"arxiv_id":"2607.01103","last_updated":"2026-07-31T12:56:37Z","snapshot_observed_at":"2026-08-17T18:48:09.298591Z","submitted_at":"2026-07-01T15:55:31Z","title":"Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T12:41:37.525229Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.01103"},"observation_digest":"sha256:527c0ac9a16c2f899d0e509695d7edb0a20a7992a81189cd8ef6c80d10865880","observation_id":"8c3e7113-111d-414d-99cd-41e5e3dc3332","resolution":{"observed_at":"2026-07-02T12:46:56.250844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-03T02:04:25.606072Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01103","last_updated":"2026-07-31T12:56:37Z","snapshot_observed_at":"2026-08-17T18:48:09.298591Z","submitted_at":"2026-07-01T15:55:31Z","title":"Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:04:25.606072Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.01103"},"observation_digest":"sha256:73c9fcbe08f1a608a6192d9f9fd6922cbddd16245b25632ca60b3788d8f1896c","observation_id":"df9f85c0-5fad-4744-b60d-a458ac76e37f","resolution":{"observed_at":"2026-08-03T02:04:25.606072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-07-13T05:07:42.040673Z","title":"MedMCQA: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-19T05:44:19.673550Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T05:07:42.040673Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:616ce2b7713c18256b28a00cae7ceefd2d60a9648726c4bfb4382a5cdbdf1733","observation_id":"6d770fca-d866-44d3-a6a8-40b9564c7e82","resolution":{"observed_at":"2026-07-13T05:07:42.040673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-02T07:43:26.937401Z","title":"MedMCQA: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-19T05:44:19.673550Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:26.937401Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:5bd95ec2a18635e0fddfcaab23f871c33ac292e02d28cea5ce76292183b15610","observation_id":"183fe46d-a841-4df4-9fc0-51fcf547f4ae","resolution":{"observed_at":"2026-08-02T07:43:26.937401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-02T02:16:39.894441Z","title":"MedMCQA:Alarge-scalemulti-subject multi-choice dataset for medical domain question answering.arXiv preprint arXiv:2203.14371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15314","last_updated":"2026-08-04T04:26:54Z","snapshot_observed_at":"2026-08-17T19:58:45.517557Z","submitted_at":"2026-07-15T22:05:23Z","title":"Cura 1T: Specialized Model for Agentic Healthcare","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:16:39.894441Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.15314"},"observation_digest":"sha256:42ed96d485ce9b446722490da6a32b3cb1207914b3ae89f2d533eb33a5873d60","observation_id":"46ebbf61-a4bb-47f9-8ea3-ee3ce8df33b5","resolution":{"observed_at":"2026-08-02T02:16:39.894441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-01T12:04:27.672674Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19678","last_updated":"2026-07-22T02:27:51Z","snapshot_observed_at":"2026-08-20T08:51:45.822616Z","submitted_at":"2026-07-22T02:27:51Z","title":"Reference-Free Evaluation of Reasoning in Open-Ended Question Answering","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T12:04:27.672674Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2607.19678"},"observation_digest":"sha256:538bd04b12b620e593dae90003feaf84f1b481cbe38095e103ea8cd737cc3f8e","observation_id":"e43714f9-47bb-4d11-a307-bf2ab5c2a694","resolution":{"observed_at":"2026-08-01T12:04:27.672674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-15T14:17:50.791324Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11420","last_updated":"2026-08-11T20:38:03Z","snapshot_observed_at":"2026-08-18T10:44:44.198770Z","submitted_at":"2026-08-11T20:38:03Z","title":"Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:17:50.791324Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2608.11420"},"observation_digest":"sha256:1c0a34b5c860ae78b398ab9488dbd37c06bee0a11cc23937f4b51a822cfe8a9a","observation_id":"04fb7e64-e3a7-4db3-9872-235300eb39b3","resolution":{"observed_at":"2026-08-15T14:17:50.791324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.14371/citation-record","integrity":"/paper/2203.14371/integrity","json":"/paper/2203.14371/citation-record.json","paper":"/paper/2203.14371"},"outbound":[],"paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:13:07.722927Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2203.14371."}