{"as_of":"2026-08-20T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5848aa16309d3aa602a8aad6f5529ed82d897ab36efb75354785cbb536c0239e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:52:16.027375Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11887/citation-record","integrity":"/paper/2505.11887/integrity","json":"/paper/2505.11887/citation-record.json","paper":"/paper/2505.11887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.654988Z","title":null,"venue":null,"work_id":"dfccc0a3-513a-460e-9483-7d5fafe0ba3f","year":2006},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.826594Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:017f2baf4af500d53eafb97431d0a3c88c8ca00632931126c5a0a6af8201a792","observation_id":"fe99e6b2-9ad4-4833-9ce6-5a156b5afac0","resolution":{"observed_at":"2026-08-15T20:52:16.660025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-20T09:21:16.017380Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-08-15T20:52:15.832274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.832274Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:3b407d212d4cdbf06ab6cc23290127b9263f5c6a9e33b894eab9d384d036a89f","observation_id":"736cacf7-1b7a-4eea-961a-98d75003af34","resolution":{"observed_at":"2026-08-15T20:52:15.832274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11598","last_updated":"2023-05-19T11:20:37Z","snapshot_observed_at":"2026-08-20T02:05:10.771678Z","submitted_at":"2023-05-19T11:20:37Z","title":"Introspective Tips: Large Language Model for In-Context Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11598","snapshot_observed_at":"2026-08-15T20:52:15.839099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.839099Z"},"links":{"cited_paper":"/paper/2305.11598","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:a4fa5ad89943a598cab897db34e2c1c31a33a008612c71e5ea966f418a320978","observation_id":"3ae1315f-b2e0-4ea2-be39-cdbecc09e727","resolution":{"observed_at":"2026-08-15T20:52:15.839099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.844477Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.844477Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:28528095ec261c9e8bc369f93861a17bf861b74137a6a7f532de09ded72a98a8","observation_id":"d3a4a363-d82e-462d-9b14-f15d2b378a85","resolution":{"observed_at":"2026-08-15T20:52:15.844477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T20:52:15.849900Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.849900Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:2095a6fe2fe2f9473f39968df1bd82d901fddbbfbd1c0ac194dcc8dde5392660","observation_id":"063b6d11-0eb9-4b03-9afa-a12882c2c04f","resolution":{"observed_at":"2026-08-15T20:52:15.849900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.855086Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\'e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.855086Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:0751c974f4ebb063f800536ed681d8abf607c05bc176646030d787294cef0285","observation_id":"8d7314dc-5800-4c7e-9114-d2d66514e84f","resolution":{"observed_at":"2026-08-15T20:52:15.855086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.860881Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.860881Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:f04803209e3a9f631d174802055297f7ad02b83ac2691fa680c7d9c804756d19","observation_id":"36d53d3c-ce5d-4da7-9ce9-5c06e55ddab4","resolution":{"observed_at":"2026-08-15T20:52:15.860881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-15T20:52:15.865639Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.865639Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:305ea4cf01aae9d1b8cea19347ab3d739aff678be7eabac2732f2de7e2ef520b","observation_id":"5ae0853d-ebca-4618-beea-738a08a39a98","resolution":{"observed_at":"2026-08-15T20:52:15.865639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04361","last_updated":"2017-03-13T12:48:15Z","snapshot_observed_at":"2026-08-19T18:15:11.192089Z","submitted_at":"2017-03-13T12:48:15Z","title":"Toward a Formal Model of Cognitive Synergy","version":1},"cited_work":{"arxiv_id":"1703.04361","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.04361","snapshot_observed_at":"2026-08-15T20:52:16.359179Z","title":"Toward a Formal Model of Cognitive Synergy","venue":"cs.AI","work_id":"1377960a-8742-41b2-bbb2-12c621628bcf","year":2017},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.871422Z"},"links":{"cited_paper":"/paper/1703.04361","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:d617eaf9b310522125e63cf8f47f5b4e2f6e155ff16980b81f6cfe4c0648cf86","observation_id":"f0ff8caf-385a-48e6-b8e6-99532332d0a0","resolution":{"observed_at":"2026-08-15T20:52:16.366965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08247","last_updated":"2025-03-18T21:31:51Z","snapshot_observed_at":"2026-08-18T08:20:50.087566Z","submitted_at":"2023-04-14T11:28:08Z","title":"MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08247","snapshot_observed_at":"2026-08-15T20:52:15.876404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.876404Z"},"links":{"cited_paper":"/paper/2304.08247","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:869f8292c48824143576d39537b2df0aaffafa61751c8e5cb8451eb7b45a0695","observation_id":"bfa08233-90d0-4f6c-b2fe-e0a910ef035a","resolution":{"observed_at":"2026-08-15T20:52:15.876404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.881968Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.881968Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:e6a7fd8d1d1e79f339dfc072e20001767d5f7262ab357900ae461275b3a42f53","observation_id":"89f45ce1-1142-4618-b202-8b989b4a4413","resolution":{"observed_at":"2026-08-15T20:52:15.881968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.595322Z","title":null,"venue":null,"work_id":"84ddcf74-f592-4aca-b946-c65acc19d815","year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.886953Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:67767440604e64a87b0340857f60f459a755fd676cf4106ca539cc7d5924d5e9","observation_id":"fcc36fad-f0dd-4f5d-92a2-66b04e719431","resolution":{"observed_at":"2026-08-15T20:52:16.599814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-15T20:52:15.891381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.891381Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:6c9d4cb8fd9d2c999e7bccf91a6ba3ed27bdb42c090e432ac61d5dbcc2c35411","observation_id":"75244dc7-19e0-4da3-833e-598a2453cda8","resolution":{"observed_at":"2026-08-15T20:52:15.891381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.895949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.895949Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:6dbeb76688e48376faf2e606f50bfb41ae7b5f6ee6b7b7de819b318617a89ec7","observation_id":"d0546bd6-e589-410c-8fa1-fd9973c40731","resolution":{"observed_at":"2026-08-15T20:52:15.895949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07103","last_updated":"2024-06-12T08:31:58Z","snapshot_observed_at":"2026-08-16T14:27:44.192442Z","submitted_at":"2024-01-13T15:59:09Z","title":"Leveraging Large Language Models for NLG Evaluation: Advances and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07103","snapshot_observed_at":"2026-08-15T20:52:15.900326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.900326Z"},"links":{"cited_paper":"/paper/2401.07103","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:4ec7c67ca293fcbdd886d4995fdf382b955e79db066a3f07a1d444682279e11a","observation_id":"60031fa8-d1b2-4d9e-ac79-746eb84c8c87","resolution":{"observed_at":"2026-08-15T20:52:15.900326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.904615Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.904615Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:90170b55d58ee9d9b440758a745bf72eff828e095fe96399c6ea55bb2f3e4acf","observation_id":"4ce9db86-1999-470d-8155-96053a3c25ec","resolution":{"observed_at":"2026-08-15T20:52:15.904615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.908759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.908759Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:2649ce59727b49a36ee6d26a85e969aa75b74d1e76d467b13b99fc12e12010e6","observation_id":"7cec2532-cd5a-4414-8135-6becd8038079","resolution":{"observed_at":"2026-08-15T20:52:15.908759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.556433Z","title":null,"venue":null,"work_id":"f2da0497-9c13-4f13-bfda-b48479c6944d","year":1999},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.913094Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:4b25265b723cd4d6c1b9ff5ea0d6148f64b0dcb96916f97d0d835d9df6c53f71","observation_id":"85bb0d07-65c8-4179-8b85-d7dbabe780bd","resolution":{"observed_at":"2026-08-15T20:52:16.561310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.539290Z","title":null,"venue":null,"work_id":"80e9dec4-07ea-41cb-9bf7-01c61dbd0091","year":2024},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.917947Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:74720ff6f518a5355d4b5d41307fb18b35ae21b4a09c5d5ab502afad7bab3bce","observation_id":"99621ce5-1fcb-42a1-be4e-5ba4f055cfb8","resolution":{"observed_at":"2026-08-15T20:52:16.544356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-17T08:49:52.717771Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-15T20:52:15.923080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.923080Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:58419b0a08a448e153d7fdd32d22db72e0aca9ed9b21948b2ec46a147fd63ca5","observation_id":"27a5002f-8dd5-471b-99bd-417cee32d824","resolution":{"observed_at":"2026-08-15T20:52:15.923080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.928985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.928985Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:45574b682d9718d2accd08ac3a76a17a13dba39bfb1124abb248bd9b43d5bcd5","observation_id":"1bf04891-3e13-4240-be05-c998aae1a61a","resolution":{"observed_at":"2026-08-15T20:52:15.928985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.509578Z","title":null,"venue":null,"work_id":"63bc5676-0588-4c54-a4a6-98c176c2ca74","year":2002},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.934256Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:382e4da550ff790c185cbd8ba1fef546aadadc6eb68d2c7d77a906d6a66892a8","observation_id":"ec796b18-65fd-4cc5-a77a-8f7563445835","resolution":{"observed_at":"2026-08-15T20:52:16.515007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-15T20:52:15.939911Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.939911Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:4dbe246160c5304a4fa57097f2f74fbc1b8b22cea1b5f06f4a8fb310d251f9b0","observation_id":"fd885281-6373-4f5d-9fe6-2571e34e8ebb","resolution":{"observed_at":"2026-08-15T20:52:15.939911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.945505Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.945505Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:731735754d73cf3d339ee4414a3cb7a510c81c0936b7a63f6e48131d3146b2ad","observation_id":"26999ed6-402f-43ee-8b98-d0ecba9448f0","resolution":{"observed_at":"2026-08-15T20:52:15.945505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.479860Z","title":null,"venue":null,"work_id":"9a8e9794-6621-4ed5-8a69-d82d1c989eb2","year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.950355Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:02399e3d034584e8957551e47cd6730881fd2038a7b2f585922d202455892d8e","observation_id":"ec019236-0aeb-45d0-9fbb-c2e864adf274","resolution":{"observed_at":"2026-08-15T20:52:16.485216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-20T13:33:56.038060Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-15T20:52:15.955259Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.955259Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:bb3aecf1dd86db6b840b071ba4beb77a4e11b97f4fcbb039c64f2221a40c8d08","observation_id":"d52e11df-71b6-4140-b3e9-f58d670e1e82","resolution":{"observed_at":"2026-08-15T20:52:15.955259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14334","last_updated":"2023-07-26T17:52:22Z","snapshot_observed_at":"2026-08-16T15:13:02.877614Z","submitted_at":"2023-07-26T17:52:22Z","title":"Towards Generalist Biomedical AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14334","snapshot_observed_at":"2026-08-15T20:52:15.960802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.960802Z"},"links":{"cited_paper":"/paper/2307.14334","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:0d740ed11bf68bf9b82d29567e15e6c5e6d9e4fabbf5b89489d3c8305c4cc9f9","observation_id":"c502c932-4b3f-4e1b-8c9b-c0d10e69fae9","resolution":{"observed_at":"2026-08-15T20:52:15.960802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-20T12:26:09.544873Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-15T20:52:15.966499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.966499Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:d5b2481de802dffe33527a1a2830d6e1b9517f2aaaead6102660e37f6bdae854","observation_id":"62e19b43-25cc-4929-bff4-926201a354b8","resolution":{"observed_at":"2026-08-15T20:52:15.966499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:52:15.971613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.971613Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:59d79cb9e15b38c84cd3182d50304cda97bad02d8d76d4aa197a741f4545e426","observation_id":"31e83056-c601-4f4b-9e4c-0b4f6bc2ea90","resolution":{"observed_at":"2026-08-15T20:52:15.971613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05342","last_updated":"2024-03-20T20:37:17Z","snapshot_observed_at":"2026-08-20T19:52:51.832125Z","submitted_at":"2023-08-10T05:10:17Z","title":"Metacognitive Prompting Improves Understanding in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05342","snapshot_observed_at":"2026-08-15T20:52:15.976781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.976781Z"},"links":{"cited_paper":"/paper/2308.05342","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:db46db8f5a4865f2f998d5381a39d03314d545e829cd055c34fe4016170dd052","observation_id":"0ed5c82e-5a2f-4981-85b3-0e38ec60b5f2","resolution":{"observed_at":"2026-08-15T20:52:15.976781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14454","last_updated":"2023-08-25T14:08:38Z","snapshot_observed_at":"2026-08-20T03:33:07.385359Z","submitted_at":"2023-04-27T18:29:05Z","title":"PMC-LLaMA: Towards Building Open-source Language Models for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14454","snapshot_observed_at":"2026-08-15T20:52:15.981975Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.981975Z"},"links":{"cited_paper":"/paper/2304.14454","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:6c0b496276296e300a71a3077c0f93f5769b0b78a834d4855b71b7cee408463e","observation_id":"d6a6421d-a7c4-4106-9d8f-69d28feb8bf5","resolution":{"observed_at":"2026-08-15T20:52:15.981975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01097","last_updated":"2023-04-17T17:06:29Z","snapshot_observed_at":"2026-08-19T17:32:38.754136Z","submitted_at":"2023-04-03T15:57:51Z","title":"DoctorGLM: Fine-tuning your Chinese Doctor is not a Herculean Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01097","snapshot_observed_at":"2026-08-15T20:52:15.986548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.986548Z"},"links":{"cited_paper":"/paper/2304.01097","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:f050b9ca60c53a3b9f866cc3ff040ce152ea1c5df56fe18bd453ce8d551821e3","observation_id":"44085475-2b97-4358-981d-f60b41e82d89","resolution":{"observed_at":"2026-08-15T20:52:15.986548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01196","last_updated":"2023-12-02T21:05:22Z","snapshot_observed_at":"2026-08-16T15:43:07.047307Z","submitted_at":"2023-04-03T17:59:09Z","title":"Baize: An Open-Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01196","snapshot_observed_at":"2026-08-15T20:52:15.993415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.993415Z"},"links":{"cited_paper":"/paper/2304.01196","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:8ac3553eab6b615604024fa6f9573fd5cdcbb64b3dd0faed98a6ef51e9d82bb9","observation_id":"6f264726-f235-421e-a510-d611fd71af91","resolution":{"observed_at":"2026-08-15T20:52:15.993415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07340","last_updated":"2023-05-12T09:37:13Z","snapshot_observed_at":"2026-08-16T15:33:37.967255Z","submitted_at":"2023-05-12T09:37:13Z","title":"MedGPTEval: A Dataset and Benchmark to Evaluate Responses of Large Language Models in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07340","snapshot_observed_at":"2026-08-15T20:52:15.999735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.999735Z"},"links":{"cited_paper":"/paper/2305.07340","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:04993bb0dfa5887095216aba695afd2f4c99d0f69bb8bffa408a0a8719a21081","observation_id":"7bcb0c7c-1f6a-42b9-8737-f99deb595d32","resolution":{"observed_at":"2026-08-15T20:52:15.999735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.006632Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.006632Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:04a3dca88da6ba42ff1d68e2ea44f32a7e2f3f34fbf5a382bb2bcd0fbc14cdb6","observation_id":"9a442ca2-7af7-4e24-b452-500945c5925b","resolution":{"observed_at":"2026-08-15T20:52:16.006632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T20:52:16.011526Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.011526Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:104c9fde3b1e866e7ba4fcc452fb0d65afac99fe6661cc6a633d0912e3544ec8","observation_id":"f3741cb3-ea52-4b82-ac10-7fd2b015fbae","resolution":{"observed_at":"2026-08-15T20:52:16.011526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T20:52:16.016392Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.016392Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:27dde25473f4eb84d25b5e7787bb09dc97f0dcdaa4bc04db5418a2deee09f323","observation_id":"a460ea7c-0bef-4bbc-860a-30cb27ad795b","resolution":{"observed_at":"2026-08-15T20:52:16.016392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.021831Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.021831Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:32dba85eeeb8a3bff8e30c8dbeb82e2cc338c6deefa449a88a399dbc7bfa9113","observation_id":"f9f921f0-261d-437f-a04e-24c482c895c0","resolution":{"observed_at":"2026-08-15T20:52:16.021831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.027375Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.027375Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:7db0519dd5334547128be4dce831575ab3fb7910150e89e7e7933dcfba4511da","observation_id":"1da77e8c-2915-4da3-9140-e64a5116ad75","resolution":{"observed_at":"2026-08-15T20:52:16.027375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.11887."}