{"as_of":"2026-08-22T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:778153bf26e6717a427d5b1fa83aebe2d617efb6ef34b28733eee89e24029208","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:46:29.739206Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:43.178158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:59:38.023398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-08-07T00:24:43.178158Z","title":"Automatic evaluation of healthcare llms beyond question-answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-13T08:27:47.041383Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:43.178158Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:328b6e3149ccbbb2e6e109c26cea3443462850231fae9208cb81360ca51182a9","observation_id":"a7c90f96-cebf-48a7-badc-0e7119573cee","resolution":{"observed_at":"2026-08-07T00:24:43.178158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-08-06T20:25:46.816118Z","title":"A., Hinjos, D., Bernabeu-Perez, P., Ganzabal, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02822","last_updated":"2025-07-03T17:33:58Z","snapshot_observed_at":"2026-08-18T21:55:45.146812Z","submitted_at":"2025-07-03T17:33:58Z","title":"SynapseRoute: An Auto-Route Switching Framework on Dual-State Large Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:25:46.816118Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2507.02822"},"observation_digest":"sha256:569c21e44f42d04581b091be2acaea8f0d49765452747932b6550b1fe0a12af0","observation_id":"1c069bbc-05f8-45c3-9434-ccb6027cc855","resolution":{"observed_at":"2026-08-06T20:25:46.816118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"cited_work":{"arxiv_id":"2502.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06666","snapshot_observed_at":"2026-07-04T05:59:38.023398Z","title":"Automatic evaluation of healthcare llms beyond question-answering","venue":null,"work_id":"80523b61-d697-4fcf-804d-95f49c7830df","year":2025},"citing_paper":{"arxiv_id":"2606.21023","last_updated":"2026-06-19T01:21:10Z","snapshot_observed_at":"2026-08-13T01:46:34.753063Z","submitted_at":"2026-06-19T01:21:10Z","title":"Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:58:55.680525Z"},"links":{"cited_paper":"/paper/2502.06666","citing_paper":"/paper/2606.21023"},"observation_digest":"sha256:ad4d89baa1593f093d954e143821080a43718756c0ed1a5c72c4e947a1743b71","observation_id":"aef5af40-d332-46b6-be89-6e4407f554e4","resolution":{"observed_at":"2026-07-04T05:59:38.025037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06666/citation-record","integrity":"/paper/2502.06666/integrity","json":"/paper/2502.06666/citation-record.json","paper":"/paper/2502.06666"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.518909Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.518909Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:fc9d48cf347f2a8be51f942db9db1a0417f009b8b2c4ad90b96335dcb85d3b78","observation_id":"3bbbf59a-aebb-4d4b-820c-079cd9576153","resolution":{"observed_at":"2026-08-08T14:46:29.518909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.524615Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.524615Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:ece1b32fb5071b6e07d54304d1cc547f4e45c40e40fb3756cb2862876248e97d","observation_id":"850463a7-aaa6-48be-9aa6-1c67d836d434","resolution":{"observed_at":"2026-08-08T14:46:29.524615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01463","last_updated":"2023-09-26T20:52:46Z","snapshot_observed_at":"2026-08-16T14:57:22.448855Z","submitted_at":"2023-09-26T20:52:46Z","title":"Creating Trustworthy LLMs: Dealing with Hallucinations in Healthcare AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01463","snapshot_observed_at":"2026-08-08T14:46:29.530844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.530844Z"},"links":{"cited_paper":"/paper/2311.01463","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:20c363436f272daac672b43454535b2943c271bc47b8a1d52205f9eba87e2681","observation_id":"1283dea7-4db4-486d-b74a-b7deb8fde1f0","resolution":{"observed_at":"2026-08-08T14:46:29.530844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.796723Z","title":null,"venue":null,"work_id":"563870b9-d095-456d-84c2-f1d9d86276bd","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.536495Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:6d7ad460eb46643edfea3817c2c997de5a29600aedf8f7dc23953899a3d6020b","observation_id":"5ccc4589-99dc-4076-aae0-cc38f0092862","resolution":{"observed_at":"2026-08-08T14:46:30.803045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01781","last_updated":"2024-07-03T11:20:43Z","snapshot_observed_at":"2026-08-18T18:45:01.785556Z","submitted_at":"2024-02-01T19:12:25Z","title":"When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01781","snapshot_observed_at":"2026-08-08T14:46:29.541762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.541762Z"},"links":{"cited_paper":"/paper/2402.01781","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:cff627629bc555aed542830f7561c0d18540a375b544bff45c39fc133abc7c5c","observation_id":"6aabf32b-0f38-4f7f-9150-377d5b946014","resolution":{"observed_at":"2026-08-08T14:46:29.541762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.778928Z","title":null,"venue":null,"work_id":"bf6e6dc8-5724-44eb-8b65-657b97d194e5","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.547732Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:32883c028d6cc55d7545606b60d4107044f6f6eb8ccde1dee9c4a5d12c63b650","observation_id":"1af37629-8959-4fb4-98c3-8911f50eb717","resolution":{"observed_at":"2026-08-08T14:46:30.784194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.762741Z","title":null,"venue":null,"work_id":"3af6653a-a1f4-4887-a52a-836315963a63","year":2019},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.553071Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:02b1f64a9f65888794d42ed10b5ffb31f29c92d423cd8dc83b0be08681affbc6","observation_id":"3388325f-8e7c-445d-9dc7-db424159e0cb","resolution":{"observed_at":"2026-08-08T14:46:30.768023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.745932Z","title":null,"venue":null,"work_id":"a20113ff-cc77-419a-8ec1-9ee47f5ef76e","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.557764Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:fedc9a774aee86b3dbb9a4087cb083fb76e13b8e6e2e707ced11fb661e56025a","observation_id":"fd74d032-ca36-478f-a1cf-dca14b31099b","resolution":{"observed_at":"2026-08-08T14:46:30.750939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16326","last_updated":"2025-04-25T22:22:45Z","snapshot_observed_at":"2026-08-19T01:38:50.630582Z","submitted_at":"2023-05-10T13:40:06Z","title":"Benchmarking large language models for biomedical natural language processing applications and recommendations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16326","snapshot_observed_at":"2026-08-08T14:46:29.562681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.562681Z"},"links":{"cited_paper":"/paper/2305.16326","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:37726f3f5ace3ccc153bc94a0f467209c0736220bee54cf735ac5ffb5f7fe20c","observation_id":"28edeeb4-31ab-4c99-a644-4632cc037651","resolution":{"observed_at":"2026-08-08T14:46:29.562681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.727901Z","title":null,"venue":null,"work_id":"fafc3136-2ca6-4174-86eb-a3fe50891a02","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.567264Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:3a1d022168e3ef01520ff259ec97e222c5598e85d8a733c8a601ede75617642e","observation_id":"7a4a866f-3a30-487f-8de7-f4156a649dae","resolution":{"observed_at":"2026-08-08T14:46:30.733748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06142","last_updated":"2024-08-12T13:37:31Z","snapshot_observed_at":"2026-08-20T14:16:38.850094Z","submitted_at":"2024-08-12T13:37:31Z","title":"Med42-v2: A Suite of Clinical LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06142","snapshot_observed_at":"2026-08-08T14:46:29.571758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.571758Z"},"links":{"cited_paper":"/paper/2408.06142","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:95fb4fceae63e9cc7a292860ba67e1156732912850ec43c888fd6b43f7196265","observation_id":"9635c7ba-dacb-4501-b06f-eee813c20d76","resolution":{"observed_at":"2026-08-08T14:46:29.571758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.576417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.576417Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:030b73ceaca561b2b50ce72a0b29beee03120236ed8788883147df3200107203","observation_id":"5c711ba1-461b-444e-8ed5-dfe3a5eded22","resolution":{"observed_at":"2026-08-08T14:46:29.576417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.709586Z","title":null,"venue":null,"work_id":"52166d2b-a253-4ff5-8d45-b7874d842677","year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.580866Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:38f9c5be3992e377fd789d6edae22b1da62f4931ad8592ff8c8085bbf2d51001","observation_id":"01300569-716a-4cac-824b-8bd5f3a6a6e7","resolution":{"observed_at":"2026-08-08T14:46:30.714409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.694096Z","title":null,"venue":null,"work_id":"3b8e2f28-868d-4591-8c4d-b0b30e374086","year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.585068Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:6a54028678f6dada6b1aeeca7734e91c72f0eadd7d73b9305d12cf4d1559b2bf","observation_id":"440f50b2-e9ed-4cfc-b551-49af38c70ebf","resolution":{"observed_at":"2026-08-08T14:46:30.699053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-19T11:12:45.951488Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-08T14:46:29.589392Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.589392Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:212857dafc15f30f6f919919028e46702ed9845f0ecad86cf5c9bd35d698a812","observation_id":"8e935abc-8196-4705-a420-85dbca0cfb18","resolution":{"observed_at":"2026-08-08T14:46:29.589392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.678026Z","title":null,"venue":null,"work_id":"0e90c5f3-b3b6-420f-8afd-439ba5c196a2","year":2019},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.594081Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:a1163c02e51af706dc23e95651c0e5ecc107f08c6615abd32bbcdc90a459a512","observation_id":"44131d9a-7334-4e33-8906-33b8c62b6ce9","resolution":{"observed_at":"2026-08-08T14:46:30.682768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.662453Z","title":null,"venue":null,"work_id":"6abfd167-2194-423e-bcd0-9a8334424d61","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.598397Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:5c1ffbf5a5ba5958bda80859ebe65240225eefa5d9b55000d685fd8609ebe479","observation_id":"20418767-79d8-435c-b263-446c64329612","resolution":{"observed_at":"2026-08-08T14:46:30.667239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.647907Z","title":null,"venue":null,"work_id":"886f3f07-37d4-497d-937b-d514f6fa354e","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.602500Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:72f8d595287bf645b9f2fc70497f40a0fafc3b84e8f82afddfb13440af7db872","observation_id":"07faaac9-8b9b-425d-b429-8a96bcfb4bf2","resolution":{"observed_at":"2026-08-08T14:46:30.652222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.607256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.607256Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:d99bf5a2241d05c0238a30a0bcb4b6198868b4987b293a318f3a78a72e0d783d","observation_id":"1cb332e2-6ba8-4ea8-a7fd-0ac708d83133","resolution":{"observed_at":"2026-08-08T14:46:29.607256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.622958Z","title":null,"venue":null,"work_id":"92012bae-9e50-4181-aaaf-65f108b21ec6","year":2025},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.612072Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:b69e28262617b30ee8e612de0996263dc60e86a11cbfab338eca332aa192f6ab","observation_id":"9bd9f22d-b078-43da-9ff9-f952e8c3dc0a","resolution":{"observed_at":"2026-08-08T14:46:30.627441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-18T15:11:49.913463Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-08T14:46:29.617054Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.617054Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:41f318f23b7f48b01600a765ba224d1c66fe0ec3da5b55fefbf302f5df8e3a4d","observation_id":"4423f7ba-ae5a-4110-b5eb-b549d5e66654","resolution":{"observed_at":"2026-08-08T14:46:29.617054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12701","last_updated":"2024-10-15T14:21:54Z","snapshot_observed_at":"2026-08-22T06:34:18.622579Z","submitted_at":"2024-05-21T11:50:16Z","title":"OLAPH: Improving Factuality in Biomedical Long-form Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12701","snapshot_observed_at":"2026-08-08T14:46:29.622140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.622140Z"},"links":{"cited_paper":"/paper/2405.12701","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:4b9d58509aa404e936f691b1ca741b76da53adafa290b1dc5a63eaa4b8ed5c01","observation_id":"392f9416-a4a5-4d90-8580-321bc43a5b50","resolution":{"observed_at":"2026-08-08T14:46:29.622140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.626947Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.626947Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:0ced5e4cb0824c8135dae5ef22d77b2a2e784c7cb646142c088604fbe8f16ddd","observation_id":"964883e9-d484-40f2-b3b1-59070b34ff6f","resolution":{"observed_at":"2026-08-08T14:46:29.626947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.598113Z","title":null,"venue":null,"work_id":"12e8a003-7b28-4854-bb2a-18b95e932e82","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.631736Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:116abc9cb09bc678e3f797594337310a53ba81cec6c22011213c55992eeda0af","observation_id":"0d0431a9-aa5f-40de-ab3f-5a303d3d5f03","resolution":{"observed_at":"2026-08-08T14:46:30.602584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07314","last_updated":"2026-07-28T17:58:21Z","snapshot_observed_at":"2026-08-21T20:40:41.988793Z","submitted_at":"2024-09-11T14:44:51Z","title":"MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07314","snapshot_observed_at":"2026-08-08T14:46:29.636932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.636932Z"},"links":{"cited_paper":"/paper/2409.07314","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:156a8f5822ad70d683c0a738332a878a285983bbd7845aec07705d8cf5d04c24","observation_id":"3d3cc3b0-46af-4e9a-9014-4905e879e5b6","resolution":{"observed_at":"2026-08-08T14:46:29.636932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-08T14:46:29.642901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.642901Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:c75a28e63074afebdb237be8bf4758d74a952df2066360a0972d5abe9627c334","observation_id":"5904f9a0-4020-4755-8ee1-a246be78e0f0","resolution":{"observed_at":"2026-08-08T14:46:29.642901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.649246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.649246Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:e10b5bef8683b8c483ecd9a5837bba223bd49f4ae15f3ad54c374f4d8b83275c","observation_id":"4d478e3f-6162-4489-ac08-11f8185db780","resolution":{"observed_at":"2026-08-08T14:46:29.649246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-20T16:15:34.790783Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-08T14:46:29.654391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.654391Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:9dcb8f8cc1333882f1b41ec214169fa15175d0f729db181eb96b5b5f6a1f09de","observation_id":"a1f7d08c-4030-4d6a-8592-d22be6238419","resolution":{"observed_at":"2026-08-08T14:46:29.654391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17752","last_updated":"2024-05-23T13:32:25Z","snapshot_observed_at":"2026-08-20T21:55:07.779366Z","submitted_at":"2024-03-26T14:43:48Z","title":"Can multiple-choice questions really be useful in detecting the abilities of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17752","snapshot_observed_at":"2026-08-08T14:46:29.659804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.659804Z"},"links":{"cited_paper":"/paper/2403.17752","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1f0739587c366717002c8c8057fa2e67c3c148ed1efbfca4c4d3491b7978637f","observation_id":"06638153-b732-4a2b-b7cd-4d6773385d08","resolution":{"observed_at":"2026-08-08T14:46:29.659804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.665017Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.665017Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:14426c015b0ed75201c247740d4b26dd1a31a0ed00e3de8240d5274edaadf3e7","observation_id":"72b9fa63-f5b0-4111-b76f-2de3e5766a7c","resolution":{"observed_at":"2026-08-08T14:46:29.665017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.562293Z","title":null,"venue":null,"work_id":"cf047a76-0fdd-4446-87eb-41549147e246","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.669943Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:c5294e9b195392a5b790259a3c70c627caae221deb808f141177369f866c8448","observation_id":"33493c1d-cef7-4509-a595-612aed3e0b27","resolution":{"observed_at":"2026-08-08T14:46:30.567180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-19T22:01:31.805341Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-08T14:46:29.674840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.674840Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8db2dec231d821b52dd500207d776ec33b032152067ca82d6f3d5a597cabdcd6","observation_id":"6d208892-cbb9-4c0b-9ffc-f8b009381b9f","resolution":{"observed_at":"2026-08-08T14:46:29.674840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.122628Z","title":null,"venue":null,"work_id":"c1d1ed9e-c53e-4ed8-9499-dfcd12339b94","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.680052Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:a41d1570210850b8697924f83e05755b4682cf19531c47b8a3b7cbc481b2c4ed","observation_id":"bb731652-7e56-4dad-9ed5-5907e3f4c78f","resolution":{"observed_at":"2026-08-08T14:46:30.129401Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07348","last_updated":"2024-05-14T16:44:02Z","snapshot_observed_at":"2026-08-16T13:53:22.075523Z","submitted_at":"2024-05-12T17:54:50Z","title":"MedConceptsQA: Open Source Medical Concepts QA Benchmark","version":2},"cited_work":{"arxiv_id":"2405.07348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07348","snapshot_observed_at":"2026-08-08T14:46:29.904520Z","title":"MedConceptsQA: Open Source Medical Concepts QA Benchmark","venue":"cs.CL","work_id":"903d91f4-b48e-4214-9079-9f177a97a1a2","year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.684247Z"},"links":{"cited_paper":"/paper/2405.07348","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:8c53e71e49394d2d10abfb58f184aac17911c3d63b834014e34f664d1041c596","observation_id":"5acaf2af-1191-46c6-b54f-942db7a0b691","resolution":{"observed_at":"2026-08-08T14:46:29.912044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-08T14:46:29.688673Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.688673Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:33cbdf2f634fd21d3c81de6b09227720dc2093d7b05f429e16c1da4d6c99cf80","observation_id":"00f716b3-e7bf-4484-b15f-2057fbb985da","resolution":{"observed_at":"2026-08-08T14:46:29.688673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.693191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.693191Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1b9d3a1602a94ac2ef9a9f5f54d9f15c029425a9d808335a5b2bb91a56a62083","observation_id":"46d4251d-b837-4d1d-b415-b098e7988428","resolution":{"observed_at":"2026-08-08T14:46:29.693191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15343","last_updated":"2023-10-14T17:04:12Z","snapshot_observed_at":"2026-08-17T19:54:07.444845Z","submitted_at":"2023-07-28T06:43:04Z","title":"Med-HALT: Medical Domain Hallucination Test for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15343","snapshot_observed_at":"2026-08-08T14:46:29.697697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.697697Z"},"links":{"cited_paper":"/paper/2307.15343","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:02f7d05e661f02d8fcb6b9129c35f9db59f4363f7603afe14f382b98451561a1","observation_id":"dba1cb38-769e-414f-9922-53724a2b5405","resolution":{"observed_at":"2026-08-08T14:46:29.697697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02424","last_updated":"2018-10-22T13:48:32Z","snapshot_observed_at":"2026-08-14T21:36:10.546624Z","submitted_at":"2016-10-07T20:56:47Z","title":"Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02424","snapshot_observed_at":"2026-08-08T14:46:29.702216Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.702216Z"},"links":{"cited_paper":"/paper/1610.02424","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:3829e78a35a8a7f8e86a1aa029a417f40ca85ad77c791d5b513eb934e298e5a4","observation_id":"e1bdcd6b-34f9-44d8-ab92-4e53efafbd26","resolution":{"observed_at":"2026-08-08T14:46:29.702216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.545083Z","title":null,"venue":null,"work_id":"6391f837-7b1d-45fe-8a6b-9e310207cfeb","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.706924Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:4e9a9dd7dcfba5fad6408f6a5721037df1fe13ec25e66a48dfca1ea2bc294f96","observation_id":"b8b97ea0-ae19-4636-9444-e8de7230ceea","resolution":{"observed_at":"2026-08-08T14:46:30.550064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-08-20T06:55:44.064896Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-08T14:46:29.711348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.711348Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:e18fee0b1af94e463fb22c8ca7be20b43e55f167e02321074812a5ed5d2fd593","observation_id":"2dc0e316-f4cc-42ef-acf0-53d56e2330f3","resolution":{"observed_at":"2026-08-08T14:46:29.711348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T14:46:29.716103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.716103Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:ab9846c13f1c10432f93a45beedd0e8270881958426d609385005b115a1fc7c1","observation_id":"47b87c55-fc5a-49fc-b430-c79d3cf665fb","resolution":{"observed_at":"2026-08-08T14:46:29.716103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.528783Z","title":null,"venue":null,"work_id":"f405296d-8b57-4cd0-9eda-31464786c7d9","year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.720920Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:4aaf6b2e195df7d915ef10eae978cbfd64e04bd224ad73e9fa5873d1e5f9e200","observation_id":"b92ceb5f-1482-4682-ad61-0c2c8d846ab5","resolution":{"observed_at":"2026-08-08T14:46:30.533821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-08T14:46:29.725457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.725457Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:df09c5eb42ade406cb0fd745d754264baf51f835fe8afd9c8eb6bf74f6cf0a14","observation_id":"6d6a70cd-7650-4683-b5ac-fc082ea71c30","resolution":{"observed_at":"2026-08-08T14:46:29.725457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:30.511840Z","title":null,"venue":null,"work_id":"3db5f781-fd97-4f47-8dfc-11625f1ed46a","year":2020},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.730073Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:9b0aebc132c9eac4ccff8d9d70c9b6463b66b93e936158e07fa5c4d7f8eb311b","observation_id":"82c598b2-ef86-45c9-97a5-b2c12086f074","resolution":{"observed_at":"2026-08-08T14:46:30.517346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:46:29.734491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.734491Z"},"links":{"citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:1feb26cb3add9ed1f0d9965ec81b3859b765ea1be37e7a81af486c6ac127b3c5","observation_id":"158089a1-6082-4287-ab4b-1ad3f226d83f","resolution":{"observed_at":"2026-08-08T14:46:29.734491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05112","last_updated":"2024-07-22T12:16:30Z","snapshot_observed_at":"2026-08-16T14:44:47.131608Z","submitted_at":"2023-11-09T02:55:58Z","title":"A Survey of Large Language Models in Medicine: Progress, Application, and Challenge","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05112","snapshot_observed_at":"2026-08-08T14:46:29.739206Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:46:29.739206Z"},"links":{"cited_paper":"/paper/2311.05112","citing_paper":"/paper/2502.06666"},"observation_digest":"sha256:a03454e2a847daba8a830e24deaf5ff6c8e06757152962aef42324ee9ffccc4b","observation_id":"cd1c6953-d553-4d06-b0cc-25c632d18d78","resolution":{"observed_at":"2026-08-08T14:46:29.739206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06666","last_updated":"2025-02-10T16:52:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T02:27:49.966430Z","submitted_at":"2025-02-10T16:52:39Z","title":"Automatic Evaluation of Healthcare LLMs Beyond Question-Answering"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 3 inbound Pith citation observations for arXiv:2502.06666."}