{"as_of":"2026-08-14T02:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e570691bbc70ee8eed2e322bab0a24dbc3fe0e19aa3f42951b09e9920d13f7b","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:42:18.697628Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:18:59.283834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:24:01.661042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"cited_work":{"arxiv_id":"2507.18143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18143","snapshot_observed_at":"2026-06-29T23:24:01.661042Z","title":null,"venue":null,"work_id":"982cd8a3-f618-4737-99bb-a3eadb99e508","year":2025},"citing_paper":{"arxiv_id":"2605.25273","last_updated":"2026-05-24T21:59:32Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-24T21:59:32Z","title":"LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T23:18:59.283834Z"},"links":{"cited_paper":"/paper/2507.18143","citing_paper":"/paper/2605.25273"},"observation_digest":"sha256:d488aaf121c4028d6bee8d9bcafeb5c92dda5e041cdbbf819a39ea121b909c5c","observation_id":"19b33552-b332-4037-a819-f9cd47f40acb","resolution":{"observed_at":"2026-06-29T23:24:01.662324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18143/citation-record","integrity":"/paper/2507.18143/integrity","json":"/paper/2507.18143/citation-record.json","paper":"/paper/2507.18143"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.339491Z","title":"& Topol, E","venue":null,"work_id":"c71ab94c-6e6a-4c83-bbc5-69ac8ac4238f","year":2025},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.327944Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:348a48bee5e9e541fc0ac0d8cb182e812a5312cade9f36535a4de5a658c6e733","observation_id":"d00093d7-01e1-48eb-bb8c-7a925d5f04f4","resolution":{"observed_at":"2026-08-06T14:42:20.345475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.314764Z","title":null,"venue":null,"work_id":"a109c08f-6db5-4c4a-9d87-83497538f896","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.333246Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:be3f56427caf87170f46db14bb93238087a5f059c688ecf7a779a6fae14ae2a3","observation_id":"cbade836-7e62-48fc-a0c6-56b58dc1a4dc","resolution":{"observed_at":"2026-08-06T14:42:20.324802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.295598Z","title":"& Taylor, R","venue":null,"work_id":"b10c1c01-4467-4a84-827a-3f7d1fd6ecef","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.338407Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:4b12fa84ba8e4637fd390244319a21b6a5f4f22d2d73bcc0e940f9d7f8c998c4","observation_id":"8cb3275f-2cd7-4c1e-87aa-50b5aa0d57b9","resolution":{"observed_at":"2026-08-06T14:42:20.301557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.273254Z","title":null,"venue":null,"work_id":"4b22c082-572a-4e61-b2d1-5f2e08cabf3d","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.348108Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:bcf8dcd246e23dbf501b17e07120a6e4684821abfcd8af7d06588ec1be2e3f03","observation_id":"a07a9f0c-7f11-4a62-aac3-8816d3a708b3","resolution":{"observed_at":"2026-08-06T14:42:20.279241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.253904Z","title":null,"venue":null,"work_id":"344f0fbb-7082-4803-af82-3e2bdcb1ed79","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.353270Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:3213261463da399d2f3342ba3e0d9c9bb6616dca6ad6c5def979004bd8dafaa8","observation_id":"7ab591a6-d8c3-434a-a2e7-c59205dfc5b0","resolution":{"observed_at":"2026-08-06T14:42:20.258544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.230721Z","title":null,"venue":null,"work_id":"76bc76c8-1bab-4b11-b1b5-26b743f3cf18","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.358167Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f29287648475a72104d4e3b4cba1d84cf4041a018d5fad39106faab893fc7199","observation_id":"d1145283-b369-458e-8b44-981598025c41","resolution":{"observed_at":"2026-08-06T14:42:20.238457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.211142Z","title":"Large language models improve clinical decision making of medical students through patient simulation and structured feedback: a randomized controlled trial","venue":null,"work_id":"551b1cf4-863c-4cc2-aa5b-dbbdc3c6d2c0","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.364769Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:c520a47a232f24771be3624c03b8d76a4246105e185e2b1add94582f56548e5d","observation_id":"3bfe12e4-5e2b-4491-a1f7-701e880d3e76","resolution":{"observed_at":"2026-08-06T14:42:20.216975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-13T05:15:47.720293Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T14:42:18.370147Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.370147Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:ceb4bb3d448043f6171ad9ebfeb73b28ca91d5ec645fd2bdb18162f67fb505e6","observation_id":"9850c560-7d20-4d05-8d5e-bf9bf6e0f933","resolution":{"observed_at":"2026-08-06T14:42:18.370147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.184980Z","title":"& Petro, J","venue":null,"work_id":"35a267a1-35bf-4ce4-93de-ec26c3da4a80","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.376914Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f68c26ac1c8d80e8d5e6dca8a88aadde9deccb738eaf6c4c03e2fd0f84d50b3d","observation_id":"b520f252-391d-40a0-bada-e08f7a2c7906","resolution":{"observed_at":"2026-08-06T14:42:20.195521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.162757Z","title":null,"venue":null,"work_id":"e870887f-4cec-4113-acaf-ce212eb0564c","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.382624Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:0eb83e99e969f4264da3369ccacf294d8b8e1fe902962c2355f93b4bb33e8238","observation_id":"a43450ec-d55d-429d-a722-69591d5051e0","resolution":{"observed_at":"2026-08-06T14:42:20.169555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.138068Z","title":null,"venue":null,"work_id":"91280004-53b7-49b5-b5fd-29eb0d7c8d24","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.388422Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:65a8b3bfadc5f3851da0b3b14c60839e1ffdbd07649d6e50b25b559efdb3c918","observation_id":"b9cd8862-9e6b-4482-940d-86bda2612c4e","resolution":{"observed_at":"2026-08-06T14:42:20.147090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.105559Z","title":null,"venue":null,"work_id":"f1944e60-8789-4dda-a4b0-c9e4f5e4be21","year":2017},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.396040Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:ec93358397f17c362ece26d32490de4c7d0561f7435b4754f071d9a54baccbdd","observation_id":"6d58057c-469f-4d10-a7ea-6dfd1cfea59f","resolution":{"observed_at":"2026-08-06T14:42:20.112418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.072390Z","title":"& Chow, C","venue":null,"work_id":"f72a4ae9-a2c4-405f-a01b-60c4e5a5063d","year":2020},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.401352Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:054935f99b92bf427bddf82020f5e8b6aa614e539d88a1b247f56049451039a8","observation_id":"a0268c01-e7f3-4dd3-b561-f2d9bc5a82d7","resolution":{"observed_at":"2026-08-06T14:42:20.078979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.043706Z","title":"& Dussault, G","venue":null,"work_id":"2e5f75ca-519e-4e2c-a41a-422de8a775ab","year":2019},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.407255Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:62fa1be7493e1cf9bdcd135aacdcc3d878d5d3dc901aeb1658d7a2ab05471bd8","observation_id":"4258786c-ff17-458e-9d9a-3d0308c087c1","resolution":{"observed_at":"2026-08-06T14:42:20.049365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:20.018284Z","title":null,"venue":null,"work_id":"01a91bb1-5f9f-4016-926e-ff8b8ee91aa9","year":2025},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.414911Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:e47da64747d8b5d1b6b6f520678b42831b0647dcb991b7e6716ed546c2358900","observation_id":"df319221-9d75-4762-b780-023922aa6af9","resolution":{"observed_at":"2026-08-06T14:42:20.027482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.989177Z","title":"S., Link, K","venue":null,"work_id":"71917aa7-2db7-4ffe-a639-410529e68c52","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.423293Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:b2373795112fac10ee16f0f800b7e67aca15ed5ed4418563a62a18f5169c4774","observation_id":"4144b980-0807-4326-83eb-902099f163dd","resolution":{"observed_at":"2026-08-06T14:42:19.996200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.966467Z","title":"A., Lester, J","venue":null,"work_id":"84593340-d652-4915-bf10-09bf63b13fd2","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.428884Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:669465d70392c68e57fcd01b5c5b99b27a11e540713c8fbc46755bdb4bc0ec9f","observation_id":"8b1b808f-b918-46e3-90b2-adf5a6666d7f","resolution":{"observed_at":"2026-08-06T14:42:19.975130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.944304Z","title":null,"venue":null,"work_id":"3a2fdbc5-e0f0-40cc-92eb-53c097dde105","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.433357Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:463893d39b05707278dfa58cb6db22a8aef65cfd23ba319792e7efbabed8068f","observation_id":"e9b44823-ec67-431b-95af-2be9221ba3cb","resolution":{"observed_at":"2026-08-06T14:42:19.951455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07314","last_updated":"2026-07-28T17:58:21Z","snapshot_observed_at":"2026-08-12T22:46:57.588845Z","submitted_at":"2024-09-11T14:44:51Z","title":"MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07314","snapshot_observed_at":"2026-08-06T14:42:18.438834Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.438834Z"},"links":{"cited_paper":"/paper/2409.07314","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f01c677fa47258d753ca355cca78fd31397aacc026425d2bdcbbbdc1352ff0cf","observation_id":"194980ef-8d66-47ce-885c-05672c89046a","resolution":{"observed_at":"2026-08-06T14:42:18.438834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.919483Z","title":null,"venue":null,"work_id":"157e492b-3623-4012-8965-f6b4797e1ec0","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.444401Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:538c1e7c2489efaf07df68767278aaa7efcd0cb1c74bf300eb49aecfe1934f25","observation_id":"283e7acc-25df-4505-9085-9bf869211366","resolution":{"observed_at":"2026-08-06T14:42:19.927167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07960","snapshot_observed_at":"2026-08-06T14:42:18.449467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.449467Z"},"links":{"cited_paper":"/paper/2405.07960","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:c1539d29b40040f285ff28e17063ac0388e2dc7cc47c71f0af1fe69cb1c1d68d","observation_id":"b09057d3-9bd3-4014-bb7d-26f8b9c2eb2f","resolution":{"observed_at":"2026-08-06T14:42:18.449467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.895458Z","title":null,"venue":null,"work_id":"fb2de950-78cd-4a8d-9e04-6e08f539edbe","year":2025},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.457258Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:247b9f4fc89bb494039e7fa169585a6a9caafba5c9944bfbe1216e3a0db1cf22","observation_id":"bbbbf14a-1c89-4f74-8a0b-584165d72658","resolution":{"observed_at":"2026-08-06T14:42:19.900924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21203/rs.3.rs-4139743/v1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Research Square","work_id":"8827bba9-e135-45a9-af9a-ef5b1e7fb93f","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.466737Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:68907c315096aeba5edfdc1767d4e73615efc42e368c5eededa388f37e7fdb95","observation_id":"54eaaba1-7eaa-4eb1-97b4-c421d08e0230","resolution":{"observed_at":"2026-08-06T14:42:18.753396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.871941Z","title":null,"venue":null,"work_id":"42b6a868-6216-4746-879e-f9007204f6d4","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.472116Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:d4ac862ab06fc3dca688c063475a2e728d49fa50626f3e2f555d8c97e430bb4c","observation_id":"7100ea01-68b9-4964-9fa2-cf8de4a11d86","resolution":{"observed_at":"2026-08-06T14:42:19.881456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:18.478987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.478987Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:2bd81a83506321a4eec9a9f067f4357887052139c2e56c22d031feee20dbb107","observation_id":"905063a4-eb7c-40f9-a37b-15af8cd2b7b2","resolution":{"observed_at":"2026-08-06T14:42:18.478987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.832679Z","title":null,"venue":null,"work_id":"0d21bf03-d940-41d2-9ab1-947b5c8c819f","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.483722Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:3155f53e3d5505f7f715dff07c5531372cdac5fec59f1690550d55fe3437770c","observation_id":"30d1fa25-0606-4c56-873c-e0a04c54c838","resolution":{"observed_at":"2026-08-06T14:42:19.839199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13833","last_updated":"2024-08-25T13:36:22Z","snapshot_observed_at":"2026-08-12T22:57:52.507474Z","submitted_at":"2024-08-25T13:36:22Z","title":"Biomedical Large Languages Models Seem not to be Superior to Generalist Models on Unseen Medical Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13833","snapshot_observed_at":"2026-08-06T14:42:18.489506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.489506Z"},"links":{"cited_paper":"/paper/2408.13833","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:474991c13ad025b966093cf692e26b316a34b80bc4020064a07d12930d8a3406","observation_id":"f52043c0-b81a-4f05-9069-e414a76359e9","resolution":{"observed_at":"2026-08-06T14:42:18.489506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.809515Z","title":null,"venue":null,"work_id":"94b950c4-4aa8-47f8-b174-d2bf333a115a","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.497292Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:c763a6d1fc265f49d603b982f2e4cd3f646f81d6ccac311c4ad68d361e66a220","observation_id":"32ad7521-810e-4550-8e2f-19abbdb99079","resolution":{"observed_at":"2026-08-06T14:42:19.817052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.784802Z","title":null,"venue":null,"work_id":"d84eb325-5d5d-4a67-9a0b-d6f1fe6f5039","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.502209Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:e1bb50c9aa8305aec69b44726d08e28b5ca5cb0cbf8aeb94c2561cb4ad21a093","observation_id":"127a8375-058a-45e2-ba9d-17c2f4ffb014","resolution":{"observed_at":"2026-08-06T14:42:19.790721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.759031Z","title":null,"venue":null,"work_id":"0621ab5d-d8a8-4983-abb5-5343dc3c7aa8","year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.507177Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:cd5f773e855d035f0e63e644ff3eeeb25e231c7021100ab6626a8b879b21ab91","observation_id":"2c305b8a-1052-421a-8afb-cbb5ccd6ec79","resolution":{"observed_at":"2026-08-06T14:42:19.769605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.725089Z","title":"A., Lingohr-Smith, M., Rogers, R., Lin, J","venue":null,"work_id":"95423842-46e3-43d0-a110-a4dc5ce280ef","year":2021},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.515205Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:802409faae5dbe54e0fa0c8cd895bd59bec06d5b44dc15d4eac7f62ba725f7af","observation_id":"af8f18bc-6c5c-4b95-84b3-8c981eaebaba","resolution":{"observed_at":"2026-08-06T14:42:19.731208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.706132Z","title":null,"venue":null,"work_id":"73d1d080-b9e8-47e1-b06f-012bdfb55ecc","year":2025},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.519604Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:d59ef75ef4707a6ec1587ac5e8d399deb2523c5884b9ea921ce073b98c6bf5ec","observation_id":"6d6b0bb9-fb89-4bcf-85f7-e95a6da22a90","resolution":{"observed_at":"2026-08-06T14:42:19.712854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:42:18.525401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.525401Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f4c7657a776f9e51160e83c9e7f1c2f2ba9dc98a6b69147bc9956de4d1b13c3e","observation_id":"9b5f2c17-8b58-47fa-9b71-d29d63ef46c0","resolution":{"observed_at":"2026-08-06T14:42:18.525401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.687357Z","title":null,"venue":null,"work_id":"db8f4f71-7804-421f-8e4e-7a45bdac462a","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.531488Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:ea29099248dba5afc65917537a89f81ea457599f9c21376124b28b41d3afba57","observation_id":"1a0ddae2-c61f-4989-99e2-13ed60bfe4f6","resolution":{"observed_at":"2026-08-06T14:42:19.693675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06142","last_updated":"2024-08-12T13:37:31Z","snapshot_observed_at":"2026-08-12T23:04:57.569788Z","submitted_at":"2024-08-12T13:37:31Z","title":"Med42-v2: A Suite of Clinical LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06142","snapshot_observed_at":"2026-08-06T14:42:18.536520Z","title":"K., Raha, T., Khan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.536520Z"},"links":{"cited_paper":"/paper/2408.06142","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:241cd836456fa87f3fad19ab652e2231637e758b7892b3917275d2a02b2fad5f","observation_id":"e67a81bc-4767-41e5-ae98-d45116476693","resolution":{"observed_at":"2026-08-06T14:42:18.536520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:18.542389Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.542389Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f1b96f19d820783ca86faa7f31c5f5cb516c8920ea3f24412922211b44501624","observation_id":"b116b51f-60ef-42bf-a9f9-b39101152c97","resolution":{"observed_at":"2026-08-06T14:42:18.542389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.655350Z","title":null,"venue":null,"work_id":"a8bc32f1-6f75-485d-938a-1b4b4fefc379","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.547648Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:44336cbdd46d76d987b2fb36a763fa27206893e32342eb9ed8e0914765d4ee29","observation_id":"91abcdb6-f3b3-422d-8517-ae17d85f68f3","resolution":{"observed_at":"2026-08-06T14:42:19.663539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:18.553615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.553615Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:b522bc237e121d402b5ec9f1f78834e1d4c91559d9e21fa8fb5558f9d61afd2d","observation_id":"85188c7c-f502-4aad-828d-c21a2ebc916f","resolution":{"observed_at":"2026-08-06T14:42:18.553615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.626026Z","title":null,"venue":null,"work_id":"2329c769-fb59-4992-965f-bc66d06cf3eb","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.559307Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:b3a5b9c442122f0e7da7c8f6fd2812e8590b6bd8713d707c38c42437e4d63b68","observation_id":"238f3bf3-6cd0-4784-8f72-113d9b51bffa","resolution":{"observed_at":"2026-08-06T14:42:19.631293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09834","last_updated":"2024-11-19T21:04:38Z","snapshot_observed_at":"2026-08-12T20:13:29.236390Z","submitted_at":"2024-11-14T22:54:38Z","title":"A Benchmark for Long-Form Medical Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09834","snapshot_observed_at":"2026-08-06T14:42:18.565269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.565269Z"},"links":{"cited_paper":"/paper/2411.09834","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:b50f0a58d66d2c819b9319807e4ee9172ff645555acd223d0f91fff73804e8a0","observation_id":"733c0ab9-b198-48e8-a7fd-b0d6895220af","resolution":{"observed_at":"2026-08-06T14:42:18.565269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.594925Z","title":null,"venue":null,"work_id":"e861fb1c-50bf-4875-9960-093978d06290","year":2025},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.571529Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:7e4968529488f3792b08ee5df5e70b3970e4bc458dd1cf4cdc5cc9c0b97efaac","observation_id":"73429537-e222-466a-a55f-98764968841c","resolution":{"observed_at":"2026-08-06T14:42:19.601340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-06T14:42:18.577140Z","title":"& Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.577140Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:eb8986f3ae78f3a9f5767d677eb00515b6f222980b27751e6ee27019ff65bc1a","observation_id":"b656ce3a-8f40-43c1-8439-db8ba960243d","resolution":{"observed_at":"2026-08-06T14:42:18.577140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17887","last_updated":"2024-06-28T13:23:31Z","snapshot_observed_at":"2026-08-13T04:08:46.150447Z","submitted_at":"2024-02-27T21:01:41Z","title":"JMLR: Joint Medical LLM and Retrieval Training for Enhancing Reasoning and Professional Question Answering Capability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17887","snapshot_observed_at":"2026-08-06T14:42:18.584585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.584585Z"},"links":{"cited_paper":"/paper/2402.17887","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:d9c42d7a78377260343aa52c4125d0997d8fe3a0fbdc7719a8dbbeeb5ea0e062","observation_id":"7a870550-04c4-4e4a-a3c1-716001ae2c5e","resolution":{"observed_at":"2026-08-06T14:42:18.584585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:18.590156Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.590156Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f06338873982afea17b7840eb83883381e434a04dc3501f8cc10d08e0f89f383","observation_id":"850d7db2-28cd-4daa-97ec-fc87bfbdcac5","resolution":{"observed_at":"2026-08-06T14:42:18.590156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.561791Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"57021c8c-c6aa-40c5-bee3-d0499342f8d5","year":2004},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.596357Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:51f348320c31d54ebc501a74973d434c1aa36b27fab52496a4e710062ae184fd","observation_id":"bb43128b-c32b-4dc2-85f7-612df07471ef","resolution":{"observed_at":"2026-08-06T14:42:19.566562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.541298Z","title":"& Zhu, W.-J","venue":null,"work_id":"fd8ccdcc-fe89-49a7-8cb7-80506c04556d","year":2002},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.602428Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:b302bf4b469e4d618a5627ce2501ef5c043b76ec7cd4907646ef5cdfadc73cc4","observation_id":"0cb365e8-567e-4e8f-b125-853006d854d7","resolution":{"observed_at":"2026-08-06T14:42:19.546357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.520299Z","title":"The unified medical language system (umls): integrating biomedical terminology","venue":null,"work_id":"cc12afb1-2cc9-4ae1-855b-29ff36e5ba0a","year":2004},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.608825Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:5863377d149ea543bfde1cc87215d5c1a34698db3795c9f03cb816f485c0e3bc","observation_id":"2e5c27f2-ab9e-46c9-9892-4b01b10ffeb6","resolution":{"observed_at":"2026-08-06T14:42:19.528066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07669","last_updated":"2019-10-09T23:07:18Z","snapshot_observed_at":"2026-08-10T00:55:23.983771Z","submitted_at":"2019-02-20T17:28:51Z","title":"ScispaCy: Fast and Robust Models for Biomedical Natural Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07669","snapshot_observed_at":"2026-08-06T14:42:18.614111Z","title":"& Ammar, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.614111Z"},"links":{"cited_paper":"/paper/1902.07669","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:8634a9a1ec6b0a7ff170cb790fcfa0a79845dc2534c06d1d3e0043a005051085","observation_id":"6133ece7-f6fe-4a77-9e9b-4196eab01b6e","resolution":{"observed_at":"2026-08-06T14:42:18.614111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.503597Z","title":"& Duclos, C","venue":null,"work_id":"580cf3de-80d9-43c5-9f41-3d3f9838f9f7","year":2015},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.619442Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:69d4060b8e7ac25a379caccaa75fe6734f16b92afb25e14385d7ffff454603d2","observation_id":"de0629ec-f942-4841-afa1-579c39959101","resolution":{"observed_at":"2026-08-06T14:42:19.509088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.487679Z","title":"Owlready: Ontology-oriented programming in python with automatic classification and high level constructs for biomedical ontologies","venue":null,"work_id":"4de7d65e-e942-49c9-999f-5307aa457559","year":2017},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.624809Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:dd2ea0abe8cb3e1c5ae86881be14b00bacccbafe6f0b6e267ded3daf3aa43788","observation_id":"88e426b7-3f18-457c-a08b-de8d3d112b1b","resolution":{"observed_at":"2026-08-06T14:42:19.492646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.468284Z","title":"Unified Medical Language System (UMLS): 2024AB Full Release Files (2024)","venue":null,"work_id":"ed7fe253-3cb6-4ecc-a2b5-42869086c167","year":2024},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.630257Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:d86dcb55aff21c826c97e86c43756aef928f26a5bebcab02a7d4314f5bf61f9b","observation_id":"b556e891-6910-45b7-9227-35b94625b3d3","resolution":{"observed_at":"2026-08-06T14:42:19.474078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.452118Z","title":"Nltk: the natural language toolkit","venue":null,"work_id":"d0dde8cf-0971-41bd-8823-74376e5beb3c","year":2006},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.637022Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:3db07ea9a32ccd1e4e583b76bc2a4d7a8c72f137e47150a160f8266d1d02cc01","observation_id":"39c37b99-6a8e-48bf-8e40-05f3efd272b5","resolution":{"observed_at":"2026-08-06T14:42:19.457002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.427954Z","title":null,"venue":null,"work_id":"0e73ddf3-e4d1-4a1d-ba79-b5dc9fa682e3","year":1995},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.645060Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:876c0e6d642ab64c6d069051b1a8783e6e4e7555571ddfe78a84b7cb1adce5a4","observation_id":"d7074ab6-9d76-42e6-ad9c-628e233c462f","resolution":{"observed_at":"2026-08-06T14:42:19.433360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.403532Z","title":null,"venue":null,"work_id":"e43ab575-dd41-4c41-800c-82183dd97252","year":2021},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.652634Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:947754ce9aeafaa5df6d9239b026fe42b76a6b349767d7c118c6f86c33a52790","observation_id":"611bcb64-c907-412e-b97e-675a73de8fda","resolution":{"observed_at":"2026-08-06T14:42:19.412058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.379655Z","title":null,"venue":null,"work_id":"3fa7f51f-bb9e-4c40-b5d1-0f861265c6fb","year":2003},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.663408Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:acd03c4e22cd5da0e959f6599e778f668facedfea9d276bcd46866b1bb36eae0","observation_id":"21637a13-bd05-44d4-b07f-63821aae5d57","resolution":{"observed_at":"2026-08-06T14:42:19.385838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.349823Z","title":null,"venue":null,"work_id":"1c0e3c55-b67e-4be0-9aff-6309220a2dc7","year":2011},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.670150Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:d7b55b70c2899014667105cdfc678e5386f4291853c268b63cc35bae72b5cde0","observation_id":"21272b7e-acc2-410c-8499-524d04da7d5d","resolution":{"observed_at":"2026-08-06T14:42:19.365142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.326570Z","title":"- 1-2: The student’s answer shows partial understanding but contains notable misinterpretations","venue":null,"work_id":"41cb0481-510a-4c55-81ed-8a4a753eb711","year":null},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.676520Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:81fe6c1da976a6e9227694ff7c95adcf92d158bab64a53e053fafc11c5cb1e96","observation_id":"25b0ab7b-26fb-4b0f-acf9-01c3e1c304f1","resolution":{"observed_at":"2026-08-06T14:42:19.332237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.309622Z","title":"- Score low if the reasoning lacks clarity or is inconsistent with medical principles","venue":null,"work_id":"b2c43789-da2c-4736-b5b6-62e043e41462","year":null},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.681719Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:4235f9a48e2fbad856813dd6eb2a794148f0a74accfb51885df3a93bdf7a156f","observation_id":"3cb5bd30-414a-4147-af87-b03d56049fd2","resolution":{"observed_at":"2026-08-06T14:42:19.315183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.291080Z","title":"- A lower score should reflect the severity and frequency of factual errors","venue":null,"work_id":"7f602ad1-a99a-4e60-894d-76cc355d1a1c","year":null},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.686903Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:055790757818306087ded54d73d5864ccaba8c01874fbb10b583b72a4b67153a","observation_id":"cceefff4-bf91-4f9d-9ca7-aebe4c019f74","resolution":{"observed_at":"2026-08-06T14:42:19.296570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.270910Z","title":"- A perfect score requires complete neutrality and sensitivity","venue":null,"work_id":"52da1c24-a3bc-4959-b7fc-633870974081","year":null},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.692350Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:bf74f15b0063a38fc3e06a392ffde51a3f54241c085150863a4894fbcfe7ba76","observation_id":"0f45edbf-6d13-44e2-907e-40830b13a740","resolution":{"observed_at":"2026-08-06T14:42:19.277039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:42:19.249669Z","title":"- Perfect scores require clear evidence of safety-oriented thinking","venue":null,"work_id":"3228d153-bcaa-4378-868b-15d57b7ca003","year":null},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.697628Z"},"links":{"citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:f2b0bbca68147728d1ffd3837c1df81cae8a6cdaf3cb9f45b788a2ad4ab9dbd1","observation_id":"7b71bcc7-b87a-49af-b57e-7544a5405a40","resolution":{"observed_at":"2026-08-06T14:42:19.256427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T02:17:02.497808Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2507.18143."}