{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d6f2e28c88519542bc1071ed82fd771ee59d7a34cd521d86c339b0a62d8ad05","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:05:45.754584Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:03:59.798126Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:47:41.432897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"cited_work":{"arxiv_id":"2505.22787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22787","snapshot_observed_at":"2026-07-03T05:47:41.432897Z","title":"Can large language models match the conclusions of systematic reviews?","venue":null,"work_id":"b42e3e83-ebf5-4288-9914-5b6858952735","year":2025},"citing_paper":{"arxiv_id":"2506.23040","last_updated":"2026-04-28T19:11:23Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T00:23:06Z","title":"Treatment, evidence, imitation, and chat","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T08:21:05.698812Z"},"links":{"cited_paper":"/paper/2505.22787","citing_paper":"/paper/2506.23040"},"observation_digest":"sha256:a14c4db45b00857622e935c99d3a0e56d327673b9f504f7023962f7342842027","observation_id":"b9ba4ec6-9052-4ae7-a9b4-e667da51b05f","resolution":{"observed_at":"2026-05-19T08:22:10.764062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"cited_work":{"arxiv_id":"2505.22787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22787","snapshot_observed_at":"2026-07-03T05:47:41.432897Z","title":"Can large language models match the conclusions of systematic reviews?","venue":null,"work_id":"b42e3e83-ebf5-4288-9914-5b6858952735","year":2025},"citing_paper":{"arxiv_id":"2606.05436","last_updated":"2026-06-03T20:58:43Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T20:58:43Z","title":"Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-06-28T06:03:59.798126Z"},"links":{"cited_paper":"/paper/2505.22787","citing_paper":"/paper/2606.05436"},"observation_digest":"sha256:d30608ac5d4ad09bcdac5a772b72d876640359cd80563f81fa17d5b862f16164","observation_id":"0aeb246b-c148-408e-aa59-a286729bfe92","resolution":{"observed_at":"2026-07-02T08:26:48.026099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"cited_work":{"arxiv_id":"2505.22787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22787","snapshot_observed_at":"2026-07-03T05:47:41.432897Z","title":"Can large language models match the conclusions of systematic reviews?","venue":null,"work_id":"b42e3e83-ebf5-4288-9914-5b6858952735","year":2025},"citing_paper":{"arxiv_id":"2606.11337","last_updated":"2026-06-09T18:16:04Z","snapshot_observed_at":"2026-07-06T23:50:25.158108Z","submitted_at":"2026-06-09T18:16:04Z","title":"Can AI Agents Synthesize Scientific Conclusions?","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:07.718882Z"},"links":{"cited_paper":"/paper/2505.22787","citing_paper":"/paper/2606.11337"},"observation_digest":"sha256:30885de59f03a5a84c2bb008aa46cd5d7d8200722dc470c97a99ff4a1ad04034","observation_id":"94e14c8b-1f7f-4c93-9106-9f4d9a7c0e67","resolution":{"observed_at":"2026-07-03T05:47:41.435176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22787/citation-record","integrity":"/paper/2505.22787/integrity","json":"/paper/2505.22787/citation-record.json","paper":"/paper/2505.22787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.961840Z","title":"Growth rates of modern science: a latent piecewise growth curve approach to model publication numbers from established and new literature databases","venue":null,"work_id":"e47ef8ff-16e5-43bd-ae62-3a6e20ad5213","year":2021},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:41.627088Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:a9e0b152b3bb6538100f60673cb35c8ad36f5aba20b90a2cb09f6c951cf2628a","observation_id":"abfb9d70-afe7-4cb1-855e-741140657f6c","resolution":{"observed_at":"2026-08-07T13:05:51.999188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.818792Z","title":null,"venue":null,"work_id":"511e9588-f48f-4355-b367-895b18425a91","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:41.702126Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:8faa60e7a5de4d171962523aa82f74c31bc895c411c4c6a26a80a2b99d21af5f","observation_id":"8d6b0df0-f2ba-4cb7-817e-201fb4cac29a","resolution":{"observed_at":"2026-08-07T13:05:51.869782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04600","last_updated":"2024-09-06T20:12:57Z","snapshot_observed_at":"2026-08-06T05:54:10.150748Z","submitted_at":"2024-09-06T20:12:57Z","title":"The emergence of Large Language Models (LLM) as a tool in literature reviews: an LLM automated systematic review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04600","snapshot_observed_at":"2026-08-07T13:05:41.788855Z","title":"The emergence of large language models (llm) as a tool in literature reviews: an llm automated systematic review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:41.788855Z"},"links":{"cited_paper":"/paper/2409.04600","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:e341bd2f8d6b8c443ece9172b820309299024505dc74e8af81d3772a71494639","observation_id":"8823c06f-d137-4b0f-991b-818d8f54718c","resolution":{"observed_at":"2026-08-07T13:05:41.788855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.678287Z","title":"How to optimize the systematic review process using ai tools","venue":null,"work_id":"e069ffb1-5878-40a4-8137-7c8ccc8ce5fa","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:41.857108Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:0ee09c726594651316b7190932afbbb968c8186f3c66f321882f2161463b3d8b","observation_id":"22686ff8-3484-41d7-a983-d27f398c74c3","resolution":{"observed_at":"2026-08-07T13:05:51.728714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.515694Z","title":"Future of evidence synthesis: Automated, living, and interactive systematic reviews and meta-analyses","venue":null,"work_id":"360e4552-abc8-41b6-aca6-16365452a646","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:41.917310Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:0f51c26561b9410af703597f38476bd3ec561dcf0c8764241b1f5dccdb0e1eb0","observation_id":"3ef3b132-53c3-4c9f-b155-040c13c904d1","resolution":{"observed_at":"2026-08-07T13:05:51.608818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.379744Z","title":"Deep research system card, 2025","venue":null,"work_id":"be2fff64-4ce8-4a17-8040-4ee063a044db","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.001265Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:2d93d8932457e0d358bf85f11253488c3bddbfb25711f6b7c2d7a2e35e80908c","observation_id":"41609f5e-f087-4fa1-a9c7-11f8ba592707","resolution":{"observed_at":"2026-08-07T13:05:51.433866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.260364Z","title":"Gemini deep research – your personal research assistant, 2025","venue":null,"work_id":"06daa99f-3397-49b0-b96e-ff4c709349c4","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.069304Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:be3747f18848aa0b78128699e4d568e8e0a813ed1514730c0d051599a30c9eb1","observation_id":"94eaa987-14a8-4cf7-9b2b-938abb39df49","resolution":{"observed_at":"2026-08-07T13:05:51.336859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:51.102096Z","title":"Elicit: The ai research assistant, 2025","venue":null,"work_id":"d7378175-4dcf-4f85-a23b-bd0e5c7a4929","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.163546Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:b5805d96b9895e203c1bc87847558971d4a57f01c789dc9cf03241c84b178753","observation_id":"0f59b63d-401a-4432-b88c-b2d27d28c6cc","resolution":{"observed_at":"2026-08-07T13:05:51.172471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.945953Z","title":"Open evidence: Ai-powered medical information platform, 2025","venue":null,"work_id":"0247e1a7-3762-43ad-a3bd-150d98abb5ad","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.237160Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:9527a57381ee3753dac598fccabc4d392bfb7f45790d40bc3850f587c4e8b8ac","observation_id":"00702845-aabc-4db0-8d57-5d07882d3dff","resolution":{"observed_at":"2026-08-07T13:05:51.025871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.826909Z","title":"Food and Drug Administration","venue":null,"work_id":"f7311726-f188-465f-97be-444de5741bbe","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.333145Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:90eb768eea56808b2ad0ee0f29c86f58edcb27bf81a5781d42eeab92b490681b","observation_id":"63bb4f11-83cd-4faa-8b6c-af94bbb4ac6d","resolution":{"observed_at":"2026-08-07T13:05:50.851003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01733","last_updated":"2024-01-29T06:49:53Z","snapshot_observed_at":"2026-08-07T20:30:35.349450Z","submitted_at":"2024-01-29T06:49:53Z","title":"Development and Testing of Retrieval Augmented Generation in Large Language Models -- A Case Study Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01733","snapshot_observed_at":"2026-08-07T13:05:42.369820Z","title":"Development and testing of retrieval augmented generation in large language models--a case study report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.369820Z"},"links":{"cited_paper":"/paper/2402.01733","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:bd234649094138037323e54978b672d23b31b618c49155ba6ff794c8fe6d7e1d","observation_id":"fd923c07-34dd-4cab-ae8e-3e618ca7096e","resolution":{"observed_at":"2026-08-07T13:05:42.369820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.662697Z","title":"Can large language models reason about medical questions? Patterns , 5(3), 2024","venue":null,"work_id":"fb393485-d42d-46f7-9098-129c47fd5e16","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.424003Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:93b2fccd2a417c24a76a1633c802df54a2a98328e8b9b4a8a346191f91e9a40f","observation_id":"35007af2-d8e3-4837-b6b3-21daba273a0b","resolution":{"observed_at":"2026-08-07T13:05:50.753052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.550813Z","title":"Medalign: A clinician-generated dataset for instruction following with electronic medical records","venue":null,"work_id":"fda557ef-3920-4d7a-84bf-22fd2d70e268","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.533830Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:7e259b884507a295811305973e41479030fc6d9672c5be3f09ea31c003968173","observation_id":"182459d2-29d9-417e-9a0e-fbbf805386af","resolution":{"observed_at":"2026-08-07T13:05:50.618921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.362502Z","title":"Artificial intelligence to automate network meta-analyses: Four case studies to evaluate the potential application of large language models","venue":null,"work_id":"3be35707-ce40-4094-b6f2-8665a307d349","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.587478Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:9df0d36b224130306c87150a581344fabb85f58a44eed0c786debb447479a8d1","observation_id":"85ac5650-3983-4a41-90cf-dd91d884f93c","resolution":{"observed_at":"2026-08-07T13:05:50.445363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.223209Z","title":"Applications of the natural language processing tool chatgpt in clinical practice: Comparative study and augmented systematic review","venue":null,"work_id":"3bf7a2f2-838e-45ba-9988-e1e6152f1c55","year":2023},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.700952Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:89ae474bea7042edd59e27cb58b93e7bf9be3ac72fce8b6e29fd958fb2dd9385","observation_id":"2e81b9be-4c87-4a88-86df-6691597059e5","resolution":{"observed_at":"2026-08-07T13:05:50.285844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:50.040367Z","title":null,"venue":null,"work_id":"4814946d-63d6-4049-b0d4-4f1c6f6512d2","year":2023},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.778063Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:49d56c60b681b8c76abb1e2b26d7208acd6505d99f16bc978b3955c45dd4972d","observation_id":"9f2c0cdb-5233-4d15-9719-d9efeaca81e6","resolution":{"observed_at":"2026-08-07T13:05:50.100641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.842215Z","title":"Assessing the risk of bias in randomized clinical trials with large language models","venue":null,"work_id":"a2bfc80b-5660-4fc9-9825-9665950e490c","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.850157Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:e81910d79ffeefee39312ed5d93341c60d2a2524b5d01a7976aa9c59cf9bef0a","observation_id":"38605347-300d-4d31-a656-f16fa7949a8f","resolution":{"observed_at":"2026-08-07T13:05:49.934019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07171","last_updated":"2025-04-01T19:50:25Z","snapshot_observed_at":"2026-08-09T01:49:55.952384Z","submitted_at":"2025-01-13T09:58:03Z","title":"BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07171","snapshot_observed_at":"2026-08-07T13:05:42.893682Z","title":"Biomedica: An open biomedical image-caption archive, dataset, and vision-language models derived from scientific literature","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.893682Z"},"links":{"cited_paper":"/paper/2501.07171","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:a0dc698daacfc26be045ccd42b55acc4e868b5c6c18ed69eae5163b4bdc9b4a7","observation_id":"98e86c26-42ec-4b84-b016-a820ada89bb2","resolution":{"observed_at":"2026-08-07T13:05:42.893682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.698199Z","title":"o ws, Maria-Inti Metzendorf, Felix Heilmeyer, Waldemar Siemens, Christian Haverkamp, Daniel B \\","venue":null,"work_id":"611d12e0-87dd-493f-a342-14fd6d90707d","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:42.975698Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:570d967bb7cb69ed6a3de86466e5c2336353433be42001242d0b65dd13c2176e","observation_id":"d67b7e0e-e96d-483a-86f3-58ec3d060384","resolution":{"observed_at":"2026-08-07T13:05:49.738498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.524857Z","title":"Generative artificial intelligence use in evidence synthesis: A systematic review","venue":null,"work_id":"dbbbd451-53c3-4ac7-aa9a-a0bad8aa4f2e","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.044004Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:88877b7090cf0b68dfaa41a73f1f10850d7ad0f72137e6b568f7539d4acceddd","observation_id":"25f5ae01-0e52-451e-8498-0e05348f9d19","resolution":{"observed_at":"2026-08-07T13:05:49.615255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.364227Z","title":"M ed REQAL : Examining medical knowledge recall of large language models via question answering","venue":null,"work_id":"c540533d-4387-40fa-8378-31914884e144","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.127980Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:7dcbb05ef31beae20f4c11009c7e99208950a92b2b7e444d1c93e989bb8d3816","observation_id":"ba71cfcd-0fdc-43bd-b69e-7113e17e0ee8","resolution":{"observed_at":"2026-08-07T13:05:49.417678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.185525Z","title":"H ealth FC : Verifying health claims with evidence-based medical fact-checking","venue":null,"work_id":"05e324cc-292d-4bda-9c82-838e27b0271d","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.193185Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:eca54a95d4c40203fdb556cff6c6eaaa5061bf3546537ec342955b125b4c7cf2","observation_id":"4ee122c0-75c4-4ee7-9002-b1a475e4b530","resolution":{"observed_at":"2026-08-07T13:05:49.287045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:49.004073Z","title":"What evidence do language models find convincing?, 2024","venue":null,"work_id":"c18ae1d3-4d26-45bc-b001-884657472d3d","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.238814Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:66a93b1a9df567bb2acce5b7b2c9e64a6100672a81719c5589bcb82f7c100025","observation_id":"116dc038-7c89-44ff-94f7-91293199787a","resolution":{"observed_at":"2026-08-07T13:05:49.071576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:48.827896Z","title":"Clasheval: Quantifying the tug-of-war between an llm's internal prior and external evidence, 2025","venue":null,"work_id":"2b0389f6-ef88-4863-938f-cd7c5c04a341","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.332339Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:d96ee0254f6874b597c471857c9d1ba10e402288b560ea1a34ba78d3f8752f2f","observation_id":"1d2fea88-ace9-4c10-86be-61cdf76911e7","resolution":{"observed_at":"2026-08-07T13:05:48.888788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:48.645020Z","title":"Conflictbank: A benchmark for evaluating the influence of knowledge conflicts in llm, 2024","venue":null,"work_id":"13cd152f-8bea-4c56-a7e1-cd63371f4a67","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.408496Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:d476bc8e4b55e187bf01202d248650dd8911941d63c73c1fd5c345f35f825b45","observation_id":"2fe2347a-368f-481e-9843-adec69ddf050","resolution":{"observed_at":"2026-08-07T13:05:48.713111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:48.461635Z","title":"Untangle the knot: Interweaving conflicting knowledge and reasoning skills in large language models, 2024","venue":null,"work_id":"b82bbcd3-7c26-4a47-b0c6-44a51876eba5","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.481306Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:4052937f688850066c982534bc9b113b468a78b4dfb8ac61ac61e2814f0d4a56","observation_id":"153c3248-884e-4b22-b754-fe928d4bb7b1","resolution":{"observed_at":"2026-08-07T13:05:48.535178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:48.267076Z","title":"How to write a cochrane systematic review","venue":null,"work_id":"daab2c8f-1547-4fa4-88fc-b033492d5ced","year":2010},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.544854Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:79d467ce383345420568c24d4e713f2182a6d9f389e0e87ef0b27fd447166304","observation_id":"c70947c1-3b0c-4aa1-b33e-b3a69558d131","resolution":{"observed_at":"2026-08-07T13:05:48.332514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:48.089622Z","title":"Quality of cochrane reviews","venue":null,"work_id":"814caf6b-d8e4-463c-a083-0781f9f17d6e","year":2002},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.584060Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:f7f3394a9f693b3f8a05f2fde6f951f500c930b30fac58292b753f60956260ff","observation_id":"b0a7dd8d-16d1-4069-84d7-ff2ff483006e","resolution":{"observed_at":"2026-08-07T13:05:48.191484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.941133Z","title":"What is a cochrane review? Epidemiol Psychiatr Sci , 20(3):231--233, Sep 2011","venue":null,"work_id":"4870f818-44a6-4398-97ef-37c8460c1752","year":2011},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.680202Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:0fa9aae8b810d99379dfc86403345013caf62b6f384d771092948eaf3b824030","observation_id":"0ee4b7c3-0587-4990-a353-0b1af38a86f4","resolution":{"observed_at":"2026-08-07T13:05:47.996527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.818446Z","title":"Biomedica: An open biomedical image-caption archive, dataset, and vision-language models derived from scientific literature, 2025","venue":null,"work_id":"71d5bd38-1bd5-43c3-9a7c-959181b2b028","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.833178Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:24348a799b9236c4403b018599d301c2213978e09f590825d8504abd65f4c468","observation_id":"f5763b0a-a6c1-4835-8b0a-348f3ea98e09","resolution":{"observed_at":"2026-08-07T13:05:47.846344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.653131Z","title":"Bethesda (MD): National Center for Biotechnology Information (US), 2010-","venue":null,"work_id":"b9f7c92c-b8a0-4d73-9dbd-57fdad3a678d","year":2010},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:43.916594Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:ba91a2093290530b5c78a90a6bad62b5049d185a59bbbf3472d30c483eb3ce74","observation_id":"57ebdff6-cfed-4775-83c3-ef9ba273a830","resolution":{"observed_at":"2026-08-07T13:05:47.705602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.511537Z","title":null,"venue":null,"work_id":"fc698c4e-c67f-4899-8e3f-76fa341727c4","year":2019},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.012378Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:b5bdb7393721effd3e89ba545074285249650a791cd01b29e673ffd8a4479051","observation_id":"ddc25f37-4587-4ab6-9032-9003f348532f","resolution":{"observed_at":"2026-08-07T13:05:47.583430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.373999Z","title":"Assessment of the strength of recommendation and quality of evidence: Grade checklist","venue":null,"work_id":"a184d8be-ec92-4110-8ddd-3fcf40c81582","year":2022},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.097237Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:4e8b06be4b6f38da88d631c3ff970bf00fa993f2d5f950bb575ed0d345fcce2a","observation_id":"2eebce0a-e7a3-4f98-b7aa-e7752544f1f9","resolution":{"observed_at":"2026-08-07T13:05:47.424267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:44.179454Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.179454Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:cfb94de9716201b254caec1acf94f7165a161dae0bb60416e37d83081b0e162d","observation_id":"ff297756-cfd5-48f9-916d-c8f0ef492680","resolution":{"observed_at":"2026-08-07T13:05:44.179454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:44.270040Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.270040Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:2ca6bcdbebeee200b1e24ff6cdde8c80658070e10f778eabf7b2863e1a8e1e56","observation_id":"052921c6-0370-49bf-ad06-b2da74cec50a","resolution":{"observed_at":"2026-08-07T13:05:44.270040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:47.174929Z","title":"Open Thoughts","venue":null,"work_id":"405e3ecf-7011-41a2-a528-f2df50ff8e08","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.358789Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:045f9bd3115d6d426f75b28db81e91ace66a094a7aa7a426c38d52c4ed8ab396","observation_id":"a2576a7f-030f-4e82-b9a4-b5681c7e2546","resolution":{"observed_at":"2026-08-07T13:05:47.248285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:44.428543Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.428543Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:edae367685f5fb686e84ef0d75be8053bd73dce823e1f4adbaff406b77ded5c7","observation_id":"74080c23-941b-4d06-9368-74c6f7e90f55","resolution":{"observed_at":"2026-08-07T13:05:44.428543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:44.486772Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.486772Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:98d64c8a024708ef1e22f08ae34e79cbe8d42aed4e9cf73080b3281c79672480","observation_id":"305a4698-4bc5-4ff5-8564-cad8cac40ee3","resolution":{"observed_at":"2026-08-07T13:05:44.486772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:46.987773Z","title":"The llama 4 herd, 2025","venue":null,"work_id":"9aa63d44-9836-40a7-b7b0-6d8138a8d124","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.547522Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:3a9da058644aab4c1c9f448d4fd63acfe742d4f68065922d8ba4a8caf5eef6d4","observation_id":"4f7c6598-9e4c-44fa-b82c-930f310679ac","resolution":{"observed_at":"2026-08-07T13:05:47.057232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:44.623175Z","title":"Huatuogpt-o1, towards medical complex reasoning with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.623175Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:ad183c4dd6395aa1916db996c7a80e9d616e13f4581ab1ab8f15d3c1719c0d2e","observation_id":"f7222a5f-1b41-44f6-817a-c64f0cd26817","resolution":{"observed_at":"2026-08-07T13:05:44.623175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:46.831329Z","title":"Openbiollms: Advancing open-source large language models for healthcare and life sciences","venue":null,"work_id":"5b944053-9941-4ad5-aea6-a2605d6f12db","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.724796Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:a2dadeb7b3623d47bd435de069630a088a3907707a5f13ed68b7ba64f135e4e8","observation_id":"935206a9-ac73-4ecf-90e1-0bddbf237818","resolution":{"observed_at":"2026-08-07T13:05:46.888598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:46.699717Z","title":"Refinedocumentschain","venue":null,"work_id":"4942d5f5-4f7f-4bcb-bea2-a0223782348e","year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.817332Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:924aff747bdd60aaf86e49da3cf70d7fb55ed4493f7244fff3cf5574805097b0","observation_id":"01a60bc0-9a29-433e-9a9d-b6db76a4c5b4","resolution":{"observed_at":"2026-08-07T13:05:46.742395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:46.558400Z","title":"An introduction to the bootstrap","venue":null,"work_id":"d67f4cb9-6306-44f6-becf-80ad9cd4d707","year":1994},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.916032Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:9adfb8f14dde4bcbd8c51444e447720162512462d4ac3cfa0f3c6e4c4e1ff0fc","observation_id":"0b21fda6-023b-4ded-8cba-254e44ea342a","resolution":{"observed_at":"2026-08-07T13:05:46.604185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17915","last_updated":"2024-05-28T07:36:56Z","snapshot_observed_at":"2026-08-01T22:47:17.032978Z","submitted_at":"2024-05-28T07:36:56Z","title":"Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17915","snapshot_observed_at":"2026-08-07T13:05:44.983710Z","title":"Long context is not long at all: A prospector of long-dependency data for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:44.983710Z"},"links":{"cited_paper":"/paper/2405.17915","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:66e5fe82e60347c763a127e54a44ace924a3c6b7583230238dc82cafc12e4f82","observation_id":"d6ba0e78-aec5-4990-8dad-eee64931b492","resolution":{"observed_at":"2026-08-07T13:05:44.983710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-07T13:05:45.055957Z","title":"Long-context llms struggle with long in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.055957Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:ae8976b7dca8438aec182d6255bf69e889c98841f23a6c83f478fbbadb15cf85","observation_id":"a9a25759-e103-4159-9809-9ffbe1bc9358","resolution":{"observed_at":"2026-08-07T13:05:45.055957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:45.149556Z","title":"Large language models are overconfident and amplify human bias","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.149556Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:34d1646626ab8d193ed9816e1156a2adf678ebbc4f5a05debcd68ba575f0d35e","observation_id":"c1bc1f40-dfa1-4665-8f19-8e8aece3d297","resolution":{"observed_at":"2026-08-07T13:05:45.149556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-07T13:05:45.189971Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.189971Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:f1e7a8cbb6c4ec63fae640da88c8502abc115e0e326710d7652f7b6a027c58ca","observation_id":"f740f987-927e-461a-aba9-43f980797571","resolution":{"observed_at":"2026-08-07T13:05:45.189971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09724","last_updated":"2025-02-28T23:36:40Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T04:48:40Z","title":"Taming Overconfidence in LLMs: Reward Calibration in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09724","snapshot_observed_at":"2026-08-07T13:05:45.303527Z","title":"Taming overconfidence in llms: Reward calibration in rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.303527Z"},"links":{"cited_paper":"/paper/2410.09724","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:ea40b6bae47341f6a57fa51597d36d1e16858f491ab98cbce4d8e3920c1cdf18","observation_id":"607a5fc8-c3fc-456a-bcae-c39cd7a68ee4","resolution":{"observed_at":"2026-08-07T13:05:45.303527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:46.411095Z","title":"Fine-tuning is fine, if calibrated","venue":null,"work_id":"e27ea3a9-5fce-4772-b41e-6e68bfa1462e","year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.381013Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:ca70bf2faeb4b9f7696c0837ec889b8afa0b57b355f537ea8e5bc5e5f8e46c1a","observation_id":"c88dedd6-9da0-4f3b-bbde-83e6c12e97fa","resolution":{"observed_at":"2026-08-07T13:05:46.443913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11506","last_updated":"2020-10-22T07:48:38Z","snapshot_observed_at":"2026-08-09T17:03:17.769507Z","submitted_at":"2020-10-22T07:48:38Z","title":"Calibrated Language Model Fine-Tuning for In- and Out-of-Distribution Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11506","snapshot_observed_at":"2026-08-07T13:05:45.447639Z","title":"Calibrated language model fine-tuning for in-and out-of-distribution data","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.447639Z"},"links":{"cited_paper":"/paper/2010.11506","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:de26c2f19e43d853ae98e35847dc7e111b81d4483c5e2e9aa75e0300ffcc8911","observation_id":"8ec6626c-2a83-4b3f-978a-1cc08e17c7ec","resolution":{"observed_at":"2026-08-07T13:05:45.447639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05059","last_updated":"2024-11-11T21:48:52Z","snapshot_observed_at":"2026-08-02T10:03:32.118519Z","submitted_at":"2024-11-07T18:22:14Z","title":"FineTuneBench: How well do commercial fine-tuning APIs infuse knowledge into LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05059","snapshot_observed_at":"2026-08-07T13:05:45.491178Z","title":"Finetunebench: How well do commercial fine-tuning apis infuse knowledge into llms? arXiv preprint arXiv:2411.05059 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.491178Z"},"links":{"cited_paper":"/paper/2411.05059","citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:87abf8f52a64ff30dec2ae7bff4395a62ddfb0fbafa405d4424c9d29b1fdc9c2","observation_id":"fd2586f8-4202-4c76-92c1-6f458ae2bf17","resolution":{"observed_at":"2026-08-07T13:05:45.491178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:45.578828Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.578828Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:9f1009504bf3a25b60b6a737ce5fa64299c843a66a96f5ec2918a0b398537023","observation_id":"d4fce9a9-c421-4326-add9-a0d887425872","resolution":{"observed_at":"2026-08-07T13:05:45.578828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:45.620661Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.620661Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:3655327f6916c2319d4a23b21fba97c40f8545dbc0271e56bee5a44092caa8d7","observation_id":"0fb222eb-0441-4a2d-a7ac-c47d6547eed8","resolution":{"observed_at":"2026-08-07T13:05:45.620661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:45.680263Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.680263Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:cbd0b837e50e17bf64dce943eef432ad08c132ccc5a3449572a170909fc04c72","observation_id":"adbe0757-7821-4c02-bd0d-a20069d1bb3f","resolution":{"observed_at":"2026-08-07T13:05:45.680263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:05:45.754584Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:05:45.754584Z"},"links":{"citing_paper":"/paper/2505.22787"},"observation_digest":"sha256:dc356dcb87f9d77cb259db04277a9c4abc87c085cf6555914758de2204b9571e","observation_id":"5c7b44d0-a5e8-48b7-b2d3-b21b530bc83d","resolution":{"observed_at":"2026-08-07T13:05:45.754584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22787","last_updated":"2025-05-28T18:58:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:11:29.144134Z","submitted_at":"2025-05-28T18:58:09Z","title":"Can Large Language Models Match the Conclusions of Systematic Reviews?"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 3 inbound Pith citation observations for arXiv:2505.22787."}