{"as_of":"2026-08-10T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65edb133e13bd1bd3ecea9826a260d867743d3fbbfd7faaff5cc7cd9b9792f1a","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:46:08.376749Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:53.040834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T17:13:54.647415Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"cited_work":{"arxiv_id":"2507.15152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15152","snapshot_observed_at":"2026-08-05T17:13:54.647415Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","venue":"cs.CL","work_id":"aef22ecb-c629-421f-99f5-b011d3963ad0","year":2025},"citing_paper":{"arxiv_id":"2509.00038","last_updated":"2025-08-22T21:37:49Z","snapshot_observed_at":"2026-08-05T23:50:11.524380Z","submitted_at":"2025-08-22T21:37:49Z","title":"Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:53.040834Z"},"links":{"cited_paper":"/paper/2507.15152","citing_paper":"/paper/2509.00038"},"observation_digest":"sha256:63cddbe43702f056eb10803892e7ff70547bf54510b54a75b84ba8a2494a5392","observation_id":"10d2e2ae-f6ec-48f1-a8fa-6aa090174121","resolution":{"observed_at":"2026-08-05T17:13:54.709479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15152/citation-record","integrity":"/paper/2507.15152/integrity","json":"/paper/2507.15152/citation-record.json","paper":"/paper/2507.15152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.653529Z","title":"Research Synthesis and Meta-Analysis: A Step-by-Step Approach","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.653529Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9523da5c8397e758d5c11ec24d4d0fd96f411029fd1d5a01ad34cbd0f0b4bddc","observation_id":"59abdfec-2b79-400f-abb4-6896d381a4af","resolution":{"observed_at":"2026-08-06T15:46:07.653529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.664179Z","title":"Analysing data and undertaking meta-analyses, chapter 10, pages 241–284","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.664179Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7df3f4aec032481299045f32978d9fc194538919335d50478a41e459449099a1","observation_id":"1f67cc0f-6e6e-4c9c-8dd2-dd9074bee257","resolution":{"observed_at":"2026-08-06T15:46:07.664179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.671805Z","title":"Analysis of the time and workers needed to conduct systematic reviews of medical interventions using data from the prospero registry.BMJ Open, 7 (2), 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.671805Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6318e86ff6b4e35ef420086e4f6dbd148f870f651c716e5203b5179ddb86823e","observation_id":"d0762771-aa93-47e0-aeb8-895ffc8ebf2c","resolution":{"observed_at":"2026-08-06T15:46:07.671805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/9781119536604","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Higgins, James Thomas, Jacqueline Chandler, Miranda Cumpston, Tianjing Li, Matthew J","venue":null,"work_id":"fc744b8c-5dfe-44ef-8ba4-2b6f4e69edff","year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.680841Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:74792d46b1077f02f0310a2d1e4b138cfcb2807a71659d4ec6422d49c1b25b61","observation_id":"efdddffb-8142-469b-909e-5f43339c72f5","resolution":{"observed_at":"2026-08-06T15:46:09.038582Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1136/bmj-2021-069155","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Validity of data extraction in evidence synthesis practice of adverse events: repro- ducibility study","venue":"BMJ","work_id":"18ef4436-5b49-483b-9eff-2aeba29df73c","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.685632Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:639e04ad6b6a26817490cc91300a116b434a20a6945d7e74b9589a4acb2f9b80","observation_id":"70ea14fd-5453-4d30-8447-05c6b28e9f97","resolution":{"observed_at":"2026-08-06T15:46:09.020674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.690733Z","title":"Toward systematic review automation: a practical guide to using machine learning tools in research synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.690733Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7abda77b656381341825d4a6bb3480a1767d86d4bf0c8a0c1551be4d5cdbf644","observation_id":"975c4024-e2d0-4308-ada1-f84d80119446","resolution":{"observed_at":"2026-08-06T15:46:07.690733Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.697875Z","title":"Exact: automatic extraction of clinical trial characteristics from journal publications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.697875Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9af18ac884de50aa2b3bfd91e5e3b5cde4c5e4710644d6d23492d9e4991a23b8","observation_id":"b0629e68-bf64-4206-99b4-91252af8cde9","resolution":{"observed_at":"2026-08-06T15:46:07.697875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/bibm.2011.72","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Summerscales, Shlomo Argamon, Shangda Bai, Jordan Hupert, and Alan Schwartz","venue":null,"work_id":"58df341e-48c2-4973-a07b-95b591ec22ec","year":2011},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.746197Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f47ecdbafc3587e2b7cbbc1a0c8ef4b2a16a258243d4cd1894f9dbe3a41f7a1b","observation_id":"fdd4bafa-4184-4928-a2ff-b8fe42880703","resolution":{"observed_at":"2026-08-06T15:46:08.968448Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.77374","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.448692Z","title":null,"venue":null,"work_id":"c5dccd46-c3ee-4235-bd92-b0895f9629ea","year":2016},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.763071Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3cb16845d20bf0f13026374faa0ccd5a138263ebc7d16980e3cda2ed32da9275","observation_id":"ca059850-7817-4bff-a971-e79644f87bd6","resolution":{"observed_at":"2026-08-06T15:46:09.459526Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.784022Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.784022Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:447d335815c871d1808cf8671bd5dab60d92fdf17dec0a90851c7f3bc40a7b00","observation_id":"1c86dbba-aac8-4c3c-ac6b-60cf0a5c8cc7","resolution":{"observed_at":"2026-08-06T15:46:07.784022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.801622Z","title":"Automating meta-analyses of randomized clinical trials: a first look","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.801622Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:561766ac3ded77a9301b61ea970f1666db1e0d9dff1a346f7cf705044b32c745","observation_id":"bc08e3c2-ce9c-41ab-ae05-793e5c754ed0","resolution":{"observed_at":"2026-08-06T15:46:07.801622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.812345Z","title":"Katz-Rogozhnikov, Kush R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.812345Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f7da1ebfbac1334fa39368ba3cfcd739c98bfa186bf36a2f3c2527576ee9a65e","observation_id":"c032b9f2-8819-4519-aed0-7709bda04041","resolution":{"observed_at":"2026-08-06T15:46:07.812345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.817822Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.817822Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d9caebde0ebd531cdfd52b61e41a3c137879b5230383c97c16d99aa9452253f1","observation_id":"ec473968-5324-44d2-a235-b93418bdb282","resolution":{"observed_at":"2026-08-06T15:46:07.817822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.12688/f1000research.51117.2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Data extraction methods for systematic review (semi)automation: Update of a living systematic review [version 2; peer review: 3 approved]","venue":"F1000Research","work_id":"08274c0e-ab2a-4f69-bef6-39514a99e927","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.824462Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4efafed9ad57bfdb4bed1720c067c7d6b10ff7fd48746159dbadfb30162900f2","observation_id":"25b1e172-1af5-4a79-be85-76ea657b1997","resolution":{"observed_at":"2026-08-06T15:46:08.928184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.829830Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.829830Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5618321a6ed82042fa2c406ef0ecb21bbb82ae3d5c7b4a87a7db436713204136","observation_id":"094ae696-9487-4bcc-8bfd-ea6e8255c58e","resolution":{"observed_at":"2026-08-06T15:46:07.829830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.834832Z","title":"The data is in: Deciding when to automate screening in your slr, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.834832Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d16d11fa274a912fdd84e6615f4f329f87ebaa9440281f1c9d6eba5e5730be62","observation_id":"d8fbea24-066b-455d-b1ca-bda23239e5b1","resolution":{"observed_at":"2026-08-06T15:46:07.834832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.839801Z","title":"Toward automated data extraction according to tabular data structure: Cross-sectional pilot survey of the comparative clinical literature","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.839801Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3919567fab7202de042d2fa31b337bbf393400c0e3e7c202c81a5679c708b873","observation_id":"f63edf05-4f58-41af-89ae-082feb262b6e","resolution":{"observed_at":"2026-08-06T15:46:07.839801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.854237Z","title":"MetaMate: Large Language Model to the Rescue of Automated Data Extraction for Educational Systematic Reviews and Meta-analyses, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.854237Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:82fc84a4a6fb2b8688e126d0c27b6f7e35a9debdbc193ae008b149e58ac12b17","observation_id":"28e34ed0-8485-4fcb-8124-2dad653175dd","resolution":{"observed_at":"2026-08-06T15:46:07.854237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.864218Z","title":"Chatgpt: Large language model (mar 14 version)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.864218Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4fcffc854d8350448365ea7bc577284dd3fcaea08e3cbe6e7c9ddfb4dbcad5d1","observation_id":"e7c78217-16e8-4a6f-8fd3-64c498887a46","resolution":{"observed_at":"2026-08-06T15:46:07.864218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.870017Z","title":"Claude 2 model announcement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.870017Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:fd88b56b15479595c7946336b3ff4292a46faca9238e8a96e3e57157a90d0c48","observation_id":"cac6f8e3-00ef-4460-b6f3-4ea7f1d4f000","resolution":{"observed_at":"2026-08-06T15:46:07.870017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.875116Z","title":"Zero-shot infor- mation extraction for clinical meta-analysis using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.875116Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:57e4022004aaa46f3aa4349d1fe5c71fa90619a103ff0aa85f1ae6a6638b3cd8","observation_id":"583f778e-b019-49a5-aa43-88fadb7779a7","resolution":{"observed_at":"2026-08-06T15:46:07.875116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.880456Z","title":"Performance of two large language models for data extraction in evidence synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.880456Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:98753d1b014661e8ad03bf789337271e7022563990425c0d841a6e7a93d521fe","observation_id":"75556778-c65e-4b3b-8f2d-8b86090c2e79","resolution":{"observed_at":"2026-08-06T15:46:07.880456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.885286Z","title":"Automatically extracting numerical results from randomized controlled trials with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.885286Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:229afc3e515962604ffbc9557934e0f7b8d2ebc7e11d14c438cd7c19bde26d0e","observation_id":"6705cf30-2390-4d27-9f7e-b02c0a6a2512","resolution":{"observed_at":"2026-08-06T15:46:07.885286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.891121Z","title":"Exploring the use of a large language model for data extraction in systematic reviews: a rapid feasibility study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.891121Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:956a5428316b635753cd6a4e9aa8ccadafa8bf34dd766e2202ffb659748f8acb","observation_id":"fe259602-0acf-4aa5-9e96-25afc38508d9","resolution":{"observed_at":"2026-08-06T15:46:07.891121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-024-52894-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Lee, Shigeki Yamada, and Tomohiro Mizuno","venue":"Scientific Reports","work_id":"4a2c6a8e-4163-47bd-8294-90db8263d608","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.896068Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:bf90f2af82da1f6f77533c5146ea515f3add13197be8c1bb6b14bf9f0c17b7a0","observation_id":"94bbea6d-b5f3-4320-89d7-15055bdf1e24","resolution":{"observed_at":"2026-08-06T15:46:08.866219Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.72502","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.362423Z","title":"Effects of the Modified DASH Diet on Adults With Elevated Blood Pressure or Hypertension: A Systematic Review and Meta-Analysis","venue":null,"work_id":"99376167-685c-43d4-b6ac-febef22cac60","year":2021},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.901443Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6a9df9bf7fa016bba651ffe738efe24021a314c4c573e3a642e2bd4aea544be7","observation_id":"1cfbaa80-85fd-4a5a-97d0-24a0a022a479","resolution":{"observed_at":"2026-08-06T15:46:09.370112Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12906-023-04257-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Abdelrahim, Nivine Hanach, Refat AlKurd, Moien Khan, Lana Mahrous, Hadia Radwan, Farah Naja, Mohamed Madkour, Khaled Obaideen, Husam Khraiwesh, and MoezAlIslam Faris","venue":"BMC Complementary Medicine and Therapies","work_id":"9a48907a-abb9-42f1-8d52-63f7a26820ba","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.906139Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a73b4247a0d6c7d15d3ef5fe04f6df936f1dea8dd06af5ed6111b3d66e354d33","observation_id":"96dc95e7-b78e-47d4-bdca-e36962197bcf","resolution":{"observed_at":"2026-08-06T15:46:08.829269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.14583","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.271237Z","title":"Effect of dietary glycemic index on insulin resistance in adults without diabetes mellitus: a systematic review and meta-analysis","venue":null,"work_id":"a252c44c-405b-468e-81b6-49b4534d96ab","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.913293Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:2af7b92033879e792896e66c57b4db6cc4a1989c3070210e73ab57db1917036c","observation_id":"64105b66-d969-41af-a918-8da6e2c4b62b","resolution":{"observed_at":"2026-08-06T15:46:09.285708Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/dmrr.3843","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Choi, Min-Sun Gu, Seo-Yeong Ko, Jae-Hee Kwon, Ja-Young Han, Jae Hyun Kim, and Myeong Gyu Kim","venue":"Diabetes/Metabolism Research and Reviews","work_id":"f5f074da-6df0-4964-9990-b5fa117c6c56","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.918186Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4ad0eb6150ca4bfe869573c21ada3fe1f9b861b786ca61bd75b30459394b1a9a","observation_id":"8b698dba-6c1e-4100-a69b-c5908f7b0a20","resolution":{"observed_at":"2026-08-06T15:46:08.799935Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1530/eor-22-0022","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"V olar locking plate vs cast immobilization for distal radius fractures: a systematic review and meta- analysis","venue":"EFORT Open Reviews","work_id":"50452f78-b3e5-42d9-a2a4-729bb182e93d","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.924380Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:1ac436e1dc80228f8b1e5d8407701b18a0f9ada938aa73274384c50711f8a304","observation_id":"5c6db0f3-9237-4145-a5d2-9b5c829d2f1e","resolution":{"observed_at":"2026-08-06T15:46:08.774773Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.934074Z","title":"Gpt-4o mini: Advancing cost-efficient intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.934074Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ce36807d415e924c841dbed22b8ecff04e95c6f1396862864c9883b5efb1d32a","observation_id":"34192b22-a459-443b-8287-0cf5870d8db2","resolution":{"observed_at":"2026-08-06T15:46:07.934074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.939758Z","title":"Gemini 2.0 flash","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.939758Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7f6d2dfd65e0011a3fe10c7cd10b8794c56bb23620fb3b3a5b7538e2dc728d48","observation_id":"c32e8170-e0d4-4921-9966-1a46b81557ab","resolution":{"observed_at":"2026-08-06T15:46:07.939758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.945503Z","title":"Grok-3 language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.945503Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:925c35affd1e011a9bc077fa6da43830bb6faeccb6d879eaab506f1e29fcb273","observation_id":"93682bef-d44e-4c7c-8a57-315a4becb015","resolution":{"observed_at":"2026-08-06T15:46:07.945503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.951933Z","title":"The impact of temperature on extracting information from clinical trial publications using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.951933Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:47f408318cf8dc79de0b7f79ecbb696fcf26a811b8604d9180a1961a62e3a560","observation_id":"8b9cbaff-4f41-4132-857c-c60de2b330d0","resolution":{"observed_at":"2026-08-06T15:46:07.951933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11840","last_updated":"2026-07-29T21:54:40Z","snapshot_observed_at":"2026-08-02T23:10:13.538051Z","submitted_at":"2025-01-21T02:49:43Z","title":"AI-Assisted Data Extraction for Systematic Reviews in Education","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11840","snapshot_observed_at":"2026-08-06T15:46:07.958889Z","title":"Schroeder, Chris Davis Jaldi, and Shan Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.958889Z"},"links":{"cited_paper":"/paper/2501.11840","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7ac780bcf966f983fae7cfc0345827fb1220ba31e01f8605bd65534e885460aa","observation_id":"4bbf6358-214b-43d1-afdb-4f0aea3b2d51","resolution":{"observed_at":"2026-08-06T15:46:07.958889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.965054Z","title":"Use gemini 2.0 to speed up data processing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.965054Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:97a8628918327fcb4e01c872224e4dbdd0c60230ef640aa8fe4cfde85efb8a10","observation_id":"178abf96-a100-40cc-b4ea-fefa51c92b6a","resolution":{"observed_at":"2026-08-06T15:46:07.965054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.34297/ajbsr.2025.26.003468","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.742981Z","title":"Harnessing ai for integrative medicine: Exploring grok 3’s role in researching qigong, tai chi, yoga, and mindfulness for college students’ mental health","venue":null,"work_id":"831bf2c3-3a34-40ca-842b-ed3cc7468e00","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.971513Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5e6158deb098d51fb0a3cb7cdfa52070ddbf623a73c09c1109927c9bb9b66291","observation_id":"f654e4b5-931a-4750-a1f4-2c9e8ea67a82","resolution":{"observed_at":"2026-08-06T15:46:08.748746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.336166Z","title":"Microsoft adds elon musk’s grok-3 to azure, citing health- care and science use cases","venue":null,"work_id":"6d4f6728-f7f6-4901-aeb2-a2aa53e99449","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.976676Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5dc68179ff362118bc0632dc291d22ae625f81c617823c4365d753a004aedc20","observation_id":"759dce94-632b-4544-a756-d882cdaf18b0","resolution":{"observed_at":"2026-08-06T15:46:10.347631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.310138Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":"df98a786-ac9d-442d-9478-67dadb1edf7a","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.989820Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ca1063ecd1505297c2909afeee3c35e69929b50452c9829b778fc4a3c13b262a","observation_id":"fc9056f3-42b0-4a30-89cd-34b59992be83","resolution":{"observed_at":"2026-08-06T15:46:10.318292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.994474Z","title":"Towards mitigating LLM halluci- nation via self reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.994474Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9651c64732f5fdfae326fec7bfa3758c93d83c48550f6c7f2c33179dc6c04698","observation_id":"2acec01b-d982-4110-aa42-d3a6d238ea8e","resolution":{"observed_at":"2026-08-06T15:46:07.994474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.287733Z","title":"When hindsight is not 20/20: Testing limits on reflective thinking in large language models","venue":null,"work_id":"1cadf30a-b0d8-4ffa-bd42-dad9aba18850","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.000826Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e50f76fb6a296192b8affafa4ffaf4d8e86bac220a1375c9469d7273fcd207ad","observation_id":"6c7a93d2-95b1-41d6-8356-4ae8b04c0c95","resolution":{"observed_at":"2026-08-06T15:46:10.295126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.260642Z","title":"Dietterich","venue":null,"work_id":"a81504b2-6175-4f61-81ba-6f0bbf193cbd","year":2000},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.011272Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8e4cdb6a1e4f77938cffeda59ee68ca89b7b40d04f9871893533315092a9071b","observation_id":"ccc81064-a620-4159-a80e-ba3512ca49d4","resolution":{"observed_at":"2026-08-06T15:46:10.267940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.018396Z","title":"A survey on ensemble learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.018396Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:cbbb9a29dec99e4ecde42fc05cded7883e50365bb7505170efe1cf85ee758b2a","observation_id":"23f4b757-ac28-47ef-8306-fc3ec919bcb0","resolution":{"observed_at":"2026-08-06T15:46:08.018396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/jamia/ocae061","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Ensemble pretrained language models to extract biomedical knowledge from litera- ture","venue":"Journal of the American Medical Informatics Association","work_id":"21d73a2f-6fa9-4b50-9478-9510efaf4d89","year":1904},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.023179Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c454581b922a49522a9ffd6d0df9180d544bd12dbfe753eb7ebf3cdbe5f529d9","observation_id":"e84df5e4-15d8-4caa-aca3-aba9d2a57a96","resolution":{"observed_at":"2026-08-06T15:46:08.645522Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12859-022-04994-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Zhang and A.L.P","venue":"BMC Bioinformatics","work_id":"df44d8f3-85d9-4ac6-995d-a50cba157feb","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.030348Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:de3b545c09e29e3ededde0d406bc90315bb43a026cbc37d5cc18441490f033a6","observation_id":"8d7ef2bc-7931-463f-922d-5202489506dd","resolution":{"observed_at":"2026-08-06T15:46:08.618170Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43856-025-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.576979Z","title":"Comprehensive testing of large language models for extraction of structured data in pathology","venue":null,"work_id":"6fdf4614-e8d2-481c-93c0-c05d15d9ac0b","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.036361Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5bcb7cb3bf567ddd8ead113d0ade023808d947303f9574e2973da7b5c2fb1957","observation_id":"31adf290-91b9-4d02-862c-b19873f71cee","resolution":{"observed_at":"2026-08-06T15:46:08.587520Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.29173/wclawr112","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Innocence discovery lab - harnessing large language models to surface data buried in wrongful conviction case documents","venue":"The Wrongful Conviction Law Review","work_id":"c51f7632-3061-4240-bfc3-829c2c61c587","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.041977Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a715d62bebcee9a3869636be720f367f19b2c776892969579f2037c3ab733add","observation_id":"d28dc553-4477-4edf-b7d3-e393a2f59d3f","resolution":{"observed_at":"2026-08-06T15:46:08.546789Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.235130Z","title":"Match, compare, or select? an investigation of large language models for entity matching","venue":null,"work_id":"75739ffe-df2d-49a2-8205-a27083b2a47d","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.048626Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:0039d4668c86c7f794e4d329833b07d485b8a5711bb5d4dd8fcc755398285b2c","observation_id":"18e1f353-74a7-4807-89c8-99ee1df24e4f","resolution":{"observed_at":"2026-08-06T15:46:10.243358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41746-025-01546-w","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"npj Digital Medicine","work_id":"ec12a7d4-479a-4e2f-80dc-98367b5823e5","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.053892Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:2d962c80ce6908de822095cc884bc5e2137bf682c9485c51ecdbd440388bb73a","observation_id":"cc3c1a78-35ff-4e69-a324-9c56813ca94d","resolution":{"observed_at":"2026-08-06T15:46:08.516502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.061584Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.061584Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6e9ff934ef336cfb6a711765e9639db33afd0ddc559d3a5866adff1805b76961","observation_id":"84af77db-91b6-4c1a-b14e-2095284f718e","resolution":{"observed_at":"2026-08-06T15:46:08.061584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jclinepi.2010.04.026","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Guyatt, Andrew D","venue":"Journal of Clinical Epidemiology","work_id":"27ddda08-7d00-417f-80bb-f03281cd194d","year":2011},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.068084Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:28b6b70d0c80b086a6c374b4a3f821570259c0944c078063c82c1a58bfc2ed74","observation_id":"3f397eca-7685-4cf9-8b04-69ba6bc821d3","resolution":{"observed_at":"2026-08-06T15:46:08.492238Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20113","last_updated":"2025-04-28T00:40:17Z","snapshot_observed_at":"2026-08-10T01:41:19.791674Z","submitted_at":"2025-04-28T00:40:17Z","title":"Transforming Evidence Synthesis: A Systematic Review of the Evolution of Automated Meta-Analysis in the Age of AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20113","snapshot_observed_at":"2026-08-06T15:46:08.075310Z","title":"Transforming evidence synthesis: A systematic review of the evolution of automated meta-analysis in the age of ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.075310Z"},"links":{"cited_paper":"/paper/2504.20113","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c5c07bc6a589b3a151301908a0436a0bb3e39b892042b18c11600cb132b9c42e","observation_id":"8614a940-0e89-4af5-add4-f99fb77eb40c","resolution":{"observed_at":"2026-08-06T15:46:08.075310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.187886Z","title":"Agentic reasoning: Reasoning llms with tools for the deep research,","venue":null,"work_id":"8845264e-8657-4757-a88b-09ad8e71d87b","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.083557Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:aa27e2bd92f2e4a608cd6c34ffc2b58e8c1be2ed152c87d2d29255c575073982","observation_id":"449df189-eab1-4838-8f8f-8e5dc1abdc35","resolution":{"observed_at":"2026-08-06T15:46:10.198891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.166239Z","title":"TART: An open-source tool- augmented framework for explainable table-based reasoning","venue":null,"work_id":"fc25f3de-a99a-44d6-b96e-be148faa73ab","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.099934Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:b2a06dc7b18b31143206e08ce4833a1b8c03089db4727d92264ad1367f9e7298","observation_id":"2aa669b4-d09e-46ea-aa25-0ac7f3da646a","resolution":{"observed_at":"2026-08-06T15:46:10.171211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.105709Z","title":"Medical hallucination in foundation models and their impact on healthcare","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.105709Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:86d14108f7bde081d240ec5e28db0109eb4990525a89199d8cbbae5f01c655d1","observation_id":"b81958ca-a660-4689-bb8e-db65fdbe01a3","resolution":{"observed_at":"2026-08-06T15:46:08.105709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.111858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.111858Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:802cb8f2215aa56e62f9af2affd978a6a26b0957a237eb1d56ce0c9c1e0343d8","observation_id":"cabcab11-7bd8-46b3-ae71-b44625490a07","resolution":{"observed_at":"2026-08-06T15:46:08.111858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.118777Z","title":"Potential roles of large language models in the production of systematic reviews and meta-analyses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.118777Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f2c326be66bc7c214c61286b4d12ef70b3994847152639799858ef3150ab6de8","observation_id":"2b1898d8-f3f5-489c-9aee-2d67e449992e","resolution":{"observed_at":"2026-08-06T15:46:08.118777Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.148981Z","title":"justification","venue":null,"work_id":"02dd754a-9530-4ce0-a81d-e836bc140a27","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.124679Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4d9120ad107b671a39d8bfd863ab5eadbadebb118f4b3f306d4431c777091ba7","observation_id":"93db9ab6-c6b9-4861-98f0-f20db0315ff6","resolution":{"observed_at":"2026-08-06T15:46:10.153899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.131755Z","title":"other_time_points","venue":null,"work_id":"5ac866b3-12ff-407a-9996-bc8c7eb582a2","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.130975Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ab47e0c00a6d25a054a60674cd0cb5f721db1f10181912d43d5447e32b82d6b5","observation_id":"e1d54069-2ad1-44a4-9a0c-74c7a7d12d35","resolution":{"observed_at":"2026-08-06T15:46:10.136844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.113120Z","title":"needs_transformation","venue":null,"work_id":"7bf6e497-6c50-477f-9f4f-ecb3babeaff9","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.136861Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4d004a18f2fc155c4aebe529d7e134061c959306931899be8f81c52355d73427","observation_id":"69682989-e509-4562-9ede-0699148ce6d3","resolution":{"observed_at":"2026-08-06T15:46:10.117550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.095460Z","title":"null\"`, NOT `","venue":null,"work_id":"da4d2d8d-b3d1-4ce5-bc8b-b409e1bfd0a1","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.142821Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c6b788f6df8861743aa459f64ab3cf18d05b6773a6ad6a56e630b5c19a2f4c75","observation_id":"5af7e017-6330-4c4b-9a15-b03cafc5d496","resolution":{"observed_at":"2026-08-06T15:46:10.100782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.069808Z","title":"more common in the intervention group","venue":null,"work_id":"56c481fd-583a-4e91-ba18-5692f693d5da","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.149296Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:027d30b89e2ea1607237fec9617307fdb567de0b5cbc06f884ac054a8ab8c061","observation_id":"502eff7e-a05c-4706-a710-8504908387b9","resolution":{"observed_at":"2026-08-06T15:46:10.078892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.050344Z","title":"data_conflicts","venue":null,"work_id":"3fa7f6cc-5263-4003-b4c7-105d5687e075","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.156022Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6c25874dc871dd857e3a47d20cf595210c2f177bed05387d3f51d7bb99df5df2","observation_id":"03ae9405-e1de-40c5-a58f-b5f4d3b0af26","resolution":{"observed_at":"2026-08-06T15:46:10.058081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.030987Z","title":"pdf_status","venue":null,"work_id":"a79b89c7-5ee5-4b00-9609-f701d0ada2a3","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.167425Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c4621c90fd98ca1360dd3418bd2518b4e54afc994cd3762185d5cb55f9c9c7a1","observation_id":"cbdb9462-4a71-409a-9055-a8c6b0f3411e","resolution":{"observed_at":"2026-08-06T15:46:10.036874Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.013244Z","title":"pdf_status","venue":null,"work_id":"8d4e0190-d513-4643-ac5d-23852e7d9dc1","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.175488Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:24241b7053dfd0089d5ca3d73e6c6c9c10a41e20d0672596a8ec05c0ac01ba0f","observation_id":"be175a7f-d594-4d4a-b249-ba68e6a3e99c","resolution":{"observed_at":"2026-08-06T15:46:10.018641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.995635Z","title":"- Identify any *structural inconsistencies* (e.g., missing key study characteristics, incomplete sample size reporting)","venue":null,"work_id":"4eaf52d1-b1b9-4143-a470-1f615508e58e","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.180143Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5ac69a905829a136ac2118ec768e9f17d49964d6584159c3b81f09ac7182c442","observation_id":"b871bc30-9e35-4490-80b3-93fad8c85ad0","resolution":{"observed_at":"2026-08-06T15:46:10.000536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.976351Z","title":"- *Unit consistency*: Verify all measurements use the correct units (e.g., blood pressure should be in mmHg)","venue":null,"work_id":"a5a9b85c-856f-4e24-834a-0b217227e7c6","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.185009Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c8239b2bc0b5027f5cacf852303a4e664e2d57b5dc52d13c7cdd15b1757c14f8","observation_id":"011d302c-57c1-4b6c-9e08-c0b603624a95","resolution":{"observed_at":"2026-08-06T15:46:09.981621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.950307Z","title":"- Identify discrepancies and data conflicts between different sections of the paper (e.g., abstract vs","venue":null,"work_id":"33224557-decf-424d-b66d-1095452ec8f9","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.190287Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5f71cc7f3fd5f1df2f09f216a95820f28fb7822d946112d672f7dac492abf6fb","observation_id":"7e25a773-219d-4351-b77e-f33ec5ef81cf","resolution":{"observed_at":"2026-08-06T15:46:09.956642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.924051Z","title":"source\" the most appropriate location in the paper for this data? If not, provide a more accurate source. - Confidence Justification: Is the assigned","venue":null,"work_id":"3d015a27-ccac-4d42-a77f-6cb2b943fbda","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.194780Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d6ca62ad83e34d9914c2deba2bd0bfc770d5ac4713173e2fd7c5b39ee7c6ebe8","observation_id":"eeed05e4-b1e0-4c03-8474-33f38239b288","resolution":{"observed_at":"2026-08-06T15:46:09.929667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.903604Z","title":"needs_transformation","venue":null,"work_id":"e10e8b72-738c-4e54-b66e-d45182ae7270","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.200814Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9bc0d828a53313f7a6f0ae9881ff139cf186831a9a72236596f0e8987ae80b1e","observation_id":"b82d1c6d-022f-4f65-b6be-1fa851dfde95","resolution":{"observed_at":"2026-08-06T15:46:09.910425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.885567Z","title":null,"venue":null,"work_id":"942e7280-9c69-4fd3-9098-85c6d24b7596","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.207241Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:581b80ffddf5e8aea642ff9d7bb4d2faeb3144490f972aac04fa6b5849432f3e","observation_id":"3c9eca83-c241-4135-8854-e64f65e33fec","resolution":{"observed_at":"2026-08-06T15:46:09.890938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.866336Z","title":"null\"` or `","venue":null,"work_id":"8a328117-fc9e-42f7-a81f-9b71c4c7a83d","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.212807Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8906385fddb9c4040e8a50f00a5034b7e5526ffc063476e618342b8ff98079ee","observation_id":"8fdb2b6c-3a11-49f8-9877-ccc8cae1ee5a","resolution":{"observed_at":"2026-08-06T15:46:09.871709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.848667Z","title":"revised_value","venue":null,"work_id":"37935961-b56d-4c66-a363-4d4ffc5a7b1f","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.217778Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7dd5b5175cb74898ebd41a6620bcf37020cd11dca10184b79921fff7c9a4138a","observation_id":"92559793-e3f6-4e01-bbf9-3f5fdee6ad67","resolution":{"observed_at":"2026-08-06T15:46:09.855205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.830199Z","title":"pdf_status","venue":null,"work_id":"c9304b03-6c59-4c2a-868c-b0a066e9f9f4","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.222572Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5340339f40c612ba04f37a1e067a31285be77705a44ea1dfcb7de49d5ead6a0b","observation_id":"9fc1478b-13be-463e-83ff-8a368299de13","resolution":{"observed_at":"2026-08-06T15:46:09.835083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.807902Z","title":"confidence","venue":null,"work_id":"99725ce3-7e05-4159-9050-2607284b8648","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.234818Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:988be4f09a79431b68f9653e71738591f99af124a6b22548f757d58594df845c","observation_id":"90943ae5-6f81-415a-8a34-8356cbc00d3f","resolution":{"observed_at":"2026-08-06T15:46:09.813283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.787783Z","title":null,"venue":null,"work_id":"8359a8c5-208c-4861-a5e1-71fb3fbdda3b","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.240837Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:97cd5693c807ee7babcba1d3695cd215f7df6c42568ec139310f94cd0d712cf7","observation_id":"aa8d47f0-2708-41cd-a7a1-9c15b0df1e89","resolution":{"observed_at":"2026-08-06T15:46:09.793979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.764986Z","title":null,"venue":null,"work_id":"ba594968-d040-4628-a4ce-61e0e41ddcd8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.246699Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f6e4a3b35baca51ca3a74c444e2b2a2342319d5999cef8ba4c7416275b49b487","observation_id":"d2d90d35-360b-48b9-b65e-437e63df213b","resolution":{"observed_at":"2026-08-06T15:46:09.770068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.748452Z","title":"Just return the final merged JSON object","venue":null,"work_id":"10348bf6-7e5c-4341-bb5e-0996740b5125","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.252902Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8a767b453f4c64effbaea68fd885151ee04afaf893587d71f82546b0a6b0ef54","observation_id":"41fcd1e8-5048-4941-909e-7a53cd38dea4","resolution":{"observed_at":"2026-08-06T15:46:09.753155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.708551Z","title":"LGL_group","venue":null,"work_id":"5f45c079-7f9b-4ea9-adc1-5c432df0d8d5","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.270446Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:19b781c492b289cf97591835057312b366838ca01b6975b313c6b9aeed74aadd","observation_id":"9385cae5-652e-45cb-8c22-60b0402bf079","resolution":{"observed_at":"2026-08-06T15:46:09.713347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.689673Z","title":"**Note:** EXT fields may be nested","venue":null,"work_id":"d662518c-5960-46e8-9f0f-54bf6cbec332","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.277351Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:2543635c2a63d46d73daf4a2863ba9d2202d7f32f63236a4931d3f6d364d1972","observation_id":"bd83a4e9-a0df-4780-ada0-9ec931fa8fcd","resolution":{"observed_at":"2026-08-06T15:46:09.694694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.674634Z","title":"kg/m²\"` and `","venue":null,"work_id":"b1733554-215d-4710-86d8-3f180474a7a8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.284067Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3ff98c05e01347539cb3b937ebeac751bd535eea53b09882e57e9a975bfeef15","observation_id":"6c0500bc-867b-4458-806d-71ba0e2a6d13","resolution":{"observed_at":"2026-08-06T15:46:09.679005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.659645Z","title":"low glycemic load diet","venue":null,"work_id":"ab810b34-589b-4cb1-b4a1-62b256b92faf","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.291370Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:44feef66a82a340686ec85d4d9215751ff5e980a686c073cc6a09a4fe8396c83","observation_id":"7176815e-0209-41f6-8c8e-5775018994e1","resolution":{"observed_at":"2026-08-06T15:46:09.664051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.645039Z","title":"null\" or","venue":null,"work_id":"531d2794-fc7e-48cc-9079-a5ed0a5cb7fb","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.296906Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:caa66336ab483ff7a176b0cfd3c4ecbf9821a8e43330a62350fb7b70f89c5b30","observation_id":"17f12667-e5e3-4b97-af9c-4857f228a268","resolution":{"observed_at":"2026-08-06T15:46:09.649218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.630444Z","title":null,"venue":null,"work_id":"49a70989-32fe-405f-bf26-53d222a357d3","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.305674Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6eee58f3d46a0fa941d11895446089f3152d26854783d170f2f4a1d63224049d","observation_id":"1be37d85-a7de-4cf8-8428-1f2016d914b7","resolution":{"observed_at":"2026-08-06T15:46:09.635116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.615377Z","title":"randomised controlled trial","venue":null,"work_id":"1fda5cb4-b449-4e14-9ec9-0330f077b185","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.316558Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:bd785d5d2a9d16ee42957b7fc3fa7c39c2227d9305c0ac9afbfd7c7bdc27110d","observation_id":"2edfcde8-35c9-4f4d-9765-3301503073e9","resolution":{"observed_at":"2026-08-06T15:46:09.620028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.600334Z","title":"You may refer to EXT field meta-information (e.g., `source`, `notes`, `confidence`) to aid in field matching, especially when EXT uses vague or ambiguous labels","venue":null,"work_id":"62aff1eb-f2d5-414f-89a6-3c8861ee964d","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.322330Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:832d5f3e5be53eeed8bb9c81add0d420aaf9d65f0f943b03e840a430126ff453","observation_id":"fc808152-11b7-4421-add0-9536fa7c8b8c","resolution":{"observed_at":"2026-08-06T15:46:09.605521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.585252Z","title":"not reported","venue":null,"work_id":"ad6a30b4-1826-4596-808a-98c67aaa6acc","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.328561Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7e3f2cbb65725335ca59e74aa3e5861b659f6a0f6badf31ef6a23260fd9b748d","observation_id":"cdf87145-1676-4d00-b375-3100fed7d3fa","resolution":{"observed_at":"2026-08-06T15:46:09.589766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.569963Z","title":null,"venue":null,"work_id":"33e1ecf0-a86a-4517-b1a0-e6f53060f355","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.335133Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ef8a0ec62434b2e2801e9e022dd33e9086db045993341329142dae9fd90345c1","observation_id":"685b9bca-5db9-43cd-9dad-2c4663eac3aa","resolution":{"observed_at":"2026-08-06T15:46:09.575016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.553966Z","title":"null\" or","venue":null,"work_id":"68c18e06-3970-4b87-941d-99ad5914deeb","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.340397Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4812d19483d5b5c164af0cc76e31ca183e41e1b20700ebc4a5a75621378e92e8","observation_id":"8c836ecb-5ab3-4107-a7c8-4d359f7eae8a","resolution":{"observed_at":"2026-08-06T15:46:09.558785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.725751Z","title":"This is the preferred method","venue":null,"work_id":"f39a5965-ca50-4ad1-b78d-fbd04ecac9e2","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.345245Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ba78a5eb2cfd6581ece03f84bb88c192230762fa7d7763ca8acf33a59627759b","observation_id":"606b3b47-a88b-4036-b68c-99e978ad0083","resolution":{"observed_at":"2026-08-06T15:46:09.731507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.538591Z","title":"study_characteristics.PC","venue":null,"work_id":"3ecab22a-4cf9-4aa3-a79b-3bc54762f0df","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.350379Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:74e0ae37180e1ef3a829efc2482c7db6bcf4400e3afd6d2f7f2320f8293786c3","observation_id":"eb4f5bfe-8964-4cb9-82f6-44340197761e","resolution":{"observed_at":"2026-08-06T15:46:09.543680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.523579Z","title":"**Note:** GT and EXT fields may be nested","venue":null,"work_id":"1fadb4de-1c4d-4e8e-a8f4-00b289cab076","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.357558Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:0b485382212d943da3992a8b7b305b5c0dd751c7be11caa909feeea8edd95d16","observation_id":"6f81d274-411b-4662-8a29-b2a4b800eb0c","resolution":{"observed_at":"2026-08-06T15:46:09.528298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.508446Z","title":null,"venue":null,"work_id":"80150ca3-e4b8-4a36-b6bc-6ed6c2e0eb02","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.363013Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:b7ef7957f07c3cd08e46b2621ef4b4c12481086f0e71c2031ca0653c5d95e85d","observation_id":"d9c6a707-ca25-4048-ab83-9962fac63c46","resolution":{"observed_at":"2026-08-06T15:46:09.513048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.491034Z","title":"Hallucinated","venue":null,"work_id":"e15fc495-3154-447f-87c4-960d4fd1cf36","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.370459Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8dae81cb8c51d0908f8e4b773c90678135ae937921550b6cd8fdc46212e16e00","observation_id":"f85a4249-4b59-4dd7-8a96-a6d65085bd5f","resolution":{"observed_at":"2026-08-06T15:46:09.495300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.476401Z","title":"Not reported","venue":null,"work_id":"9aa6dcea-9fe3-4a4b-8b0a-15593dbd87ce","year":1976},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.376749Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:466038ce0fa9fe3132ab428b1a7d774aa1637e2aa15b259c410c25a277a40132","observation_id":"630a5e2b-c286-48be-b87e-e5bf735924fd","resolution":{"observed_at":"2026-08-06T15:46:09.480859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/1472-6947-10-56","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"BMC Medical Informatics and Decision Making","work_id":"1436c057-c0df-48a1-8d2e-d6dcf741cde8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.723776Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f58972878192102b3443494b7ed1ab592a4f128016bc672a68e9963d1e489cc8","observation_id":"6eb66810-3256-4c2e-ac1c-081f1c2e57ba","resolution":{"observed_at":"2026-08-06T15:46:08.993029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/33124","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi:10.2196/33124","venue":"JMIR Formative Research","work_id":"f2ffbe0f-a3c0-4d14-8561-6bf1d8452717","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.844989Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:1f0ce1e8c6aa0fefc36ac66cd9f113616e193c86c1ccc37879c7f49b7faf694c","observation_id":"f2e4c449-39dc-4619-bcfe-c1fbc710d46c","resolution":{"observed_at":"2026-08-06T15:46:08.908021Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.237","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi:10.18653/v1/2024.findings-naacl.237","venue":null,"work_id":"002b4e91-55b5-45f9-97f7-531cf80673fb","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.006169Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9282dddff1859dffae365b0bf0b215d70fb243318a50ad7733b23d198b60b098","observation_id":"d98a3bf5-63c6-4afe-962e-99dc9b911760","resolution":{"observed_at":"2026-08-06T15:46:08.707784Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-08-10T05:10:02.806455Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-06T15:46:08.090594Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.090594Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:02f943d2a5d7d94557e21817c15d2970a4dcab8eeabad4a9ce06ab787ffa31e6","observation_id":"eb66b4e2-c9ff-40f7-bcf8-a057212be15a","resolution":{"observed_at":"2026-08-06T15:46:08.090594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T00:35:48.807283Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":5,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":37,"verified_exact":16,"verified_fuzzy":38},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 1 inbound Pith citation observation for arXiv:2507.15152."}