{"as_of":"2026-08-19T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23584ba0a7e5e68b1e531559eaa67d30e11a501114994b8549f4146fd7b387e4","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:58:27.657384Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03785/citation-record","integrity":"/paper/2506.03785/integrity","json":"/paper/2506.03785/citation-record.json","paper":"/paper/2506.03785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:58:26.583069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:26.583069Z"},"links":{"citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:7d9134d90df8ba64bbcdea0e270c585f01502d7ee2a679d27d982ac0e4dbe5b0","observation_id":"331d1f76-3d4d-4d0a-9293-1f544e829147","resolution":{"observed_at":"2026-08-07T10:58:26.583069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10421","last_updated":"2024-10-02T14:20:50Z","snapshot_observed_at":"2026-08-16T13:42:48.758506Z","submitted_at":"2024-06-14T21:52:21Z","title":"SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading","version":3},"cited_work":{"arxiv_id":"2406.10421","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10421","snapshot_observed_at":"2026-08-07T10:58:28.043796Z","title":"SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading","venue":"cs.CL","work_id":"5d3b3f74-9b7d-4786-aa8b-8f247f592b3e","year":2024},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:26.696473Z"},"links":{"cited_paper":"/paper/2406.10421","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:3e03549117b3b3a0976ec170e392dbd57abfd7655de05d8f85b144f89758b1dd","observation_id":"647f39a9-061e-4496-b608-7e577fe028fd","resolution":{"observed_at":"2026-08-07T10:58:28.168041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:58:26.789363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:26.789363Z"},"links":{"citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:4518737398b237ae86e0faa707b220d8660bdd9aa349ea775aeecc724b5fe18d","observation_id":"85d3b424-5874-4216-83a8-654b2f96e3ad","resolution":{"observed_at":"2026-08-07T10:58:26.789363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:58:26.930200Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:26.930200Z"},"links":{"citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:8c183b612f18154c98e7fc4ec9c94c07f4e1d0ecd9b49176812b4052ccf63e20","observation_id":"fceb344c-b0ce-4cbc-aa62-dcc7fff13356","resolution":{"observed_at":"2026-08-07T10:58:26.930200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07889","last_updated":"2024-02-06T17:05:58Z","snapshot_observed_at":"2026-08-16T15:15:59.443149Z","submitted_at":"2023-07-15T22:02:12Z","title":"LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07889","snapshot_observed_at":"2026-08-07T10:58:27.025105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.025105Z"},"links":{"cited_paper":"/paper/2307.07889","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:f0c31a08b0b737947f53b4b8fa814df95602550f4337e23c50a3c88b7a6236bb","observation_id":"df6d0917-afb7-454d-b77f-f2a6d1a7b858","resolution":{"observed_at":"2026-08-07T10:58:27.025105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17563","last_updated":"2024-03-28T13:59:09Z","snapshot_observed_at":"2026-08-19T01:19:52.706355Z","submitted_at":"2023-06-30T11:32:25Z","title":"Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17563","snapshot_observed_at":"2026-08-07T10:58:27.135754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.135754Z"},"links":{"cited_paper":"/paper/2306.17563","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:d458df4845aad00c8f3fd09a388c74a92f296178f70969e026a14282cd5d5efb","observation_id":"3abebc9c-4799-4c0d-9afd-db3fab180062","resolution":{"observed_at":"2026-08-07T10:58:27.135754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13138","last_updated":"2025-03-13T20:32:18Z","snapshot_observed_at":"2026-08-16T22:27:34.627415Z","submitted_at":"2024-06-19T01:08:03Z","title":"Large Language Models are Biased Because They Are Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13138","snapshot_observed_at":"2026-08-07T10:58:27.262021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.262021Z"},"links":{"cited_paper":"/paper/2406.13138","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:0d658acbaf668a20ea664a86caa606f0ce76a82fe8c7cbb5a374b8bdf4c056c5","observation_id":"333b0b5b-1c0a-4de9-9522-bc719485b433","resolution":{"observed_at":"2026-08-07T10:58:27.262021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-16T15:50:04.573553Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-07T10:58:27.365332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.365332Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:a74e399ac42445b8fa3105b0913536dbb1bed28f973394cdace9d796cd6bb032","observation_id":"d54c5bac-9273-48d6-b8c2-88b91f717d13","resolution":{"observed_at":"2026-08-07T10:58:27.365332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T10:58:27.445120Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.445120Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:8301934d2ee9e0b94d4e3ca99acfef99175e13871ccf76a04ca57572b01ce585","observation_id":"a9f5cabf-7b10-4ae3-8b80-50c79fa0b58e","resolution":{"observed_at":"2026-08-07T10:58:27.445120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:58:27.548955Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.548955Z"},"links":{"citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:4b86fdc0bf74be9bd236bc59e7eacea0f716a9f27687a3380893b13ffa03ecbf","observation_id":"5dc644c4-dcf5-48f5-ad19-b45acd21457d","resolution":{"observed_at":"2026-08-07T10:58:27.548955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:58:27.657384Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:27.657384Z"},"links":{"citing_paper":"/paper/2506.03785"},"observation_digest":"sha256:dd7a0a5b42d48653d0532829639aa7aa92fe3af643092f3e05c3a2040212fee0","observation_id":"604b1408-b9d0-4fb3-970b-6e7158486d25","resolution":{"observed_at":"2026-08-07T10:58:27.657384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03785","last_updated":"2025-07-09T10:58:38Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T09:26:30.824173Z","submitted_at":"2025-06-04T09:46:43Z","title":"Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2506.03785."}