{"as_of":"2026-08-15T01:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3f9d33152d15c10f340d97ab2b68bd30a7ea7a3d9b33f62692205778a6b260d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:28:10.894434Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:53:02.187519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T18:53:02.683433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15240","snapshot_observed_at":"2026-08-03T06:49:20.019956Z","title":"and Gales, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21817","last_updated":"2026-06-10T10:26:33Z","snapshot_observed_at":"2026-08-14T03:58:20.844869Z","submitted_at":"2026-01-29T15:01:28Z","title":"A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T06:49:20.019956Z"},"links":{"cited_paper":"/paper/2505.15240","citing_paper":"/paper/2601.21817"},"observation_digest":"sha256:6c4f70f53d3e204005e556a4edb7e761a6c23777005a0eb9dc109e4048d288a8","observation_id":"27443c4a-b1ef-430f-89dd-8f762f430d72","resolution":{"observed_at":"2026-08-03T06:49:20.019956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"cited_work":{"arxiv_id":"2505.15240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15240","snapshot_observed_at":"2026-08-08T18:53:02.683433Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","venue":"cs.AI","work_id":"1c62046e-a165-4d97-bd22-d4b13344229a","year":2025},"citing_paper":{"arxiv_id":"2608.04374","last_updated":"2026-08-05T02:31:48Z","snapshot_observed_at":"2026-08-14T17:57:52.345535Z","submitted_at":"2026-08-05T02:31:48Z","title":"FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T18:53:02.187519Z"},"links":{"cited_paper":"/paper/2505.15240","citing_paper":"/paper/2608.04374"},"observation_digest":"sha256:5b34c254f034f4b12e28f52a6f818acaa6b91a7c06d983792f51fb02b88dadbc","observation_id":"8fec4e1d-53fa-47cd-94f0-2b042fbe1a96","resolution":{"observed_at":"2026-08-08T18:53:02.689460Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15240/citation-record","integrity":"/paper/2505.15240/integrity","json":"/paper/2505.15240/citation-record.json","paper":"/paper/2505.15240"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:28:07.772078Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.772078Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:1aae2b500ff17d57764c832c0dd7dd18ad7350eb4c835a61172af0accd05429b","observation_id":"eadde58f-0925-492b-a928-73b06b038893","resolution":{"observed_at":"2026-08-07T15:28:07.772078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.891715Z","title":"Categorical data analysis","venue":null,"work_id":"28611cd3-1283-4305-b249-db042e06fdbf","year":1990},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.872856Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:9e4ccbb3497e1043c88f0e82f08f997f8d4f611c33e405af26c67c11d2458c65","observation_id":"467dbc23-a0d5-4c5f-9049-756a0e40b7c0","resolution":{"observed_at":"2026-08-07T15:28:14.953900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.813231Z","title":"A computationally intensive ranking system for paired comparison data","venue":null,"work_id":"5eaa109d-ce9e-4dc4-831e-a6dcfa5535e4","year":2018},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.925438Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6e3ac17e7ad1d49db1912f9f8a17b1fdebdc0ed36752bec7eb35987da195e0ce","observation_id":"db7db87a-aea4-42ba-bf0e-65311de07201","resolution":{"observed_at":"2026-08-07T15:28:14.838672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.965543Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.965543Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:72251733afd56149ffdd1e54a52db8933ef8b0b4adb4cd6fba87fabb91501ee6","observation_id":"96127373-87f6-45f5-a8eb-cbeca7724a9f","resolution":{"observed_at":"2026-08-07T15:28:07.965543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.029766Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.029766Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:bd54903b2b3848c32622fad9c78b1adc68bb59ac246ee9bcbf8f4eb958a77b6e","observation_id":"35d1a2ed-7104-4683-83e3-433242852d34","resolution":{"observed_at":"2026-08-07T15:28:08.029766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T15:28:08.130142Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.130142Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:9f3f158b22b166a2ce30599076d300bc7030bea422c9e5b0ce9eab84a3a22a3f","observation_id":"e5936fee-505a-43d0-9255-cb5dda048f1c","resolution":{"observed_at":"2026-08-07T15:28:08.130142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.179818Z","title":"Learning to rank: from pairwise approach to listwise approach","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.179818Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:fb120933ab257618b096a7d37cd020291c4e237dbcc347aada06d113424b99a1","observation_id":"5d8571d4-de8d-4bcf-a2d5-ef4679f4ee63","resolution":{"observed_at":"2026-08-07T15:28:08.179818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.252459Z","title":"Efficient bayesian inference for generalized bradley--terry models","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.252459Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:a1811fcfbd909d5cd42e761ed218a350603eef188ccdd039a5ac66effccdd831","observation_id":"356dde46-a9d5-46f6-888c-3f5bdc7e283d","resolution":{"observed_at":"2026-08-07T15:28:08.252459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.635842Z","title":"Models for paired comparison data: A review with emphasis on dependent data","venue":null,"work_id":"ae4b0c4c-e176-45fe-bcad-1ec484822f36","year":2012},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.346278Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d07e8271cf15a7606420aa8a8e1c3caf05a2c27641761b1910eac2b1cbcb910c","observation_id":"45c945fa-246a-4147-8f9f-64fecc9a50e3","resolution":{"observed_at":"2026-08-07T15:28:14.688879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.538691Z","title":"Humans or llms as the judge? a study on judgement biases, 2024 a","venue":null,"work_id":"46d97008-7a22-4527-a2eb-c1ab28f18bff","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.409355Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:3a5277797372e00ab072c4f9ca24c1eef23ec8f9a8b70b0d642851e9c9250a96","observation_id":"1e7ab943-58d5-4e45-8989-d6ed586af534","resolution":{"observed_at":"2026-08-07T15:28:14.587348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08939","last_updated":"2024-05-28T04:32:09Z","snapshot_observed_at":"2026-08-13T04:19:21.806858Z","submitted_at":"2024-02-14T04:50:18Z","title":"Premise Order Matters in Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08939","snapshot_observed_at":"2026-08-07T15:28:08.450887Z","title":"Chi, Xuezhi Wang, and Denny Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.450887Z"},"links":{"cited_paper":"/paper/2402.08939","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:44fe7bf9b3dcd49dc18707741d236c6525f46a7ca44d4fb9a0813ad483278a73","observation_id":"0d7ef445-02df-496d-bb81-bf337597a535","resolution":{"observed_at":"2026-08-07T15:28:08.450887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.444597Z","title":"Of human criteria and automatic metrics: A benchmark of the evaluation of story generation","venue":null,"work_id":"fb5abe7f-f8cc-4d44-aecc-29c7ff9f1949","year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.502773Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:e54c6faad9a67ffa79f55fbb6577727bf9c005fc172ef4dc12588e7b80bde711","observation_id":"d0015be6-7a2c-4c43-a796-579b9d683950","resolution":{"observed_at":"2026-08-07T15:28:14.488265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T15:28:08.594167Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.594167Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:58be484923f389be9e7c0a4ef6db0797e933b5afc378154c976ea3736c0ea8e6","observation_id":"f9799cb4-970b-4e35-ba8e-c3918c478614","resolution":{"observed_at":"2026-08-07T15:28:08.594167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.365369Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"6cca5bd7-f677-4fc6-8aa4-0bb3b0a1fdaa","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.640171Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d413c28fc5280668437fbf185dfc8f7bdeb81542cf4c3db8c2fc8446b7618884","observation_id":"2d6691a0-6d51-4edd-9f5e-8926df2563c6","resolution":{"observed_at":"2026-08-07T15:28:14.397921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.270642Z","title":"Ranking by pairwise comparisons for swiss-system tournaments","venue":null,"work_id":"42e6a311-b607-49f5-87ab-c73a0e21c9ab","year":2013},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.679816Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8417cf34f0e5cf5e10974b677902a327c80b658bd8e78c471cc2e339b0233a3a","observation_id":"1a6aa0b7-0ce2-484c-9fec-a6d176015723","resolution":{"observed_at":"2026-08-07T15:28:14.315039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.182058Z","title":"The method of paired comparisons, volume 12","venue":null,"work_id":"af874b0e-a729-4e0d-aad2-29bc49fed1cb","year":1963},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.741755Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:34453875eaab216e10aaff1a7ef44a6bcb9bb00067f52f933f57c0a3b656a127","observation_id":"6069fd9a-d81c-47ed-9d81-93c7aaf9f6cc","resolution":{"observed_at":"2026-08-07T15:28:14.212792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:28:08.826293Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.826293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:cbe525e44ce5b6486bcc0f47b0745889dc6e85b4e7509521d29c563984d14448","observation_id":"446665cf-8dd5-4de3-8efc-e0ff5235425c","resolution":{"observed_at":"2026-08-07T15:28:08.826293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.030163Z","title":"Rank aggregation methods for the web","venue":null,"work_id":"7ac82a0e-844e-4827-8ef0-a4542ac45c5c","year":2001},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.860405Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:eafa81d8025035263f62ee060841f2819f4c22f35184959dde93d4653aa4cfbe","observation_id":"f2db2e4d-2a6d-443b-90f4-870843a00bba","resolution":{"observed_at":"2026-08-07T15:28:14.106964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.906818Z","title":"Summeval: Re-evaluating summarization evaluation","venue":null,"work_id":"34a1552e-5586-4168-b54f-fa4e9aa882a6","year":2021},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.964922Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d90f35b4c9b6564be78169d2f5ecf264bd33b04a491ce8385352a3d4cc99ff59","observation_id":"da8ea7c2-855e-4f5a-bf8a-017ff2f09038","resolution":{"observed_at":"2026-08-07T15:28:13.961343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:28:09.027206Z","title":"Gptscore: Evaluate as you desire","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.027206Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:25090b8990576844ed1f4d4f1a634418cc7bcff602e6920b96602f22e91841bd","observation_id":"8042578b-947a-4264-b9c7-a3660f7d2c4f","resolution":{"observed_at":"2026-08-07T15:28:09.027206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.782955Z","title":"Trueskill™: a bayesian skill rating system","venue":null,"work_id":"d2b66c72-ed61-4da9-b2e6-d462e3614d78","year":2006},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.064810Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:5c90dc1a0136fe55e560169174169ee7a969148a6e82d8b898746316957d96ec","observation_id":"8b01b668-9df0-496a-961b-60ca7706f7f0","resolution":{"observed_at":"2026-08-07T15:28:13.835903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.664605Z","title":null,"venue":null,"work_id":"83b19b5c-42e4-449e-919c-c7ecb39086cb","year":1999},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.174549Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8b4bab48e60daaa4dda46afba5227eb574d6dddb0438b5af72ff68b0a8eaca27","observation_id":"b56986d4-cd59-4ed1-8c13-8dfcba911fe0","resolution":{"observed_at":"2026-08-07T15:28:13.709267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14520","last_updated":"2023-05-31T19:51:51Z","snapshot_observed_at":"2026-08-13T12:35:22.929236Z","submitted_at":"2023-02-28T12:23:48Z","title":"Large Language Models Are State-of-the-Art Evaluators of Translation Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14520","snapshot_observed_at":"2026-08-07T15:28:09.226377Z","title":"Large language models are state-of-the-art evaluators of translation quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.226377Z"},"links":{"cited_paper":"/paper/2302.14520","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8973d08c029efda1fa7960578b998140b74673e1d3de5a64bc84f083eb3107bc","observation_id":"e6ff5acb-ce24-4ec7-8b84-622957033dce","resolution":{"observed_at":"2026-08-07T15:28:09.226377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.268446Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.268446Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b252de8902924c24d500c86e88d90d947ddc27fecd5014bb2a976a52d79b0558","observation_id":"339a8c9d-66c9-4d53-acbf-8cf41c0a0d9b","resolution":{"observed_at":"2026-08-07T15:28:09.268446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.310157Z","title":"Learning to rank for information retrieval","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.310157Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8243fe3f90bfd7ac9a281c6311a855ac8b1b8e144f5c660370884d1eaf9dfb29","observation_id":"73b61eed-2a0f-4020-a8a6-cbf2e2bca907","resolution":{"observed_at":"2026-08-07T15:28:09.310157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.389780Z","title":"G -eval: NLG evaluation using gpt-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.389780Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d988f1fee3dafef6669092e4a7f0405d15f910b901484ecd6056198c0fb9e71b","observation_id":"fffee44e-23f9-4fd5-a59a-e7f9814163e9","resolution":{"observed_at":"2026-08-07T15:28:09.389780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.397044Z","title":"Aligning with human judgement: The role of pairwise preference in large language model evaluators, 2024 b","venue":null,"work_id":"3f5ad0f0-53d9-42ea-8872-56c40abf20e7","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.452271Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:a958a9030c1fe089fc5602b4789a724e1525345bbb4e7eae4000f87ddf42d521","observation_id":"6340000d-5367-4002-8518-90d0d56a1d97","resolution":{"observed_at":"2026-08-07T15:28:13.546621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13590","last_updated":"2024-03-20T13:38:07Z","snapshot_observed_at":"2026-08-13T00:49:30.190072Z","submitted_at":"2024-03-20T13:38:07Z","title":"Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.13590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13590","snapshot_observed_at":"2026-08-07T15:28:11.760816Z","title":"Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models","venue":"cs.CL","work_id":"dec1581e-1737-46a0-9a70-49065d4c8319","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.490840Z"},"links":{"cited_paper":"/paper/2403.13590","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6f48be214bef0d91d79084089c7ceac70762f0836d47d4f8c545803639327333","observation_id":"15275cc5-d69f-428f-9750-5ce9be79c1f0","resolution":{"observed_at":"2026-08-07T15:28:11.788655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.136149Z","title":"LLM comparative assessment: Zero-shot NLG evaluation through pairwise comparisons using large language models","venue":null,"work_id":"a05d05cb-e9e9-46f2-9731-232333b874ff","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.555067Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:4fa933c3a240e80b26498679a6139b37c50627dffb786585e1ca1714170f8a4e","observation_id":"4dc69aba-b45f-4250-bafe-7e67660805b5","resolution":{"observed_at":"2026-08-07T15:28:13.241221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05894","last_updated":"2024-11-12T14:06:49Z","snapshot_observed_at":"2026-08-14T11:12:08.643535Z","submitted_at":"2024-05-09T16:45:27Z","title":"Efficient LLM Comparative Assessment: a Product of Experts Framework for Pairwise Comparisons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05894","snapshot_observed_at":"2026-08-07T15:28:09.676956Z","title":"Efficient llm comparative assessment: a product of experts framework for pairwise comparisons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.676956Z"},"links":{"cited_paper":"/paper/2405.05894","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:f1fd1efa7f025709a65f80310b349a3d45a9cfda916fd2bc1fcf9401b8e112e1","observation_id":"2da9566a-ddd2-4c3b-b617-7e6400494f5a","resolution":{"observed_at":"2026-08-07T15:28:09.676956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.955675Z","title":"Stated choice methods: analysis and applications","venue":null,"work_id":"a91e10a7-4cee-4c1e-beb8-3173d73d5940","year":2000},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.717192Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6c5982d381a09c10185bb8527c7d06fbbaec385d97c3d360f462299e41a15931","observation_id":"8d705c09-3f70-4972-8cf6-05be56ecf021","resolution":{"observed_at":"2026-08-07T15:28:12.992603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.863973Z","title":"The structure of random utility models","venue":null,"work_id":"ed9384ac-1586-4edf-b8b7-8ed7d3802cd9","year":1977},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.761167Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:c65d438d976274111309d49b59b879f5932eeff34b40d16f1abe07d30b1565b0","observation_id":"604b0b71-aa6f-440e-9a13-713aa2d9803b","resolution":{"observed_at":"2026-08-07T15:28:12.905404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.755331Z","title":"Trueskill 2: An improved bayesian skill rating system","venue":null,"work_id":"50f88996-3709-4da7-96be-c5deb1b3aa29","year":2018},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.855334Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:eac1b04f2f884a40c24ddf839e7d399e434b95f2b8c52825d54f77c3d9f1bf43","observation_id":"e5bcca16-bf0f-4c06-8e03-87463ceed9af","resolution":{"observed_at":"2026-08-07T15:28:12.795135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.636055Z","title":"Efficient computation of rankings from pairwise comparisons","venue":null,"work_id":"df484157-b39f-446e-8905-5f0d21af974f","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.912909Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6191ef50085342b5b5375b3343b288cee7fbb3829f96a7326b1c6f2260d5afd0","observation_id":"1ed99d0f-dab3-457f-8066-f050f4cb1d0b","resolution":{"observed_at":"2026-08-07T15:28:12.683651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.957908Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.957908Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:ad2b5634412e83b300a7a88443b47145e97a652ddad814bd51c9e0dc7820b7c8","observation_id":"f3c346b9-2726-4ab0-a5ca-f87e319bb147","resolution":{"observed_at":"2026-08-07T15:28:09.957908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01015","last_updated":"2024-07-18T02:00:41Z","snapshot_observed_at":"2026-08-13T00:40:13.338575Z","submitted_at":"2024-04-01T09:35:06Z","title":"PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison","version":2},"cited_work":{"arxiv_id":"2404.01015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01015","snapshot_observed_at":"2026-08-07T15:28:11.540931Z","title":"PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison","venue":"cs.CL","work_id":"898602b8-a074-44b9-9be0-2e9dab03d23d","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.001331Z"},"links":{"cited_paper":"/paper/2404.01015","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:f1c1ac30f539e49b154574147c38bdea1c309fbe5ac2a4e8044dd0b11fa617a8","observation_id":"a898b7d7-b1e6-4c88-990c-ea67df9c3fb8","resolution":{"observed_at":"2026-08-07T15:28:11.613917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17563","last_updated":"2024-03-28T13:59:09Z","snapshot_observed_at":"2026-08-14T20:21:53.563107Z","submitted_at":"2023-06-30T11:32:25Z","title":"Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17563","snapshot_observed_at":"2026-08-07T15:28:10.098915Z","title":"Large language models are effective text rankers with pairwise ranking prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.098915Z"},"links":{"cited_paper":"/paper/2306.17563","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:72f1a3bd6020a14cfc877d2d77bbad7c673fc245344380b5f1280223267b8e52","observation_id":"e1e43ffc-2cc6-4775-9367-77bafad316bf","resolution":{"observed_at":"2026-08-07T15:28:10.098915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.160968Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.160968Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8398d0f71d3e8b2247e7eba9f6ec0b1caf43015b59241f5509b0553692aaaf05","observation_id":"a45b21d5-04e9-4df4-9199-7dcac28bfe06","resolution":{"observed_at":"2026-08-07T15:28:10.160968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15979","last_updated":"2024-09-24T11:21:43Z","snapshot_observed_at":"2026-08-12T22:38:45.597394Z","submitted_at":"2024-09-24T11:21:43Z","title":"Finetuning LLMs for Comparative Assessment Tasks","version":1},"cited_work":{"arxiv_id":"2409.15979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15979","snapshot_observed_at":"2026-08-07T15:28:11.347314Z","title":"Finetuning LLMs for Comparative Assessment Tasks","venue":"cs.CL","work_id":"3158de9d-91b4-49a4-a976-772f11d7677f","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.202374Z"},"links":{"cited_paper":"/paper/2409.15979","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:470762c5666203f8d5705e1dbc45cb9a4c7793210884c7cef3096bb8f18f80c1","observation_id":"f1abfbcf-c988-4af7-b6c5-960383d42a60","resolution":{"observed_at":"2026-08-07T15:28:11.376856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.260157Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.260157Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d5034d71b6ef9d3cedb6573a11e79a45936b9078c36c9b23248434d7f6afbf80","observation_id":"1b2d98d3-156a-4685-a01b-f136671e54a9","resolution":{"observed_at":"2026-08-07T15:28:10.260157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-14T11:06:12.407244Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-07T15:28:10.352664Z","title":"Is chatgpt a good nlg evaluator? a preliminary study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.352664Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:e279cbcb939dc7c6a084d5ae5077eab1e6ea48b2785ea667e58b2ece70480ab4","observation_id":"9ef6c73d-62fc-4021-b73b-af03aada0b01","resolution":{"observed_at":"2026-08-07T15:28:10.352664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.464357Z","title":"Large language models are not fair evaluators, 2023 b","venue":null,"work_id":"fe6a49bf-1099-4ec2-b319-2c7a1f209c1d","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.387688Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6c2c2c7ffb32d15da14336f56ca8a26e87e910f9281f0e6f7fc5da2dbc4f22f8","observation_id":"e62c44d6-1bf2-4314-b9dd-834bdb2ca0b6","resolution":{"observed_at":"2026-08-07T15:28:12.506759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.453435Z","title":"Primacy effect of C hat GPT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.453435Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:98d5cf1a95517bde113079baac0bb07d71dd0e849098eea41e86e4ca2f176558","observation_id":"d010cadd-bc90-4b67-98f0-71747f35ac9e","resolution":{"observed_at":"2026-08-07T15:28:10.453435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-13T22:45:34.795769Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T15:28:10.548443Z","title":"Self-instruct: Aligning language models with self-generated instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.548443Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:f98144afdfa76dc9d9b1db4b35242a3c53e2313d840fedbeff587a6b0865f8fd","observation_id":"ab765c02-662e-40be-9d11-00c87efb2024","resolution":{"observed_at":"2026-08-07T15:28:10.548443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4249/scholarpedia.3879","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Scholarpedia","work_id":"a9742c3b-9933-4e86-ae40-3c5083253186","year":2007},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.610236Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:c9b9106e72afcf9cd73e41101cb959dec86ad767817c658dee5caa990e1ba447","observation_id":"e96b7956-0621-4486-b72c-160692212958","resolution":{"observed_at":"2026-08-07T15:28:11.117158Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.335993Z","title":"Die berechnung der turnier-ergebnisse als ein maximumproblem der wahrscheinlichkeitsrechnung","venue":null,"work_id":"345670ce-fa87-4591-8cce-17420f285ac1","year":1929},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.723001Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:dcea6094b9baaff6b693573e5736bba25694a0a0d69b0343a44678e8b0601b5b","observation_id":"240c239b-42aa-4f59-a97f-d2e88c222feb","resolution":{"observed_at":"2026-08-07T15:28:12.399371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T15:28:10.779957Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.779957Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8090fe4787917d289938db16ee77bc568b447b43d07ad1eda6cb92a2587ef448","observation_id":"af9ba3e4-36ba-4be3-85fa-bb043de809d4","resolution":{"observed_at":"2026-08-07T15:28:10.779957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.215866Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"ddec0245-f963-4e18-bb30-082b713a4c6d","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.828110Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b57677edbcb92e57d3c38ac905ff60e7fd4b523a20a4b1738988428d85be6cca","observation_id":"3954a661-deb0-4836-96b3-456b129590b5","resolution":{"observed_at":"2026-08-07T15:28:12.275766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.075786Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":"e18b5496-bc99-4a09-b130-e79760ab0303","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.894434Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b580f16b174547f5a6f5912b4dc8aebe0e1f592198ff15c1cabe0712c2f37d7a","observation_id":"9b426243-0836-4127-a569-ebc5eb8d8e14","resolution":{"observed_at":"2026-08-07T15:28:12.145963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":21},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2505.15240."}