{"as_of":"2026-08-23T03:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:441d9be201052f7169f6c1c3d13637e3593c5952959d5c606ce48dcd85c24666","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:40:42.268550Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:22:56.174076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2509.22055","last_updated":"2026-04-11T08:49:59Z","snapshot_observed_at":"2026-08-13T02:10:16.582935Z","submitted_at":"2025-09-26T08:36:45Z","title":"RedNote-Vibe: A Dataset for Capturing Temporal Dynamics of AI-Generated Text in Lifestyle Social Media","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:46:48.348859Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2509.22055"},"observation_digest":"sha256:c34eaced9ba757fca61c87b95da39193570363709687b8b58c6f2534c871ed04","observation_id":"b56aec3f-1b02-45fa-8577-3816428ecdc9","resolution":{"observed_at":"2026-05-18T13:51:26.124111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2509.26464","last_updated":"2026-05-19T17:20:14Z","snapshot_observed_at":"2026-08-15T18:34:03.842007Z","submitted_at":"2025-09-30T16:13:56Z","title":"Extreme Self-Preference in Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T20:57:37.199128Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2509.26464"},"observation_digest":"sha256:307a6140a31759185fb4b11c38ba206d950be33193d5be1fe911414346a2abd6","observation_id":"1af5245e-b6bd-4899-9cf6-12a53103a301","resolution":{"observed_at":"2026-05-21T21:00:39.082645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2510.07517","last_updated":"2026-04-09T17:03:18Z","snapshot_observed_at":"2026-08-13T22:17:37.730697Z","submitted_at":"2025-10-08T20:29:46Z","title":"When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T08:50:53.486588Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2510.07517"},"observation_digest":"sha256:5b39c85ad86bedde60a667434f0ac5fe75c10733b6309708b980f89f14d7082b","observation_id":"6022807f-8a57-4574-bd20-c2abb734a229","resolution":{"observed_at":"2026-05-18T08:51:08.533941Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-03T06:35:37.070203Z","title":"doi: 10.18653/v1/P17-1099","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22548","last_updated":"2026-06-22T18:27:35Z","snapshot_observed_at":"2026-08-21T22:27:39.991566Z","submitted_at":"2026-01-30T04:38:18Z","title":"Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T06:35:37.070203Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2601.22548"},"observation_digest":"sha256:233207c06cd55c7d9be9a4495e21e6d23904c121efc802b56d379752e25780d3","observation_id":"40c16883-2fe6-48d7-a8f9-8420bfe1dbba","resolution":{"observed_at":"2026-08-03T06:35:37.070203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2602.11157","last_updated":"2025-12-08T06:48:17Z","snapshot_observed_at":"2026-08-11T06:21:28.149022Z","submitted_at":"2025-12-08T06:48:17Z","title":"Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T01:27:16.967080Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2602.11157"},"observation_digest":"sha256:6e29f7518555828ab305a3a843bbeeab7df24c041c96d36df9010aa82f963e66","observation_id":"6bcbd550-bf76-455c-8374-2092d0880441","resolution":{"observed_at":"2026-05-17T01:28:48.785362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2604.05593","last_updated":"2026-04-07T08:43:30Z","snapshot_observed_at":"2026-08-12T23:25:06.692122Z","submitted_at":"2026-04-07T08:43:30Z","title":"Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T19:38:11.595077Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.05593"},"observation_digest":"sha256:7d205a27d13e2255138fa5aed4cd91f57036a0e357013284120e5d5ad2e213fe","observation_id":"4d2d3d9e-46ad-4bc4-8ec8-5f727af6279c","resolution":{"observed_at":"2026-05-10T22:40:51.666192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:0d226b181f873cf76763e14f18f5d81ef85b0f8cf9eacbefc9e23a77852d280c","observation_id":"2cfb26b7-9e07-417b-906a-14e481c77c59","resolution":{"observed_at":"2026-05-11T00:50:50.434134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-02T16:40:55.448677Z","title":"Play favorites: A statistical method to measure self-bias in llm-as-a-judge.arXiv preprint arXiv:2508.06709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.448677Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:8fdc0f4bdf8d0ff0c670ecaf2638f8c01d20fd3fda40f1d07522e191c4f4cd1d","observation_id":"44be8642-c2da-490b-b916-08fbd24dc89a","resolution":{"observed_at":"2026-08-02T16:40:55.448677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-04T05:36:43.365289Z","title":"Play favorites: A statistical method to measure self-bias in llm-as-a-judge.arXiv preprint arXiv:2508.06709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.365289Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:a9485079607b16ecbb08fd326a13b82c86603383d22bd8c1949f13f614e64ace","observation_id":"e0c2e89e-0807-40cc-aad1-04f92cd4a65d","resolution":{"observed_at":"2026-08-04T05:36:43.365289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2605.17173","last_updated":"2026-08-11T01:53:13Z","snapshot_observed_at":"2026-08-15T05:56:08.173988Z","submitted_at":"2026-05-16T22:08:54Z","title":"Why Do Safety Guardrails Degrade Across Languages?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T14:17:41.347193Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2605.17173"},"observation_digest":"sha256:b40ed8cc2b633d16d7d83f92396f41c732b6daa38644e26f18c6991c6eca117c","observation_id":"3e25a0e9-63c4-4f43-a7de-2c632048062e","resolution":{"observed_at":"2026-05-20T14:18:21.034567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-11T09:05:16.100158Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:d16b242ad600675451c625cc25461808fcc5dbb8edbc5c5e6ab2876ad64e978b","observation_id":"328827ab-7ee7-488b-8ec1-322163c9e6d9","resolution":{"observed_at":"2026-07-02T02:36:27.462423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2606.06454","last_updated":"2026-06-04T17:49:00Z","snapshot_observed_at":"2026-08-16T06:41:01.033279Z","submitted_at":"2026-06-04T17:49:00Z","title":"Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T00:08:06.720586Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2606.06454"},"observation_digest":"sha256:0644d9e3df716de5b77650244f87ceb9f41664499dfd91c8ccdde257cc07cbf2","observation_id":"daf7bb2d-8931-4544-87ec-51046d0acc16","resolution":{"observed_at":"2026-07-02T14:47:04.549846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:db40640629232168a2b51c540914988e4e979ccd1ae2bfb440bc565b77d04b9d","observation_id":"2bfa219f-0831-4e2d-8252-5e3a3f8ba9d5","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-03T11:54:20.710057Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29196","last_updated":"2026-07-31T09:15:56Z","snapshot_observed_at":"2026-08-15T16:49:47.315727Z","submitted_at":"2026-07-31T09:15:56Z","title":"Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T11:54:20.710057Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2607.29196"},"observation_digest":"sha256:2830b4c399f130b0c405ad131820cc114f10fad4ccc9752616ed306dee1afbfa","observation_id":"fa650952-5d5a-4684-b682-9a9d4e91de11","resolution":{"observed_at":"2026-08-03T11:54:20.710057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T04:18:54.154755Z","title":"Spiliopoulou, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00794","last_updated":"2026-08-05T05:37:25Z","snapshot_observed_at":"2026-08-21T20:52:43.823108Z","submitted_at":"2026-08-01T17:50:12Z","title":"Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:18:54.154755Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2608.00794"},"observation_digest":"sha256:cb7bbf8781f39266cf0d8fb55e28655e6a5309ef393f5c70140c50b471a85591","observation_id":"c40e4a63-4ed1-40a0-99a9-2c20f9ab037e","resolution":{"observed_at":"2026-08-05T04:18:54.154755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-06T04:16:26.027632Z","title":"Spiliopoulou, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00794","last_updated":"2026-08-05T05:37:25Z","snapshot_observed_at":"2026-08-21T20:52:43.823108Z","submitted_at":"2026-08-01T17:50:12Z","title":"Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:16:26.027632Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2608.00794"},"observation_digest":"sha256:aaec4fd0517ab12ba2e75f4670be622d8a49ebb7cff4f819714b6ce0a9d50f65","observation_id":"02488741-6b29-4e9b-bf88-00a539169708","resolution":{"observed_at":"2026-08-06T04:16:26.027632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-11T00:22:56.174076Z","title":"arXiv:2508.06709 (2025) https://arxiv.org/abs/2508.06709 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.174076Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:fe5e7a54fe4260d07e063d0ac805efdcd7468fdb8fb8c123823c7754161a683f","observation_id":"e166e748-13c0-4c34-b676-936972121e76","resolution":{"observed_at":"2026-08-11T00:22:56.174076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06709/citation-record","integrity":"/paper/2508.06709/integrity","json":"/paper/2508.06709/citation-record.json","paper":"/paper/2508.06709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T22:40:42.167324Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.167324Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:0fbc7066e98f5a5cc54b1510e24e244fc7f9b501b0c6c2a0648b127a1ba17889","observation_id":"36620798-45f4-4c0b-a057-a2f1225267ed","resolution":{"observed_at":"2026-08-05T22:40:42.167324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T22:40:42.175210Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862 , 2022a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.175210Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:9b1ea8ac06a939cdb313683c34c244da799b769f50ba1ccdc0d373c7a344da97","observation_id":"6b31b1aa-453c-44d3-a790-dd4b345c54b1","resolution":{"observed_at":"2026-08-05T22:40:42.175210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.663475Z","title":"Here they are: [list of 7 restaurants] Low There are only 7 restaurants with a yelp rating of 5 in North Platsville","venue":null,"work_id":"3084efd5-f7e6-4d29-963c-9f421cffed3d","year":1954},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.261241Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:2f87d21a7e096b1e4c46d0308a1dc866ae1db1c30e3b21df42a15bf1e11f0d0d","observation_id":"31a342e9-9936-4dfc-802a-e07af9026c36","resolution":{"observed_at":"2026-08-05T22:40:42.667071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11188","last_updated":"2021-06-21T15:27:11Z","snapshot_observed_at":"2026-08-16T18:15:36.798963Z","submitted_at":"2021-06-21T15:27:11Z","title":"maars: Tidy Inference under the 'Models as Approximations' Framework in R","version":1},"cited_work":{"arxiv_id":"2106.11188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11188","snapshot_observed_at":"2026-08-05T22:40:42.521202Z","title":"maars: Tidy Inference under the 'Models as Approximations' Framework in R","venue":"stat.ME","work_id":"19101488-1a24-463e-b8fd-ff67c1f2d661","year":2021},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.189024Z"},"links":{"cited_paper":"/paper/2106.11188","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:c437c25171b73508a08c88270bf9906167e2505ed758b79752fd915f4d9fd418","observation_id":"cd81f2d6-217e-43ff-bd4c-5517b1807056","resolution":{"observed_at":"2026-08-05T22:40:42.527450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T22:40:42.195962Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.195962Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:e75fdc73190b505d86010bb73489eb1bac3fcc693a620a37309aaf6dafd4ff3d","observation_id":"88e6b996-898f-40ab-96ea-fe4d1d2993c3","resolution":{"observed_at":"2026-08-05T22:40:42.195962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T22:40:42.202754Z","title":"Seungone Kim, Juyoung Suk, Shayne Longpre, Bill Yuchen Lin, Jamin Shin, Sean Welleck, Graham Neubig, Moontae Lee, Kyungjae Lee, and Minjoon Seo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.202754Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:9b118d33a2059398e104df27eb7825ca974d2a64ffbe8ef6425a458eba63d30a","observation_id":"a1a7d895-0bea-4b43-9374-291a03674111","resolution":{"observed_at":"2026-08-05T22:40:42.202754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-08-17T11:56:26.482360Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-05T22:40:42.206258Z","title":"Bench- marking cognitive biases in large language models as evaluators.arXiv preprint arXiv:2309.17012 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.206258Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:f3b07deed57e6cf1f6c0d540e0c7b2133463a523cbca1d8091ebb49a7992a560","observation_id":"44abe90e-85c8-43a4-9e08-15a1b0802d92","resolution":{"observed_at":"2026-08-05T22:40:42.206258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10538","last_updated":"2018-09-27T14:25:29Z","snapshot_observed_at":"2026-08-17T03:14:34.861540Z","submitted_at":"2018-09-27T14:25:29Z","title":"Model-free Study of Ordinary Least Squares Linear Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.10538","snapshot_observed_at":"2026-08-05T22:40:42.209390Z","title":"Model-free study of ordinary least squares linear regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.209390Z"},"links":{"cited_paper":"/paper/1809.10538","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:3538d6ea377d4b0f11d928cf60d78ea0dbac11daa52028d022fad7abac3b52bc","observation_id":"6ca0770c-082e-409e-b593-a7a18a3c892e","resolution":{"observed_at":"2026-08-05T22:40:42.209390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-18T02:44:37.072871Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-05T22:40:42.222615Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.222615Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:f46d696466b0f6de6b9f0721ceef1a1c127696a4c4ddefc0ca2a54342726397a","observation_id":"e1b4a454-ab3b-4ee8-b80d-7bc864ed07a2","resolution":{"observed_at":"2026-08-05T22:40:42.222615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.715833Z","title":"Red teaming language models with language models","venue":null,"work_id":"73f20a7e-92f9-47aa-a66d-a7712c8d24ee","year":2022},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.228653Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:7dd3b4db4a2a71bf7b0d967540cd3771d081a074fb35654b95b7835e14e8ff7a","observation_id":"0329d65d-1fa1-40d7-8b6f-ac82cad12d74","resolution":{"observed_at":"2026-08-05T22:40:42.718877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10076","last_updated":"2023-10-16T05:19:02Z","snapshot_observed_at":"2026-08-19T20:15:57.441818Z","submitted_at":"2023-10-16T05:19:02Z","title":"Verbosity Bias in Preference Labeling by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10076","snapshot_observed_at":"2026-08-05T22:40:42.231938Z","title":"Verbosity bias in preference labeling by large language models.arXiv preprint arXiv:2310.10076 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.231938Z"},"links":{"cited_paper":"/paper/2310.10076","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:87d55064f43f35b09de2b1cc5e01bfe7605d8c466016453914d05f470fdb4283","observation_id":"5eb9e439-0269-4ae7-a484-92e8eaec9ae3","resolution":{"observed_at":"2026-08-05T22:40:42.231938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-05T22:40:42.238510Z","title":"Replacing judges with juries: Evaluating llm generations with a panel of diverse models.arXiv preprint arXiv:2404.18796 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.238510Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:8d216a0bef8323dd3ecc0acde59b7aba74b87ad92090d06c797dd0414f1cffd4","observation_id":"ccab4162-85cf-455c-a242-9766a689756c","resolution":{"observed_at":"2026-08-05T22:40:42.238510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21819","last_updated":"2025-06-21T08:39:06Z","snapshot_observed_at":"2026-08-14T13:23:53.106970Z","submitted_at":"2024-10-29T07:42:18Z","title":"Self-Preference Bias in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21819","snapshot_observed_at":"2026-08-05T22:40:42.241622Z","title":"Self-preference bias in llm-as-a-judge.arXiv preprint arXiv:2410.21819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.241622Z"},"links":{"cited_paper":"/paper/2410.21819","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:14c501f2e551ab1f9e298eabeb0b4bff29608f5ccd579ef289c66e3ad3b1ee35","observation_id":"23a61c37-6754-4582-a38a-e0cfe8c79dc5","resolution":{"observed_at":"2026-08-05T22:40:42.241622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-21T19:39:41.738597Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-05T22:40:42.244943Z","title":"Justice or prejudice? quantifying biases in llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.244943Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:5d7d916e92b534d338d7f0d8e6ed878c58533a7ebbba0de43ea19e5a4c58e1c3","observation_id":"ded1c9c0-b922-4ee7-9e19-60ac1bc9e2e8","resolution":{"observed_at":"2026-08-05T22:40:42.244943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.706186Z","title":"Flask: Fine-grained language model evaluation based on alignment skill sets","venue":null,"work_id":"75bf64f9-b105-4726-8990-d9ae8bc359b0","year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.248098Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:2391cdc01c5a4ef671f389438a685fbcee120c6d74150e5264d22ebc71e4dced","observation_id":"2f1438ae-0efa-44de-8946-1d2b2771abce","resolution":{"observed_at":"2026-08-05T22:40:42.709377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.695852Z","title":"Xinshu Zhao, Jun S Liu, and Ke Deng","venue":null,"work_id":"0ac2e149-e1b5-47c0-833b-5bde4b88f363","year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.251116Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:c7fa54ac64652cf61e9242dc46e6d99f5b0b21d00bf90d86b64ef9d8b67336b5","observation_id":"7188a20f-7ba9-4b83-a725-03a6511ec3b7","resolution":{"observed_at":"2026-08-05T22:40:42.699227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.684308Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":"bcd7b3fc-0848-4a70-ae31-1cec7db04c8b","year":2010},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.254049Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:e9d1d141766f469333eb0ce68bdaac453c3a2deb433f66c4ed28de08445203e3","observation_id":"10b75555-d439-4d6a-9fe1-0ac2f57c1d34","resolution":{"observed_at":"2026-08-05T22:40:42.688089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.674182Z","title":"The process is analogous for the cofficient corresponding to family-bias","venue":null,"work_id":"133947d7-4e90-4928-8866-684c17dcff40","year":2013},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.257200Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:cdb55d8e2d4300e310eefddaeaa9bcee0b184b7041706f32daac96361ed802fb","observation_id":"5a724327-e137-4881-b5dc-d7b1a3c182c3","resolution":{"observed_at":"2026-08-05T22:40:42.677417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.640665Z","title":"I can’t answer that","venue":null,"work_id":"fca8797e-b4c9-401b-ae55-7dd02e3844cc","year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.268550Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:25ff10d7c0399f95f223351c6039e0406eef29bbcf97cf17d6726955d067ba65","observation_id":"a70def62-4351-422d-bc71-53061a13babb","resolution":{"observed_at":"2026-08-05T22:40:42.644136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.651755Z","title":"Is a kilo of feathers heavier than a pound of steel? High One pound is equal to about 0.45 kilograms","venue":null,"work_id":"92b58b4a-2509-4454-82a8-f9ab31a531d3","year":1954},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":1954,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.264549Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:4451856d44881b3154dc327a7e86ee374eaf79b5993cd4cec544eb5af1d7c8ba","observation_id":"84428477-78ea-4224-8f46-26838fc00a99","resolution":{"observed_at":"2026-08-05T22:40:42.655650Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01724","last_updated":"2024-05-02T20:42:28Z","snapshot_observed_at":"2026-08-19T07:52:50.883828Z","submitted_at":"2024-05-02T20:42:28Z","title":"Large Language Models are Inconsistent and Biased Evaluators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01724","snapshot_observed_at":"2026-08-05T22:40:42.235193Z","title":"Large language models are inconsistent and biased evaluators.arXiv preprint arXiv:2405.01724 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":1961,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.235193Z"},"links":{"cited_paper":"/paper/2405.01724","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:4db5dbb82ac38cd351f2918b8aedf296f70cec8188d16c54eebdd5bbc0fb83f1","observation_id":"64a461cf-98cf-443b-b41e-7edf4afc2c4d","resolution":{"observed_at":"2026-08-05T22:40:42.235193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.725095Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"303d0498-3f63-445e-82a2-28f403ef35e3","year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.225788Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:2770fbc907ceb8b3cc4e8e7309bfb44bfcc6f6d18f1c7e1c79a0841c63a493ba","observation_id":"da65f48b-4185-416e-9a57-3c7624b8339d","resolution":{"observed_at":"2026-08-05T22:40:42.728370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09766","last_updated":"2024-06-07T09:41:36Z","snapshot_observed_at":"2026-08-19T20:17:31.835947Z","submitted_at":"2023-11-16T10:43:26Z","title":"LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09766","snapshot_observed_at":"2026-08-05T22:40:42.215645Z","title":"G-eval: Nlg evaluation using gpt-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.215645Z"},"links":{"cited_paper":"/paper/2311.09766","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:e29320630aee2dd4867d1a1dc5ab4ca945211105201cef07cf1af800ae468ebe","observation_id":"577d1d4b-13f4-41ea-839a-c6fcf9d46fab","resolution":{"observed_at":"2026-08-05T22:40:42.215645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02554","last_updated":"2023-04-05T16:17:32Z","snapshot_observed_at":"2026-08-21T13:03:28.868823Z","submitted_at":"2023-04-05T16:17:32Z","title":"Human-like Summarization Evaluation with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02554","snapshot_observed_at":"2026-08-05T22:40:42.192331Z","title":"Human-like summarization evaluation with chatgpt.arXiv preprint arXiv:2304.02554 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.192331Z"},"links":{"cited_paper":"/paper/2304.02554","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:298c11a5fab67678bd962b8bf3548a45582b77286c9050f65b53098d44b8c3dd","observation_id":"4fe04d12-60a9-4794-9cab-1de6c3c9ada0","resolution":{"observed_at":"2026-08-05T22:40:42.192331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.764046Z","title":"Humans or llms as the judge? a study on judgement bias","venue":null,"work_id":"5414caab-448e-41ed-8344-4a181ad4169b","year":2024},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.179101Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:70d73095cb029a5d04b8b2999af0194ab991c832e43efe11f0d997140a1fb0d5","observation_id":"22c9e1f1-eb39-4906-9929-36e5c2ac3a30","resolution":{"observed_at":"2026-08-05T22:40:42.767499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.734762Z","title":"Don’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization","venue":null,"work_id":"2380b090-cecb-4b91-9a5d-27c4b9aff689","year":2018},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.219077Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:1ca771c79e684df89a30cb3b978bbb08bc67cbf7ac8f78251a844570a149a108","observation_id":"d4195fdc-f149-4b09-89d7-31c553cb2f5e","resolution":{"observed_at":"2026-08-05T22:40:42.738042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T22:40:42.199401Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.199401Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:fcf15b8f9b9520f0eba16d34d0aaeebafac2a9131284469e346e841ef700cae8","observation_id":"2aeeb816-893c-4fac-8cc4-e76b61eb1cc5","resolution":{"observed_at":"2026-08-05T22:40:42.199401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.212669Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge.arXiv preprint arXiv:2411.16594 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.212669Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:b8217f4a219aae6d3f6aecdbfad974e655b0f81f948784568d6950df00ece3d8","observation_id":"b2fae387-ae36-4008-a55c-739559387891","resolution":{"observed_at":"2026-08-05T22:40:42.212669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.745401Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"27ad0ec5-8316-45b0-b101-d37bd1d676bd","year":2019},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.185900Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:d4419d74211d1e019164d1cfea097a55beaf276946b5de749ef193ee9189f2dc","observation_id":"00710c5d-cf5b-463a-9f96-5f0870253672","resolution":{"observed_at":"2026-08-05T22:40:42.748605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.754727Z","title":"On the limitations of reference-free evaluations of generated text","venue":null,"work_id":"d1129152-31cb-495c-b278-b662cd4016ec","year":2022},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.182557Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:7a74c17e17cfb2eab4bb398b74adc65ee496fa38a0369dec520cc114abe899a0","observation_id":"6c1254a0-3741-456b-9fc6-88a9b72fea00","resolution":{"observed_at":"2026-08-05T22:40:42.758062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:40:42.171599Z","title":"Reference-guided verdict: Llms-as-judges in automatic evaluation of free-form text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.171599Z"},"links":{"citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:817e19205cef67f19159ea4dadaece08c5aed073fbe7d7e1ea32d48449e4afe4","observation_id":"7463a7b1-ae58-4734-b22f-a94445ebee8d","resolution":{"observed_at":"2026-08-05T22:40:42.171599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 17 inbound Pith citation observations for arXiv:2508.06709."}