{"as_of":"2026-08-16T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c84e8a6b91d2281713a063559e65af85fafae9d5401d97ceb7482c95db1c56ec","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:32:25.256651Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12808/citation-record","integrity":"/paper/2505.12808/integrity","json":"/paper/2505.12808/citation-record.json","paper":"/paper/2505.12808"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:32:24.988520Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:24.988520Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:99342146939e7c0492b3e58fdb5d798774bb33ab2b09356eb7bf3d5941408549","observation_id":"8fc25614-7b07-43a0-bbc7-f1662f1351b4","resolution":{"observed_at":"2026-08-15T20:32:24.988520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:32:24.994060Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:24.994060Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e6b2a7b9274792de4eaf65c13cd82ad3f39b7194614992bc75b52770e2a3156c","observation_id":"23b0208d-af0f-4de3-8ff7-e9507dc15591","resolution":{"observed_at":"2026-08-15T20:32:24.994060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T20:32:24.999687Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:24.999687Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e484d33790acf9de5d2e1d2472f5206098ee4d028b3ae570785842f36e103856","observation_id":"0fee0ad9-100f-42ca-a692-671d2671d18b","resolution":{"observed_at":"2026-08-15T20:32:24.999687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:32:25.005377Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.005377Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:827e98aa7eab1db955380a40d7daffad9094368b3e1ff8c3f207066f4d833243","observation_id":"26f4897c-4452-4277-bd1f-8225b80dbe0f","resolution":{"observed_at":"2026-08-15T20:32:25.005377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.011656Z","title":"Legalbench: A collaboratively built benchmark for measuring legal reasoning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.011656Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:3f6001b1a2d28a8388b13c40c516014f8650c0e5da42e0cc465c6fa141ae3ef0","observation_id":"114d6de0-8431-47d4-befd-6f1f0380c54f","resolution":{"observed_at":"2026-08-15T20:32:25.011656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05443","last_updated":"2023-06-08T14:20:29Z","snapshot_observed_at":"2026-08-16T15:25:28.218063Z","submitted_at":"2023-06-08T14:20:29Z","title":"PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05443","snapshot_observed_at":"2026-08-15T20:32:25.016672Z","title":"Pixiu: A large language model, instruction data and evaluation benchmark for finance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.016672Z"},"links":{"cited_paper":"/paper/2306.05443","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:444e0c3db475536867a9e4ec6618277ce23ff3fe9606841ee212f3792d8b3914","observation_id":"4cbe7aec-b82d-4d4f-ab35-85a34540fd7d","resolution":{"observed_at":"2026-08-15T20:32:25.016672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00498","last_updated":"2022-03-15T17:23:53Z","snapshot_observed_at":"2026-08-16T17:14:21.031207Z","submitted_at":"2022-03-15T17:23:53Z","title":"Evaluating the Text-to-SQL Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00498","snapshot_observed_at":"2026-08-15T20:32:25.022516Z","title":"Evaluating the text-to-sql capabilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.022516Z"},"links":{"cited_paper":"/paper/2204.00498","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:7bdb51117b93dafb5931535bb0c05034cf4c4beeece8a6d36e411c7fe1d797d3","observation_id":"dfbc6f0e-3fbb-4084-8c6d-6dbf54fc112a","resolution":{"observed_at":"2026-08-15T20:32:25.022516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-15T20:32:25.027531Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.027531Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:bd12eed1b3d69e115f0725b194592d69ec3ef710f3d6e83d793ce3c599b817a5","observation_id":"0102a29a-5669-411c-a7e0-604232a25b3d","resolution":{"observed_at":"2026-08-15T20:32:25.027531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.032353Z","title":"Large language models for software engineering: A systematic literature review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.032353Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ad2ee18b1673bd4545451c9e8cbd6f0d07572f00b2083e68f5bc03b50d396b3b","observation_id":"33f72cf9-a311-4e6c-bc89-3957b12c5ffa","resolution":{"observed_at":"2026-08-15T20:32:25.032353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-13T16:29:32.694746Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-15T20:32:25.037139Z","title":"Galactica: A large language model for science","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.037139Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:db0b4220b7f3aa26ff14bc2330238091be45e2f6023366f727f2d05dd3e28e56","observation_id":"be6708b2-b7b7-42cd-95c8-7bd2c4b0dfb7","resolution":{"observed_at":"2026-08-15T20:32:25.037139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.991092Z","title":"Large language models for automatic equation discovery of nonlinear dynamics","venue":null,"work_id":"da722e38-9b46-4c54-97dd-7bc9ecd6caa5","year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.042496Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ec2d7b89fd305319ae679e9516753998d59230d212f02878f3834f0c5a5df0ae","observation_id":"33b813c8-d48a-42d4-b5cf-555e8d17063c","resolution":{"observed_at":"2026-08-15T20:32:25.995962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.046926Z","title":"Large language models in medicine.Nature medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.046926Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:77a1750c3755f553b3cdcb06e71d4f620d656fbb86f572ebcd4124f26779d091","observation_id":"aea10b6d-7b96-4bf4-8077-f53d1b138dcd","resolution":{"observed_at":"2026-08-15T20:32:25.046926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T20:32:25.051364Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.051364Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:a48bde181709f1a85736c676762a22eb567ec4df8234e6d5cf89bed283edd4ac","observation_id":"c8296292-47de-4b7b-930e-bb2fc7ee466f","resolution":{"observed_at":"2026-08-15T20:32:25.051364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.967804Z","title":"this is a problem, don’t you agree?","venue":null,"work_id":"70e6ee47-a43f-4025-bafe-7200456b7be3","year":2020},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.057147Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:d5ed047fe155eb36f4c1188a8b409f0e48ff08579c6b7d6b11076168ad722c98","observation_id":"2c56887c-0935-4866-bb22-5c23604025f8","resolution":{"observed_at":"2026-08-15T20:32:25.972157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-15T20:32:25.062684Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.062684Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:fafdb3bf234fb8dd1d1cc03b2f1de867588cc6f2fbf6500aeff2985009f84846","observation_id":"8198f62d-f6d2-4acd-a723-81696cd35afe","resolution":{"observed_at":"2026-08-15T20:32:25.062684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.067456Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.067456Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:23cbe64fa64f8a3c43f3680960f2de79d5dc017a1471ba19157525ece7dd5061","observation_id":"412a9677-1131-4737-9c8f-8c592c1a8dbb","resolution":{"observed_at":"2026-08-15T20:32:25.067456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.072004Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.072004Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ce479dc9cc7cc7a838de73b9d310e79abc4528b35d027ebb44dfde28c4f85602","observation_id":"f024736d-a5b7-471d-9a75-9bf5e2e8e26a","resolution":{"observed_at":"2026-08-15T20:32:25.072004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.076932Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.076932Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ba780ed198da651ad4a10f701d4e507eeacf122f3a1f702e2bb9e599e8a08c86","observation_id":"596fa2c5-dc32-486c-97ea-27e55c12d33e","resolution":{"observed_at":"2026-08-15T20:32:25.076932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.925438Z","title":"The role of collective intelligence in crowdsourcing innovation","venue":null,"work_id":"aeb8abe7-0c92-4eec-9158-afaa6f84446c","year":2015},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.081753Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:d506c1f8a2608d0e22dfc4a7d852e5ca74be4af7e0a68f783476ab790f6160b6","observation_id":"3b068fae-a0eb-45f8-9018-9d1e8a1797d5","resolution":{"observed_at":"2026-08-15T20:32:25.930534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.910774Z","title":"The Wisdom of Crowds: Why the Many Are Smarter than the Few and How Collective Wisdom Shapes Business, Economies, Societies, and Nations","venue":null,"work_id":"0455e6b3-ca5b-409a-9d8a-0dd2636d421b","year":2004},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.086345Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e66bb253e83e10583177c835f35b7e67c4f123e2fc193ad3fb7564193c44bc14","observation_id":"d07ecbcf-428f-43e4-ab6c-e84fccb3d834","resolution":{"observed_at":"2026-08-15T20:32:25.915592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04313","last_updated":"2025-06-12T14:43:36Z","snapshot_observed_at":"2026-08-13T07:09:13.997727Z","submitted_at":"2025-02-06T18:56:01Z","title":"Great Models Think Alike and this Undermines AI Oversight","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04313","snapshot_observed_at":"2026-08-15T20:32:25.091216Z","title":"Great models think alike and this undermines ai oversight","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.091216Z"},"links":{"cited_paper":"/paper/2502.04313","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:9a75bccc87a34c2b5be8afbccadd60c3924e1e73a999171c635c6d203615430e","observation_id":"a773fd94-506c-45eb-8645-70fda3e6b5b4","resolution":{"observed_at":"2026-08-15T20:32:25.091216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02622","last_updated":"2019-09-26T09:56:23Z","snapshot_observed_at":"2026-08-14T04:42:40.981178Z","submitted_at":"2019-09-05T20:26:44Z","title":"MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02622","snapshot_observed_at":"2026-08-15T20:32:25.096264Z","title":"Mover- score: Text generation evaluating with contextualized embeddings and earth mover distance","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.096264Z"},"links":{"cited_paper":"/paper/1909.02622","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:c5f5d00bc3764333ebf15c0ca53628a9cba8c9a58c2f014faca9a61ff8ce483c","observation_id":"b0f9eb2f-fffc-4fc5-84b3-296ba4f99c57","resolution":{"observed_at":"2026-08-15T20:32:25.096264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T20:32:25.101473Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.101473Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:7ea49caab7294817386e4f86eaedd923eea34c09b7957d23b1666f684bea82a2","observation_id":"5e98473e-ef5f-4c12-860d-c77a831a3759","resolution":{"observed_at":"2026-08-15T20:32:25.101473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.895993Z","title":"Bartscore: Evaluating generated text as text generation","venue":null,"work_id":"b543625c-f183-4618-95ae-7b5f76f9741f","year":2021},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.106444Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:da03bca54148a72131455f771e3561f8966d65c7662d4da8cb20a39786da6aac","observation_id":"5b9b383d-ae84-4ae4-8ee2-4c2c25a3c1a0","resolution":{"observed_at":"2026-08-15T20:32:25.900680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.111289Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.111289Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:4f9cd90a0ffb3307c00438bc0348edf19c7729bcb81d30ac6e0195eac308e20a","observation_id":"6416c483-82ea-4d8d-aff4-4bb57ee811c5","resolution":{"observed_at":"2026-08-15T20:32:25.111289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.115818Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.115818Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:8575150f68efe636d8f8d2ea94890c54a738e7a4d04efe4ea82443bbb2d97e9e","observation_id":"2314fd09-95b4-4283-8400-a71eece06574","resolution":{"observed_at":"2026-08-15T20:32:25.115818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.863532Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":"89c028e9-08e3-428f-aab7-963d6d14c357","year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.121364Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:d21e08070570b55e8b30e95abebbe1e150b5edbfa87361987ce2b94d136cfecd","observation_id":"e8bfcef6-1833-46bd-9068-a9860b1f7ada","resolution":{"observed_at":"2026-08-15T20:32:25.867989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.126903Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.126903Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:8f942368c67d268c2da2f03112fea5b49743c17841d09df2a371ade04ea8484c","observation_id":"a062709f-9651-4ecc-8b22-0558fd042f98","resolution":{"observed_at":"2026-08-15T20:32:25.126903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-15T20:32:25.132474Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.132474Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:091f3d0300a63d968419d6b8d1209be84f68a630e9eb3c071006479f63d53900","observation_id":"fd3aa93c-eb57-49b0-b80a-9a1955847564","resolution":{"observed_at":"2026-08-15T20:32:25.132474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.138585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.138585Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:012099454630de6ec947a5a5986f107185e51cdf6ce42d5d8ea9f63cbd1ecb40","observation_id":"89656eb2-221c-4656-95c1-d3d9a81b79bf","resolution":{"observed_at":"2026-08-15T20:32:25.138585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.829388Z","title":"Rethinking pragmatics in large language models: Towards open-ended evaluation and preference tuning","venue":null,"work_id":"a2832bb3-9361-4ffb-b60c-58913d01bec2","year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.143825Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:872c6d2b8f77d1f2227b4da5ac57332694f9a8b90ffed23a77bf1765ffc2c524","observation_id":"ef719b63-329c-478e-8cf2-b24ecacce57d","resolution":{"observed_at":"2026-08-15T20:32:25.834297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.814913Z","title":"NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark","venue":null,"work_id":"7a0f8b78-d82c-45fb-bf52-73023d89e77c","year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.148461Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:d399c60b178a48c24ea15ff37a5e77e56d317b89de8d2e3e542bfaef3bb7c48a","observation_id":"71a8ac0a-de32-42cc-b92b-9244bb780efa","resolution":{"observed_at":"2026-08-15T20:32:25.819719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-15T20:32:25.153102Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.153102Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e5b568397c0df1e8d667355c78fb9ab7360e09738ec814655d4deb3823f8f990","observation_id":"481cbd25-884f-475e-b9dc-9d7891821f05","resolution":{"observed_at":"2026-08-15T20:32:25.153102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-15T20:32:25.158010Z","title":"Prometheus 2: An open source lan- guage model specialized in evaluating other language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.158010Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:1b775bbeffaba3be262c23401d1506c3890525b7ecf36e51c529964810995b79","observation_id":"ff496347-eb8e-41e4-b2b0-c892c5a0654b","resolution":{"observed_at":"2026-08-15T20:32:25.158010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.799779Z","title":"Verbosity bias in preference labeling by large language models","venue":null,"work_id":"c3431b0f-6b60-49f8-9040-271832955015","year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.163164Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:8ab331ad35748bec7dca4adf018007df13fc9fc96b95ac746b82b84c8519a427","observation_id":"a4ae1978-d969-42d5-bda5-64247e092be0","resolution":{"observed_at":"2026-08-15T20:32:25.804847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02762","last_updated":"2024-12-31T06:54:19Z","snapshot_observed_at":"2026-08-16T15:18:21.421288Z","submitted_at":"2023-07-06T04:05:44Z","title":"PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02762","snapshot_observed_at":"2026-08-15T20:32:25.167955Z","title":"Prd: Peer rank and discussion improve large language model based evaluations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.167955Z"},"links":{"cited_paper":"/paper/2307.02762","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:270fa7df7f390ad59fddc3dd871ee65efe5f2227a97d21ad888e6530caa629a2","observation_id":"a785a6d9-48f9-42ab-b81e-d2a55ad74bd1","resolution":{"observed_at":"2026-08-15T20:32:25.167955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20267","last_updated":"2024-10-07T02:53:44Z","snapshot_observed_at":"2026-08-16T13:47:39.758900Z","submitted_at":"2024-05-30T17:19:19Z","title":"Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20267","snapshot_observed_at":"2026-08-15T20:32:25.173072Z","title":"Auto arena of llms: Automating llm evaluations with agent peer-battles and committee discussions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.173072Z"},"links":{"cited_paper":"/paper/2405.20267","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ebc873927fcc6634d1e3eb31fa2752550e168d67f087b644ce9855b408b66b77","observation_id":"d778eae1-1c53-4f0d-8b73-9d6c5d8cf3aa","resolution":{"observed_at":"2026-08-15T20:32:25.173072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.783623Z","title":"A bayesian approach towards crowdsourcing the truths from llms","venue":null,"work_id":"06eb1b2c-8dcf-4b42-932b-5a47f68d0790","year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.177851Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e26b2bfdd86488df4a1e7164f965ba38276e25ad38ab96412fac8bebad3947b8","observation_id":"505c3919-5fee-4e00-88e1-cd116667de92","resolution":{"observed_at":"2026-08-15T20:32:25.788323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.769293Z","title":"A multiagent approach for collective decision making in knowledge management","venue":null,"work_id":"669da37c-0424-4f95-9407-cf1d74bef5e6","year":2011},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.182847Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:ccd32867165d006e1f71746b9f852ca24439489eadeb3a7a9647297a8640c240","observation_id":"6d3293d0-6dce-4158-8312-1edcc1736672","resolution":{"observed_at":"2026-08-15T20:32:25.773908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.755173Z","title":"Swarm intelligence: A review of algorithms","venue":null,"work_id":"28abd612-5135-4622-ac2f-c70c6cc652d4","year":2017},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.187420Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:da5afd90c1632e86683255719dff7464cca68bf216561bd794b39cd686eb8ed4","observation_id":"c24b0dab-4135-4031-9fa6-7013030cbef2","resolution":{"observed_at":"2026-08-15T20:32:25.759718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.740466Z","title":"Swarm creativity: Competitive advantage through collaborative innovation networks","venue":null,"work_id":"3ca9c50a-8c03-4608-9727-62315d60b473","year":2006},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.192162Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:637d6c13890a049cbf7e6bcb902589b6a40f085eb5da5e2661621ab1c9296d02","observation_id":"07df0506-c6d7-4a3c-a262-c7128ca837c0","resolution":{"observed_at":"2026-08-15T20:32:25.745076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.725894Z","title":"Binary search algorithm","venue":null,"work_id":"0bd744c5-9bb3-41fb-949b-a4815bb8e168","year":2019},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.196739Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:c01d1287d5f57214a92752ec1b98ca737ebe1a424752f99d3402d52db6ba2d9b","observation_id":"c8468396-33e5-470b-86de-fe59d20a2917","resolution":{"observed_at":"2026-08-15T20:32:25.730422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.201472Z","title":"The proposed uscf rating system, its development, theory, and applications","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.201472Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:4f94823fdfd47bfb901afd4c1b83e5a84c9a20f3bc841ca5b387fa6c7f2c0b53","observation_id":"721d1c75-8523-4a0e-a868-eb37fad72ceb","resolution":{"observed_at":"2026-08-15T20:32:25.201472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.206369Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.206369Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:cfcb359b89b0f472559899f38ff796922bcb7f617ac9ef6cc890c89bc5299e44","observation_id":"6e780c37-4818-41de-8064-ef7a54fd1b3b","resolution":{"observed_at":"2026-08-15T20:32:25.206369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.211061Z","title":"Patil, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.211061Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:e0f6c38727cd747c8d29a92c43c1e1aba16a9476432fecdbbfd756baeb16260e","observation_id":"d86183e6-fb97-41a5-8fbd-836aa6f89cb2","resolution":{"observed_at":"2026-08-15T20:32:25.211061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T20:32:25.215708Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.215708Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:431cbfe97e00b15ff9c185d426cdec81c050de0c377833628d49d3d83e22ee2c","observation_id":"6694cabc-06d1-4ad7-a6bc-433369601a04","resolution":{"observed_at":"2026-08-15T20:32:25.215708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-15T20:32:25.220753Z","title":"Livebench: A challenging, contamination-free llm benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.220753Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:dea5cdd3ce0395ec5b6c4169420e217d4ccbb6ba6cf88bff824543e09488eee4","observation_id":"1629666e-bc3e-414d-8c1c-94c61d4366cd","resolution":{"observed_at":"2026-08-15T20:32:25.220753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06281","last_updated":"2024-01-03T12:20:35Z","snapshot_observed_at":"2026-08-16T14:35:56.165307Z","submitted_at":"2023-12-11T10:35:32Z","title":"EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06281","snapshot_observed_at":"2026-08-15T20:32:25.225734Z","title":"Eq-bench: An emotional intelligence benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.225734Z"},"links":{"cited_paper":"/paper/2312.06281","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:95cfd54b210262232bcf1f92ca1995a22926ac38ff0ac71b8fcfa52fb7e6966c","observation_id":"797968d4-e839-4d69-b486-843b1405cd9e","resolution":{"observed_at":"2026-08-15T20:32:25.225734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06565","last_updated":"2024-10-12T14:13:27Z","snapshot_observed_at":"2026-08-16T13:46:53.335278Z","submitted_at":"2024-06-03T05:47:05Z","title":"MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06565","snapshot_observed_at":"2026-08-15T20:32:25.231127Z","title":"Mixeval: Deriving wisdom of the crowd from llm benchmark mixtures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.231127Z"},"links":{"cited_paper":"/paper/2406.06565","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:c19d359423a7b316467662aa33ec45040cd04c620bd84c3f997f994440ec910f","observation_id":"5c168072-8d54-4881-b6d9-30118242fd5f","resolution":{"observed_at":"2026-08-15T20:32:25.231127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.236356Z","title":"Open llm leaderboard v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.236356Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:679ab78c7f8eef3d208201cadc1a04f5a0ef45db45f4ca508495b25cecb72a23","observation_id":"dad94738-cb5d-4c79-be22-4bff7999e8c2","resolution":{"observed_at":"2026-08-15T20:32:25.236356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-16T13:44:47.609069Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-15T20:32:25.241466Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models.arXiv preprint arXiv:2406.05761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.241466Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:2b1ded38e0ac673d9de892a2442fd41c5115eba970a39eca5b262c6111e2fdf9","observation_id":"67ce7fc7-be5d-400a-9375-59c2bb7de809","resolution":{"observed_at":"2026-08-15T20:32:25.241466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-16T13:45:13.487794Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-15T20:32:25.246442Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.246442Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:084885384f899357656f96dc2d828337c6559b51711e133f9b30dada7a2d4459","observation_id":"cd1baaa6-6e8f-4848-833b-e3bd189361dd","resolution":{"observed_at":"2026-08-15T20:32:25.246442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:32:25.671342Z","title":"Anchor points: Benchmarking models with much fewer examples","venue":null,"work_id":"add7b989-e62e-4555-98ae-d6475667a6a8","year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.252100Z"},"links":{"citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:22f4d7c75900038cbd704987d86bae239917c0e1b4c8b850ca8c8ebfd54680ea","observation_id":"7cdf3396-cfe5-47f9-a95a-d8892a89ec88","resolution":{"observed_at":"2026-08-15T20:32:25.677825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T20:32:25.256651Z","title":"authority","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.256651Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:4d9be0493e3a99231ca89c6a26d0112d35c56e295928af04b31a32e8333e019f","observation_id":"d3bc8c80-03b7-43dd-a777-3c84aadff164","resolution":{"observed_at":"2026-08-15T20:32:25.256651Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:23:52.978911Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.12808."}