{"as_of":"2026-08-11T21:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0482674712031e23318ba3094ba5c7c4a1675d6154d84272c0f850770f144e7c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:02:43.344256Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.17178/citation-record","integrity":"/paper/2501.17178/integrity","json":"/paper/2501.17178/citation-record.json","paper":"/paper/2501.17178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.126190Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.126190Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:64657de1694d266aaf8c55a8909ff2d13ea554485bd3eb14cd24e62905362804","observation_id":"65079401-af76-451a-9e28-8fc5522a6d18","resolution":{"observed_at":"2026-08-10T15:02:43.126190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T15:02:43.135167Z","title":"N., Li, T., Li, D., Zhang, H., Zhu, B., Jordan, M., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.135167Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:2249802fa291ebaf92d550678020a8985d0cac92675d3c392feb0a08182f63a0","observation_id":"183ee70d-39bc-4dff-b816-464fa854bc3a","resolution":{"observed_at":"2026-08-10T15:02:43.135167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-10T15:02:43.141457Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.141457Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:feb0b93efbd788fe09842b27f197ada063c48109efd30dc19c90e799437b8869","observation_id":"897fe0da-d751-42e4-ba76-d326a6433776","resolution":{"observed_at":"2026-08-10T15:02:43.141457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13439","last_updated":"2024-11-26T06:18:16Z","snapshot_observed_at":"2026-07-06T18:33:37.328813Z","submitted_at":"2024-06-19T10:59:48Z","title":"Finding Blind Spots in Evaluator LLMs with Interpretable Checklists","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13439","snapshot_observed_at":"2026-08-10T15:02:43.147194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.147194Z"},"links":{"cited_paper":"/paper/2406.13439","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:a32eaea6f7c06a1e61c9cff45eef4538dc99cf2aa53596bfaa3d1ca82f829a55","observation_id":"a0e01cf3-5634-4125-9be2-74bf851d986f","resolution":{"observed_at":"2026-08-10T15:02:43.147194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-10T15:02:43.152437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.152437Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:4d0cb3ddb9f3ed10ca4debf949569f34fab267b759b00584a6e2016982e57282","observation_id":"0b3d30b0-21f4-4af7-a3c6-c27c336aea3a","resolution":{"observed_at":"2026-08-10T15:02:43.152437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.157860Z","title":"From general LLM to translation: How we dramatically improve translation quality using human evaluation data for LLM finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.157860Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:5f65a887cfea0d29de9aedfa76f2ea72f883ec96ebfbd1410c883e76e560e19f","observation_id":"263757ef-a977-46e0-b7e0-e215def5fd5b","resolution":{"observed_at":"2026-08-10T15:02:43.157860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.950799Z","title":null,"venue":null,"work_id":"1bd220a9-bb2b-4dcc-9fe2-a3f1b1e5e91d","year":2018},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.163347Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:424e70689f1af69c969841effbccd047eb8f5a81a8712d9e9b0f7b7d828b32bf","observation_id":"7e31defa-5c81-4c03-9801-c0ad9a2e5c8f","resolution":{"observed_at":"2026-08-10T15:02:43.955862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16797","snapshot_observed_at":"2026-08-10T15:02:43.177549Z","title":"Promptbreeder: Self-referential self-improvement via prompt evolution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.177549Z"},"links":{"cited_paper":"/paper/2309.16797","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:452b34d51fdfb20dd178d787e15a99f40b3da9b15aa6589a48c11fd2beec0705","observation_id":"1d22ed4d-dcb4-4b55-8273-7c8f6bfd21f7","resolution":{"observed_at":"2026-08-10T15:02:43.177549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T15:02:43.182676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.182676Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:f0295e5ff3800ce854e16bc5a7999f8a14cc5339f26e56d1f7a23841bec230d4","observation_id":"474d9235-48cf-4b3e-bf98-cccbc29909cf","resolution":{"observed_at":"2026-08-10T15:02:43.182676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10541","last_updated":"2024-11-15T19:26:38Z","snapshot_observed_at":"2026-08-09T14:08:30.550913Z","submitted_at":"2024-11-15T19:26:38Z","title":"Does Prompt Formatting Have Any Impact on LLM Performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10541","snapshot_observed_at":"2026-08-10T15:02:43.191164Z","title":"X., and Hasan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.191164Z"},"links":{"cited_paper":"/paper/2411.10541","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:9764d6b92aada417852c8061a3513f733001f3d82d91b7bceea9ecb1916660a2","observation_id":"f62d0ab9-a5fa-44a5-94af-b064f3d14fb8","resolution":{"observed_at":"2026-08-10T15:02:43.191164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-08-11T15:59:36.948242Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-10T15:02:43.196827Z","title":"On the limitations of fine-tuned judge models for llm evaluation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.196827Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:61e6bbdd36c4d82b4e6cee7835723f78014c5dd13da93cc07c14a2f4859f9a7d","observation_id":"6ddaebaf-ba4a-4199-a5ec-917255b161ed","resolution":{"observed_at":"2026-08-10T15:02:43.196827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.935147Z","title":"Bag of baselines for multi-objective joint neural architecture search and hyperparameter optimization","venue":null,"work_id":"23b43547-de55-4ba2-a16d-65adb267d401","year":2021},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.202521Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:406124c9920d5fba7a6920b9b42fd5409386171944102d9ddfa95d156eb98c4d","observation_id":"4678c2c8-d8f3-4f49-be03-d3b2c4acf58d","resolution":{"observed_at":"2026-08-10T15:02:43.940346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.918271Z","title":"Almost optimal exploration in multi-armed bandits","venue":null,"work_id":"af1a4bc2-4086-442b-90bb-106ad49e9cd7","year":2013},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.209724Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:cbb3953355c449a28f0704fb428dcab490b8b6d612d8c8602d85cd42207f9c11","observation_id":"5a91289d-172c-4664-ac42-2b1f64d76a98","resolution":{"observed_at":"2026-08-10T15:02:43.923053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T15:02:43.216786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.216786Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:51725797a73e4d6fc9eafae8181e51b251f620a08916e6f016b7a594431c8393","observation_id":"913c0f86-f6c8-4513-b647-2dad7fa3c3c5","resolution":{"observed_at":"2026-08-10T15:02:43.216786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-10T15:02:43.230563Z","title":"E., and Stoica, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.230563Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:8053349bf352b1de10406bf9268ba84a8d97615861b39bdd8f015e46367cdcc5","observation_id":"aabda245-64de-4670-94e0-ffa245e30dc4","resolution":{"observed_at":"2026-08-10T15:02:43.230563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.902405Z","title":null,"venue":null,"work_id":"d5e0f4a6-c15a-448a-a448-10d9410212a2","year":2023},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.238897Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:4f5b291a3c2b30e01989ff552c3c185c98096e5f217b7c8ca91d3f354e16fb24","observation_id":"5107405a-2842-45b6-bf1a-7cca8549f606","resolution":{"observed_at":"2026-08-10T15:02:43.907606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.882559Z","title":"E., Stoica, I., Mooney, P., Dane, S., Howard, A., and Keating, N","venue":null,"work_id":"0313da8e-30a2-4534-a6d1-1d941e92445e","year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.247605Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:cf01b6e7749b6ce09b4d2a5b1b00117207c8e3c091e7bea5873eaa2506b3f5b1","observation_id":"4fcab8b6-7dad-45fd-9808-56dd4d009178","resolution":{"observed_at":"2026-08-10T15:02:43.890384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.863493Z","title":"Aligning with human judgement: The role of pairwise preference in large language model evaluators","venue":null,"work_id":"53b717c7-c93d-4480-a05c-15bcf2e3fb87","year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.258842Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:d9b6b18b41b8d0522eef57ba81fef5569ac575982e3f66e58b4b17c2316d1059","observation_id":"3eb3c3e8-cabe-495c-a774-8c1a07889219","resolution":{"observed_at":"2026-08-10T15:02:43.869102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.844213Z","title":null,"venue":null,"work_id":"f1ac56c7-dd48-41f6-aab3-5d76996383bf","year":2023},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.263443Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:5973fcbd66f4c45b26d84aee95f0ee4342857e6458fc56f86f1a0cd83d7bf699","observation_id":"e34c35c1-5b09-4ace-8d71-ca3ab9e5db8d","resolution":{"observed_at":"2026-08-10T15:02:43.849295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06565","last_updated":"2024-10-12T14:13:27Z","snapshot_observed_at":"2026-08-10T12:43:32.729350Z","submitted_at":"2024-06-03T05:47:05Z","title":"MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06565","snapshot_observed_at":"2026-08-10T15:02:43.268780Z","title":"Mixeval: Deriving wisdom of the crowd from llm benchmark mixtures, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.268780Z"},"links":{"cited_paper":"/paper/2406.06565","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:6130fcc65e367c09a37d814e3207a302dcfd6b83d8fc2eab950094829ce38ef7","observation_id":"ff803e47-8d9f-4f93-840e-4dd68681c9d5","resolution":{"observed_at":"2026-08-10T15:02:43.268780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-11T08:26:18.478575Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-10T15:02:43.274806Z","title":"R., and Feng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.274806Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:5615c7392fe643a6787dba1e665539cded2ea868f10f97215ca29de203541416","observation_id":"0f1a9170-4b93-41c0-9fd0-fa6ecc3be8dd","resolution":{"observed_at":"2026-08-10T15:02:43.274806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05680","last_updated":"2021-06-10T11:52:55Z","snapshot_observed_at":"2026-08-05T05:50:38.185301Z","submitted_at":"2021-06-10T11:52:55Z","title":"A multi-objective perspective on jointly tuning hardware and hyperparameters","version":1},"cited_work":{"arxiv_id":"2106.05680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.05680","snapshot_observed_at":"2026-08-10T15:02:43.482353Z","title":"A multi-objective perspective on jointly tuning hardware and hyperparameters","venue":"cs.LG","work_id":"1b925916-365e-45c2-bd42-2d8c94e7372b","year":2021},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.284693Z"},"links":{"cited_paper":"/paper/2106.05680","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:9ecde996626962324f4a53a690ec902c9ecdb68294e5d6f351d18505c1f19b29","observation_id":"a314ee06-a6a7-460e-b319-dded7a73726d","resolution":{"observed_at":"2026-08-10T15:02:43.491145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12639","last_updated":"2021-06-23T19:39:31Z","snapshot_observed_at":"2026-07-06T11:22:19.116944Z","submitted_at":"2021-06-23T19:39:31Z","title":"Multi-objective Asynchronous Successive Halving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12639","snapshot_observed_at":"2026-08-10T15:02:43.291444Z","title":"B., Salinas, D., and Archambeau, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.291444Z"},"links":{"cited_paper":"/paper/2106.12639","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:47e109c436f3f5aceb046f218b56a9d987a65adb527a72133311938d7efc0a2f","observation_id":"134b22ef-4814-468d-8518-f211b8e9749b","resolution":{"observed_at":"2026-08-10T15:02:43.291444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.820069Z","title":"Efficient prompt optimization through the lens of best arm identification","venue":null,"work_id":"abba11c0-4a9c-422b-9023-81052e41e9b6","year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.297699Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:eb5eba25eefc493603c472ed79105011f60d0b164fd99acaad04f57c719b2bbb","observation_id":"89c57b62-b27b-49b1-b300-cbfcf43901f7","resolution":{"observed_at":"2026-08-10T15:02:43.826367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.792148Z","title":"Fine-tuning and prompt optimization: Two great steps that work better together","venue":null,"work_id":"80e82f5e-fb48-40d4-8ae9-3532e45dad09","year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.305459Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:858e59334e8033d13c66dbdb1e617bb967134a45e13c3227e6a03e61552d7482","observation_id":"8af58ca6-d7ef-42f4-ab0b-478c1f0e391e","resolution":{"observed_at":"2026-08-10T15:02:43.801370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.760030Z","title":"Panda LM : An automatic evaluation benchmark for LLM instruction tuning optimization","venue":null,"work_id":"3b9264c2-5c5f-4602-91dc-f7e171802623","year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.310841Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:eaa4f16fb3248f56f7e7b1036fd567878eec4c1293c92b5b0b581095e78768c3","observation_id":"35c2ea36-9ad8-41a0-bd50-685b1ab775fd","resolution":{"observed_at":"2026-08-10T15:02:43.770207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-10T15:02:43.317107Z","title":"H., Le, Q., and Zhou, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.317107Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:ec74219cedc8b2a22de3eecf80d3088452e95230426f78bd71607b08b054744b","observation_id":"cc38d7dc-6883-4f06-af7d-415f3f877f7b","resolution":{"observed_at":"2026-08-10T15:02:43.317107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.323365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.323365Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:9a4c6d40e94b02346a2a47fdd22e0f61e8286866224c1973561944ed6715aba7","observation_id":"e378df08-18d0-4050-9482-ca4aa00243ba","resolution":{"observed_at":"2026-08-10T15:02:43.323365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:02:43.332839Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.332839Z"},"links":{"citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:9f809cc62e943411144b069f1c72d6434433de06259da46d0e331ba377e0c0ac","observation_id":"d3439735-3525-4b8c-946d-5614fe46b33c","resolution":{"observed_at":"2026-08-10T15:02:43.332839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11370","last_updated":"2024-10-12T23:47:11Z","snapshot_observed_at":"2026-08-11T04:51:09.869730Z","submitted_at":"2024-06-17T09:48:53Z","title":"Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11370","snapshot_observed_at":"2026-08-10T15:02:43.338988Z","title":"Fairer preferences elicit improved human-aligned large language model judgments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.338988Z"},"links":{"cited_paper":"/paper/2406.11370","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:e6010085879ad8ea31e8b2b71580f65f302d72308bbb80867ec06ed939e53ca6","observation_id":"1032083e-4b32-49cc-894e-fc61a3d3e160","resolution":{"observed_at":"2026-08-10T15:02:43.338988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-06T12:42:08.815092Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-10T15:02:43.344256Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.344256Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:d329c70fb858a0dd0f2705ddfe9ccd4611686ee61b277e6b06c0feedfce4aeb1","observation_id":"4d31f7b3-89de-47ca-9839-e8f9055ad91a","resolution":{"observed_at":"2026-08-10T15:02:43.344256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T16:14:50.539673Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2501.17178."}