{"as_of":"2026-08-17T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f714044f4e75d7e57e1c7116b763c21b77c0a799150a6f9ed337b33dc026867f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:24:54.518422Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-12T11:59:18.413886Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: explainable metrics and diverse prompt templates,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17793","last_updated":"2024-11-26T17:43:32Z","snapshot_observed_at":"2026-08-15T22:06:40.141239Z","submitted_at":"2024-11-26T17:43:32Z","title":"Engineering AI Judge Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:59:18.413886Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2411.17793"},"observation_digest":"sha256:b0645acdf2a3d452cb704d1c46d80034139f2602b4b924a1170ed8fc5da11dbb","observation_id":"02d0b65c-f5f1-4087-b51f-22bad0f786a2","resolution":{"observed_at":"2026-08-12T11:59:18.413886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-12T11:15:45.007500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18444","last_updated":"2024-11-27T15:35:32Z","snapshot_observed_at":"2026-08-15T01:23:17.995892Z","submitted_at":"2024-11-27T15:35:32Z","title":"Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T11:15:45.007500Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2411.18444"},"observation_digest":"sha256:a567e5d4bbbfecdb0664650ee578b26acec7624ac0634cbe3aba8088adea14c3","observation_id":"93aad358-4b48-40d0-b804-ff1f51b37eb0","resolution":{"observed_at":"2026-08-12T11:15:45.007500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-11T16:59:49.630019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09569","last_updated":"2025-06-10T17:54:35Z","snapshot_observed_at":"2026-08-15T05:44:23.549539Z","submitted_at":"2024-12-12T18:51:13Z","title":"JuStRank: Benchmarking LLM Judges for System Ranking","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:59:49.630019Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2412.09569"},"observation_digest":"sha256:5134d0cb3b7ae05232af99414960e878e408e83eb32536ed4737dc528efaebf0","observation_id":"03aa5361-1225-4f49-870b-270152bb2229","resolution":{"observed_at":"2026-08-11T16:59:49.630019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-11T14:04:26.401714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12509","last_updated":"2025-02-18T15:24:25Z","snapshot_observed_at":"2026-08-16T21:16:12.321849Z","submitted_at":"2024-12-17T03:37:31Z","title":"Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T14:04:26.401714Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2412.12509"},"observation_digest":"sha256:7cfa1e4763036d6e673f66663a06f00f621d72419b6ee4ba828bde8d15ff6716","observation_id":"717fec84-1dc1-4046-a27b-d65922246322","resolution":{"observed_at":"2026-08-11T14:04:26.401714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-09T19:10:53.900627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00409","last_updated":"2025-07-21T12:20:06Z","snapshot_observed_at":"2026-08-10T00:34:58.507365Z","submitted_at":"2025-02-01T12:08:38Z","title":"Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems","version":3},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-09T19:10:53.900627Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2502.00409"},"observation_digest":"sha256:dddab6de6dd4302915ba020170a61ec67a3b0f354a0f7f81265ce34fa985b9a7","observation_id":"64df046f-feb9-42f9-8849-fabc483a1f95","resolution":{"observed_at":"2026-08-09T19:10:53.900627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-08T16:14:57.549944Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10441","last_updated":"2025-02-10T09:19:52Z","snapshot_observed_at":"2026-08-15T16:33:10.713147Z","submitted_at":"2025-02-10T09:19:52Z","title":"AI Alignment at Your Discretion","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-08T16:14:57.549944Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2502.10441"},"observation_digest":"sha256:7483169238281e409ae356ddf598b470e2e71771bea2fc835a3a23e49c5bda66","observation_id":"048f9501-3b4e-46a5-af7c-b65f2aed6af8","resolution":{"observed_at":"2026-08-08T16:14:57.549944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:f4a5ffd123acd76e49e59cfb9ed25640ff701eea1685a41ca315cbdf3a822718","observation_id":"c736d4fb-3f19-43d8-bef9-b167f1e36ba6","resolution":{"observed_at":"2026-05-11T13:02:44.404608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-16T12:24:54.518422Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12911","last_updated":"2025-04-19T04:07:54Z","snapshot_observed_at":"2026-08-16T12:26:24.726493Z","submitted_at":"2025-04-17T13:01:38Z","title":"Benchmarking Multi-National Value Alignment for Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T12:24:54.518422Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2504.12911"},"observation_digest":"sha256:071c50142ee4215bb2a1850eb31f184ad3b8184b31947be5f756ed39425c6d85","observation_id":"f589180a-ebc3-4b9c-bb6e-911a83749ed3","resolution":{"observed_at":"2026-08-16T12:24:54.518422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-16T11:38:28.503121Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15013","last_updated":"2025-04-21T10:35:48Z","snapshot_observed_at":"2026-08-17T01:56:37.536116Z","submitted_at":"2025-04-21T10:35:48Z","title":"Stay Hungry, Stay Foolish: On the Extended Reading Articles Generation with LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:38:28.503121Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2504.15013"},"observation_digest":"sha256:5d35d029019b80a2e2098985d420addc80bc946c315df85ae8667468e075a14c","observation_id":"ea756bce-79bd-4c0a-826f-358842298d06","resolution":{"observed_at":"2026-08-16T11:38:28.503121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-16T04:51:30.333086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00263","last_updated":"2025-05-01T03:07:30Z","snapshot_observed_at":"2026-08-16T04:44:18.581963Z","submitted_at":"2025-05-01T03:07:30Z","title":"EnronQA: Towards Personalized RAG over Private Documents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:30.333086Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2505.00263"},"observation_digest":"sha256:5d5f2c5f3b4c9c202efe38ceaddaf66d85dc73623db335632a674323e2f7e271","observation_id":"05e4fd5f-8b6c-4d20-b406-07454b960542","resolution":{"observed_at":"2026-08-16T04:51:30.333086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T15:05:25.799258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17149","last_updated":"2025-05-22T09:02:15Z","snapshot_observed_at":"2026-08-15T22:42:24.497363Z","submitted_at":"2025-05-22T09:02:15Z","title":"Large Language Models for Predictive Analysis: How Far Are They?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:05:25.799258Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2505.17149"},"observation_digest":"sha256:fa63c07d574cab24d508fcbea4352e03c51134669015281d02447adde1f98cb2","observation_id":"57ba14f9-bb84-44fb-b442-9d6f7946c53a","resolution":{"observed_at":"2026-08-07T15:05:25.799258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T11:32:31.693251Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates.arXiv preprint arXiv:2408.13006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-13T09:31:50.592140Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:31.693251Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:dc162af360874ec8b5bee11fd31d6328481f7f08847d2a67558c109096a4120a","observation_id":"b472d78c-92ea-4f16-8e06-1c1a56c278ee","resolution":{"observed_at":"2026-08-07T11:32:31.693251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T10:19:35.386305Z","title":"Systematic Evaluation of LLM -as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05748","last_updated":"2025-06-06T05:18:54Z","snapshot_observed_at":"2026-08-07T21:55:18.527116Z","submitted_at":"2025-06-06T05:18:54Z","title":"Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:35.386305Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.05748"},"observation_digest":"sha256:6e1000f1bb193bd3ec150a89624d4bcb6f1464e420656acead7f16a3fa70fafe","observation_id":"7c9c9731-28a4-45d0-914a-91332507933e","resolution":{"observed_at":"2026-08-07T10:19:35.386305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T04:34:08.584381Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10403","last_updated":"2025-06-12T06:53:22Z","snapshot_observed_at":"2026-08-12T23:48:00.159911Z","submitted_at":"2025-06-12T06:53:22Z","title":"Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:08.584381Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.10403"},"observation_digest":"sha256:e8902d1a143d0d5e3bfd6105bd4f89aaffd6c59e09424043d6d8dd397c0ddac6","observation_id":"ef315790-9b74-4f37-80c1-6a150431efaa","resolution":{"observed_at":"2026-08-07T04:34:08.584381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T00:31:36.601561Z","title":"Ziyou Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13639","last_updated":"2025-06-16T16:04:43Z","snapshot_observed_at":"2026-08-16T19:16:57.442306Z","submitted_at":"2025-06-16T16:04:43Z","title":"An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.601561Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.13639"},"observation_digest":"sha256:72d5366a752bbd3379ae2bbf585b08187f3a3634411378b9105a127091cbd75c","observation_id":"60835722-30b9-4029-95ec-185286065f5e","resolution":{"observed_at":"2026-08-07T00:31:36.601561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-15T19:15:21.934638Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-15T19:08:12.643716Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.934638Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:1172b56d79e5bcb3cc84b63e0655a5317d8e0e0cabd0bab2f7262e7d7544b690","observation_id":"f32569ca-49f8-4a11-bbe0-c12970b98b9b","resolution":{"observed_at":"2026-08-15T19:15:21.934638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-06T21:13:12.843092Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-16T15:41:59.095179Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.843092Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:19815e019513c6809b4136df5655c90097edd9a251700ef073852e17d65ddc16","observation_id":"da944267-1197-4876-a579-307bef239571","resolution":{"observed_at":"2026-08-06T21:13:12.843092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-06T19:12:05.596485Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-14T22:56:03.693923Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:05.596485Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:73bda4064868d9a95706fd57675c5567b2a313e09ae22b2daab2e8b55e9a010d","observation_id":"31fef8a8-1a7f-49d7-b3b8-a8bf0d604315","resolution":{"observed_at":"2026-08-06T19:12:05.596485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T22:34:14.617849Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06888","last_updated":"2025-08-09T08:35:40Z","snapshot_observed_at":"2026-08-14T17:18:25.671702Z","submitted_at":"2025-08-09T08:35:40Z","title":"Multi-Modal Requirements Data-based Acceptance Criteria Generation using LLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:14.617849Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2508.06888"},"observation_digest":"sha256:129139b5aff4a0b168500573a6243bc112f0cb92828aa87bd65ecf9ef02b596a","observation_id":"1dabb476-796a-40e7-a1a1-95629d87f9c2","resolution":{"observed_at":"2026-08-05T22:34:14.617849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T15:21:32.643649Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20186","last_updated":"2025-08-27T18:04:45Z","snapshot_observed_at":"2026-08-13T03:20:30.766116Z","submitted_at":"2025-08-27T18:04:45Z","title":"AI Propaganda factories with language models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:21:32.643649Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2508.20186"},"observation_digest":"sha256:2fd3752f4a983eda58a673e2d0bf142e4f014b3c9977f6d27b1b1769ee7718fb","observation_id":"dd0bb244-766b-40a7-bb26-8341a1390907","resolution":{"observed_at":"2026-08-05T15:21:32.643649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T11:26:27.543864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02855","last_updated":"2025-09-02T21:58:58Z","snapshot_observed_at":"2026-08-16T00:42:41.675172Z","submitted_at":"2025-09-02T21:58:58Z","title":"IDEAlign: Comparing Large Language Models to Human Experts in Open-ended Interpretive Annotations","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T11:26:27.543864Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2509.02855"},"observation_digest":"sha256:299d2c31a04683e17d51a05888c79b9e11e34b7165b2436f7c3be468b3959a65","observation_id":"7c465ca9-2c19-4f63-a87d-aee427466f19","resolution":{"observed_at":"2026-08-05T11:26:27.543864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-07-13T15:55:53.399860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-08-09T04:03:34Z","snapshot_observed_at":"2026-08-16T05:17:14.711870Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T15:55:53.399860Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:7025e62f792ae874f35f7686774cede6e04e63e474ccda81e957f45d3fdd62d4","observation_id":"aeb117fe-1c82-4dba-8867-5cee665d83b0","resolution":{"observed_at":"2026-07-13T15:55:53.399860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-02T17:09:18.168845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-08-09T04:03:34Z","snapshot_observed_at":"2026-08-16T05:17:14.711870Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T17:09:18.168845Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:2c0fc9e22cc3657e01d3acc17412675a3570b561344d07f7a7fc9ac77d8af68a","observation_id":"d49d3437-8437-407b-8c8d-2b048b58bf33","resolution":{"observed_at":"2026-08-02T17:09:18.168845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2604.05371","last_updated":"2026-04-07T03:16:44Z","snapshot_observed_at":"2026-07-06T22:54:08.897942Z","submitted_at":"2026-04-07T03:16:44Z","title":"LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:37:19.360378Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2604.05371"},"observation_digest":"sha256:3cd0aa6d016543c1aae1ece94f69c34f09aed4f723410e5fec33588033f60d70","observation_id":"d1d85efb-00b7-4abd-8b08-b003eaafd557","resolution":{"observed_at":"2026-05-10T22:45:48.017272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2605.01130","last_updated":"2026-05-01T22:01:31Z","snapshot_observed_at":"2026-08-11T14:06:58.954849Z","submitted_at":"2026-05-01T22:01:31Z","title":"Iterative Finetuning is Mostly Idempotent","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:04:36.210200Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2605.01130"},"observation_digest":"sha256:f8900e365cacaea89724e5b15f5c26642f369d75bc4a82576b3ab7fc7af09e5d","observation_id":"cfcb7436-1bf7-4185-b89a-df84914418af","resolution":{"observed_at":"2026-05-11T15:51:44.631356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2605.24636","last_updated":"2026-05-26T17:07:57Z","snapshot_observed_at":"2026-08-14T00:00:10.208597Z","submitted_at":"2026-05-23T15:53:44Z","title":"GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T13:38:51.424919Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2605.24636"},"observation_digest":"sha256:786a8704e8b002d66cf7b7788b6a74750899cc4829bd7ef8def6649d4b9a4c9d","observation_id":"f2209723-09be-42a7-9623-9f00e582529d","resolution":{"observed_at":"2026-06-30T13:44:40.790933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2606.07874","last_updated":"2026-06-05T22:11:26Z","snapshot_observed_at":"2026-08-02T07:02:54.289200Z","submitted_at":"2026-06-05T22:11:26Z","title":"Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:26.268337Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2606.07874"},"observation_digest":"sha256:2429e1c1ff8014feb1a4f73c61e7657e3d91aa4029ab6005b63a81d4f4d8698f","observation_id":"7133626b-ec70-40b2-b733-4667d82b46c1","resolution":{"observed_at":"2026-06-27T21:41:18.486232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-07-12T14:02:41.517301Z","title":"None identified","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.14948","last_updated":"2026-07-06T20:16:03Z","snapshot_observed_at":"2026-08-13T21:45:07.434756Z","submitted_at":"2026-06-12T20:46:04Z","title":"Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T14:02:41.517301Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2606.14948"},"observation_digest":"sha256:be08391c2b491815d1340119e099e5244c287c98b96a467c682b7b2081cb82c8","observation_id":"8ff3a2b6-4a2a-453b-8bed-405c8d29267d","resolution":{"observed_at":"2026-07-12T14:02:41.517301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.13006/citation-record","integrity":"/paper/2408.13006/integrity","json":"/paper/2408.13006/citation-record.json","paper":"/paper/2408.13006"},"outbound":[],"paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:24:21.810554Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2408.13006."}