{"as_of":"2026-08-08T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e9f146087f561ecb066ddf3b80c10f531edd64e015cf8ccdffddcd630b7c9a2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:53:28.643250Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T23:32:17.279836Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2404.18796"},"observation_digest":"sha256:35ce833aa0144cd383ff4007f059fa178912e41ac13907d0ad74fb999c7fbdad","observation_id":"440556cc-00a4-4867-a40e-587797f21bc3","resolution":{"observed_at":"2026-05-15T23:32:17.998336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":2},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-16T18:44:49.519995Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2405.14782"},"observation_digest":"sha256:dc5fdd0431a184a0d3979f3bc25cfe8fa15c354ecddf4dc5d844ec49ec60384d","observation_id":"619b6d6e-f015-48cd-ab29-8af910c92656","resolution":{"observed_at":"2026-05-16T18:44:49.795483Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T23:10:40.420241Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2406.04244"},"observation_digest":"sha256:e71d0ebc3a11af62e6ef52ecbc527112081a3255073359a0f7affc8fbf6b7618","observation_id":"8fba2e7e-e1bc-4ebc-b016-358942c9def7","resolution":{"observed_at":"2026-05-22T23:10:40.974779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T13:17:39.444002Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2407.21772"},"observation_digest":"sha256:1c949a41ec9053a49b6f14b0382aeffa9a68f95838450c2b57739b67d9c784cf","observation_id":"6ca8af0d-7ab7-4a8b-97ac-91e9263a8cb8","resolution":{"observed_at":"2026-05-20T13:17:39.501674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:275d170ddfa7a8233ef9520eb01e9f636ed561ecd3d7f17ae9e02cdcc3801eb2","observation_id":"6b368de2-740e-4e4d-86c4-5ba9d9cdd820","resolution":{"observed_at":"2026-05-23T17:35:43.845001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:5c0b4efa0df778e0838b7cd7286e682a72ff3d057028a46798c1639aeeeed4e2","observation_id":"33615456-3847-4488-b199-59963e60b2e0","resolution":{"observed_at":"2026-05-11T23:08:36.802863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-08T14:53:28.643250Z","title":"An empirical study of llm-as-a-judge for llm evaluation: Fine-tuned judge models are task- specific classifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06633","last_updated":"2025-02-10T16:29:12Z","snapshot_observed_at":"2026-08-08T14:49:08.354414Z","submitted_at":"2025-02-10T16:29:12Z","title":"Combining Large Language Models with Static Analyzers for Code Review Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:53:28.643250Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2502.06633"},"observation_digest":"sha256:19e5b7977c3ecf525f499ea548fea5ec8ec965e2a81fba058603cb7d89964e2e","observation_id":"9b67cbc0-95b8-43ef-86fd-5d34564de8ec","resolution":{"observed_at":"2026-08-08T14:53:28.643250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-07T14:17:56.118892Z","title":"An empirical study of llm-as-a-judge for llm evaluation: Fine- tuned judge models are task-specific classifiers.arXiv preprint arXiv:2403.02839, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19433","last_updated":"2025-06-01T13:59:15Z","snapshot_observed_at":"2026-08-07T14:11:55.401752Z","submitted_at":"2025-05-26T02:49:07Z","title":"Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.118892Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2505.19433"},"observation_digest":"sha256:0950bd89969e2d485a0a0fc46cdc9628e23c91ce719cbcbeca97e4c607962824","observation_id":"eddbdcaf-db0e-4888-8247-92ef29f2589b","resolution":{"observed_at":"2026-08-07T14:17:56.118892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-07T04:06:32.364901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11604","last_updated":"2025-06-27T10:12:42Z","snapshot_observed_at":"2026-08-07T21:22:13.117618Z","submitted_at":"2025-06-13T09:20:41Z","title":"VLM@school -- Evaluation of AI image understanding on German middle school knowledge","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:06:32.364901Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2506.11604"},"observation_digest":"sha256:7959735a3afb8152d0db9de28ebc60846420e284a0144160c99598f59f786380","observation_id":"338cffb2-af94-4e6e-9237-ea82b87c11ee","resolution":{"observed_at":"2026-08-07T04:06:32.364901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-06T23:25:47.829032Z","title":"On the limitations of fine-tuned judge models for llm evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:47.829032Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:3400ebd4343d75529d7abb93ac8b1dce333ea3bed6df0def992790f0eb02737a","observation_id":"35245c9b-6ac1-4d25-abec-e0eb5ed53118","resolution":{"observed_at":"2026-08-06T23:25:47.829032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-06T15:10:23.222553Z","title":"On the Limitations of Fine-tuned Judge Models for LLM Evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16587","last_updated":"2025-07-22T13:40:26Z","snapshot_observed_at":"2026-08-06T15:04:15.420149Z","submitted_at":"2025-07-22T13:40:26Z","title":"On the Effectiveness of LLM-as-a-judge for Code Generation and Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:10:23.222553Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2507.16587"},"observation_digest":"sha256:967bc6abdfef58045eb2d1c1e3ff2f293757e3230c8c667ee1f4198df982b7c8","observation_id":"6630e635-cbe4-40e3-8524-e2f4199fe69d","resolution":{"observed_at":"2026-08-06T15:10:23.222553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T23:04:56.912415Z","title":", author Qu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05929","last_updated":"2025-09-10T12:09:14Z","snapshot_observed_at":"2026-08-05T23:04:47.746625Z","submitted_at":"2025-08-08T01:40:10Z","title":"Towards Reliable Generative AI-Driven Scaffolding: Reducing Hallucinations and Enhancing Quality in Self-Regulated Learning Support","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:04:56.912415Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2508.05929"},"observation_digest":"sha256:bafd0064c9c74bdfa2d5e2cf6d2d1d744004e50bcfce41608a831190b26c83de","observation_id":"f9e7aece-e3a1-4f62-a2cb-de4e76c4482a","resolution":{"observed_at":"2026-08-05T23:04:56.912415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-03T21:09:20.133943Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16478","last_updated":"2026-07-20T11:57:11Z","snapshot_observed_at":"2026-08-08T04:23:14.885822Z","submitted_at":"2025-11-20T15:46:27Z","title":"Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:20.133943Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2511.16478"},"observation_digest":"sha256:dc6957ee4ed6286755536b464ac643890180dfda0dff8b9f580bdd531cd24db5","observation_id":"094d9722-3e48-41b7-b780-5842449971b8","resolution":{"observed_at":"2026-08-03T21:09:20.133943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2605.02765","last_updated":"2026-05-04T16:05:40Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T16:05:40Z","title":"U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:55.849451Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2605.02765"},"observation_digest":"sha256:c863586829f2e259181c0f7d3bad7cf69f7a1d96ec84e06cc4f01e53b303b906","observation_id":"2333b4db-20bd-4583-a8f7-2d4feab28d01","resolution":{"observed_at":"2026-05-09T06:35:39.005139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2605.11663","last_updated":"2026-05-12T07:22:50Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:22:50Z","title":"Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-13T01:12:44.476894Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2605.11663"},"observation_digest":"sha256:29246c48dc6099a1e9d663241d7d22ce25ee1f29e0c20603268b14043a649143","observation_id":"d2d22ba6-a5c3-4f42-a572-30e2337e13eb","resolution":{"observed_at":"2026-05-13T01:17:02.696947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2606.03138","last_updated":"2026-06-02T04:27:53Z","snapshot_observed_at":"2026-08-05T08:20:24.247189Z","submitted_at":"2026-06-02T04:27:53Z","title":"Section-Weighted Hybrid Approach for Legal Case Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T08:39:28.510255Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2606.03138"},"observation_digest":"sha256:69c4522c90d2c23ed1ff7ae054761284a5d43decdbdc41f5468a32a1dce95d7d","observation_id":"0d67d5d2-beea-4717-858a-1893de695dc3","resolution":{"observed_at":"2026-07-02T04:56:39.300020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2606.07874","last_updated":"2026-06-05T22:11:26Z","snapshot_observed_at":"2026-08-02T07:02:54.289200Z","submitted_at":"2026-06-05T22:11:26Z","title":"Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:26.268337Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2606.07874"},"observation_digest":"sha256:ac375b790d355239f753deaa2d99be08bc1ae1d8e9626318b55fe16b4b60acaa","observation_id":"9d426666-40ad-4b7c-9c99-16f0bd40c3e4","resolution":{"observed_at":"2026-06-27T21:41:18.571899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-02T05:30:00.492775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13347","last_updated":"2026-07-16T21:13:23Z","snapshot_observed_at":"2026-08-08T07:52:29.533188Z","submitted_at":"2026-07-15T00:14:31Z","title":"LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T05:30:00.492775Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.13347"},"observation_digest":"sha256:35a6b309feeb2ad076b15587edfa271fafe9c55b035c55d63e9e8b250451b2fd","observation_id":"bd79bc58-d3bd-4eb0-8bed-8afeccf7dde5","resolution":{"observed_at":"2026-08-02T05:30:00.492775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-07-31T12:20:07.090862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28282","last_updated":"2026-07-30T14:31:07Z","snapshot_observed_at":"2026-08-06T16:34:19.905250Z","submitted_at":"2026-07-30T14:31:07Z","title":"(Towards) Scalable Reliable Automated Evaluation with Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T12:20:07.090862Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.28282"},"observation_digest":"sha256:6a6960fcdb630d29edea6e7469c6604998364beab986ae79c1da50ced02e79fc","observation_id":"919a65f8-29a8-430a-a1ec-2d0a3744c8f5","resolution":{"observed_at":"2026-07-31T12:20:07.090862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-03T00:55:40.748915Z","title":"arXiv preprint arXiv:2403.02839 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:40.748915Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:5edd4d0c718e7da8d0661ebeb03d3283f126efe7f219d4878317f118387dd14f","observation_id":"27885a75-59e5-46f3-9d69-832c82e6d4cd","resolution":{"observed_at":"2026-08-03T00:55:40.748915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.02839/citation-record","integrity":"/paper/2403.02839/integrity","json":"/paper/2403.02839/citation-record.json","paper":"/paper/2403.02839"},"outbound":[],"paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2403.02839."}