{"as_of":"2026-08-19T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28580f22fda5fb91048e818a4349b78611242b82d47e16b1042ab08e6c38406c","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:22:55.558755Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10626/citation-record","integrity":"/paper/2607.10626/integrity","json":"/paper/2607.10626/citation-record.json","paper":"/paper/2607.10626"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.13210","last_updated":"2024-10-17T04:30:46Z","snapshot_observed_at":"2026-08-17T22:58:07.712193Z","submitted_at":"2024-10-17T04:30:46Z","title":"FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13210","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2410.13210","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:e2ec4ccfa7535cc33b4aca34dd385d203110f0d1a0e19c0e91ee13159f7e4db7","observation_id":"56d8b4d3-18be-4c85-b3c8-ad6090cce019","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.86","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"9b57269c-a1a7-460f-8748-3f59e8fda604","year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:b4618710f096849e9b19075460527d7a9e1b25e17b5ccbc55bbaf519f5d79d69","observation_id":"668510e8-86fd-4af3-b654-6ec1f6a95337","resolution":{"observed_at":"2026-07-14T10:30:24.951785Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:06.645079+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:06.645079+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:d458ae3c4be5838465117ba3677eb3041279c750bd111e4fee00b47f04725f52","observation_id":"79842aee-f0ec-4b0f-9806-0a63cbde44e5","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":"Coman, Ionut-Teodor Sorodoc, Leonardo F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:bc893d41f2954afd9c0e69875af0a9556399b09252a517512fafb99cd10ad82f","observation_id":"062ba047-64ef-4fe8-a791-8ebe6c161713","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:3e200ee5fa03418b96c505216e22a779b8bf07b88b11681afd93f5bd3fbb571a","observation_id":"6245d437-22e5-4d1d-8110-74344e6c170e","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-13T16:22:14.977210Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:91ab2792bb43566162e90cd74cf69226dc9dae05adabb83a06c46e4ffaea6f51","observation_id":"a9390467-7df5-4809-b694-4317c9b2ae50","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:78e583a667660fd9cc649dc113df57d3d7c1cff0f798065b0a8f70c111184812","observation_id":"476f8506-8794-4e05-a692-97b3dd17c9f4","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:f5e894abfa826909c9dc79dd59df4d2593c9a5a1d2718f93f2640f69314ec5d7","observation_id":"c9bf7bb1-45ed-450b-833c-918b1c384b45","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08491","last_updated":"2024-03-09T10:44:58Z","snapshot_observed_at":"2026-08-17T23:58:14.375298Z","submitted_at":"2023-10-12T16:50:08Z","title":"Prometheus: Inducing Fine-grained Evaluation Capability in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08491","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2310.08491","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:634606051b1803229d9eb23db10fc55e6544297c3c5e96fa4a177d3aba825f66","observation_id":"72d0cc1b-c5e4-45e9-96d8-d53ab0736cf5","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:3c96c81a60239590e1c25982421c2deb2d2fed6214432592573a3c7b3300e293","observation_id":"de0313bb-4bc5-4feb-8898-d65e9457cb67","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:7f73de097bf33f2e27a5a61a7d1de078077cb6b98c2d40480d2ebdef06792196","observation_id":"a711624a-1c8f-4703-a639-d87a258427ed","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:5119f6a0b23369d0f7bc9703a33f7abc8cdbf91b8af36c93b024b9cf9ea0c98f","observation_id":"5570a3af-a771-46d3-adad-a1871e240281","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:30ce35f6541683e35ecdf9a791b4452aba5c09cfdf9aa7697ce378dcebe69c35","observation_id":"3c110c5d-90f1-45fd-bd2c-3022b314d510","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00396","last_updated":"2024-05-17T06:29:31Z","snapshot_observed_at":"2026-08-16T15:25:56.339870Z","submitted_at":"2023-12-31T04:43:45Z","title":"RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00396","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2401.00396","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:45ea08091828694c28de1a77555a994dd7e6483640d2db733dbf0861e8e22f97","observation_id":"63b30c6a-cc2f-46c1-8764-a0da85c4e3cb","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:707dde6e2c39d93ce19b9d070cb25b86de06305985bca50e0c36c6397d034fc5","observation_id":"dd37bc81-e830-48b9-b5bd-0ec954aba5ac","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09476","last_updated":"2024-03-31T20:58:46Z","snapshot_observed_at":"2026-08-17T08:07:48.882785Z","submitted_at":"2023-11-16T00:39:39Z","title":"ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09476","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2311.09476","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:88c3e0d5d69899e5899a176359272f317bbd0f36acfb81d81eba7f158f63350d","observation_id":"4e1154b0-a21c-4cbe-8c7a-0f8ae5f88e8a","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:58a3043ffe0293025c061b40b03e60ff459e847268318fc5b41e1be0eed1b69b","observation_id":"2b989eeb-3ff0-4560-bf38-917b3338ec6a","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:cca30cbefb977afcf40652531aaf53c8a1e1e612dbf3dc56c0ff20926bb3d02e","observation_id":"e5717006-fb16-4ca2-a301-403c87071cba","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:db40640629232168a2b51c540914988e4e979ccd1ae2bfb440bc565b77d04b9d","observation_id":"2bfa219f-0831-4e2d-8252-5e3a3f8ba9d5","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-08-15T04:40:13.234467Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19196","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2605.19196","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:e32c01bd07c2f3e5862703f040693eaf66a1787cc0a714cd6196427d1ee6f594","observation_id":"77399758-2e3c-4b3a-bd63-8061acd33a9e","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21819","last_updated":"2025-06-21T08:39:06Z","snapshot_observed_at":"2026-08-14T13:23:53.106970Z","submitted_at":"2024-10-29T07:42:18Z","title":"Self-Preference Bias in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21819","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2410.21819","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:292561695a479ce12d45cb040125dc71b5b3e4a9e0e7facb6e4f052ed50c4ba5","observation_id":"396578c7-75a8-48e0-9f5e-ebf93919abda","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:c1cafd5763faf5117c30296161d947dbeb607af1bd825c1c73360f6bccca7139","observation_id":"2894a54e-0b1f-4050-9046-4945156666b2","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":"Chawla, and Xiangliang Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:88c7b37b0bae64c7d69a4a50fcd54b3a7934e18c2df64d666e5340b8259ee3d7","observation_id":"ba6c6b92-bfdf-4b01-a20a-8d4249cd5bb2","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:4ac0dd5bed09a09a1325c344bff1e05a62942a76f29037e957b859571ee0ea00","observation_id":"8e9ccb93-808c-4dbb-969b-64e95579dfaf","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:13:47.409076Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.10626."}