{"as_of":"2026-08-18T15:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1fc3668e3801f3229a358c6dac043ef937bda50a1f9d77687b2b01c6444cca7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:21:26.014390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":13,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-11T10:47:44.152066Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2309.07864"},"observation_digest":"sha256:33fc4ce1edee7e7cdff7fef798949ccc37fe142cb0ebf4a75d6f161881787018","observation_id":"5845ceaf-2264-486b-8a47-37a80cded7f4","resolution":{"observed_at":"2026-05-11T10:47:48.089570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2406.06608","last_updated":"2025-02-26T18:59:01Z","snapshot_observed_at":"2026-08-13T23:11:34.204909Z","submitted_at":"2024-06-06T18:10:11Z","title":"The Prompt Report: A Systematic Survey of Prompt Engineering Techniques","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:16:17.875268Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2406.06608"},"observation_digest":"sha256:50cc0f11d4411a22baa9b85c9225a13b75f3a0eb489f28d324fc40a07a30daff","observation_id":"4ef38040-ddcb-4866-8b9f-7509d29866da","resolution":{"observed_at":"2026-05-15T02:16:17.959486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-12T14:29:54.233656Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15320","last_updated":"2024-11-22T19:28:06Z","snapshot_observed_at":"2026-08-17T20:54:25.584082Z","submitted_at":"2024-11-22T19:28:06Z","title":"PPLqa: An Unsupervised Information-Theoretic Quality Metric for Comparing Generative Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:29:54.233656Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2411.15320"},"observation_digest":"sha256:799e8baa8bbdf52a465b563c29e7ac15e4e5058217ac1bfd500449cc5cc4316e","observation_id":"0b709059-0e66-46cb-adbc-02615707342e","resolution":{"observed_at":"2026-08-12T14:29:54.233656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-12T12:28:14.345801Z","title":", & author Chen, Y.-N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17204","last_updated":"2024-11-28T01:04:40Z","snapshot_observed_at":"2026-08-17T21:24:20.285377Z","submitted_at":"2024-11-26T08:21:24Z","title":"Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T12:28:14.345801Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2411.17204"},"observation_digest":"sha256:0f1abe726b476c3bf6c632258fd1b09cb509c6c005fd81b019add0e5de59f77f","observation_id":"7fed3f83-a174-4bed-9481-4cb7bfbe194d","resolution":{"observed_at":"2026-08-12T12:28:14.345801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:e5de4d0dcec7edcf7e59ac14864c182f95d7a5e57a36164064c1b2c846344826","observation_id":"8297fc60-5b9b-4af3-b422-632528bf69a5","resolution":{"observed_at":"2026-05-11T23:08:37.265522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-11T14:15:59.533685Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12322","last_updated":"2024-12-16T19:40:26Z","snapshot_observed_at":"2026-08-17T22:11:35.166032Z","submitted_at":"2024-12-16T19:40:26Z","title":"RAG Playground: A Framework for Systematic Evaluation of Retrieval Strategies and Prompt Engineering in RAG Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:15:59.533685Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2412.12322"},"observation_digest":"sha256:377283e529f166c40b876ec25a6a21b71d3851fb949c31a041276877636ad6e3","observation_id":"d0c1f4d9-65d2-4510-8dac-c096b93179b6","resolution":{"observed_at":"2026-08-11T14:15:59.533685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-08T23:35:38.372362Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04095","last_updated":"2025-02-06T14:12:41Z","snapshot_observed_at":"2026-08-17T22:21:24.331785Z","submitted_at":"2025-02-06T14:12:41Z","title":"LLMs to Support a Domain Specific Knowledge Assistant","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T23:35:38.372362Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2502.04095"},"observation_digest":"sha256:1e4e7929cc1ac990385cee4cac7167418cb0e7ab891886d31d512c46e257ed60","observation_id":"2d4ddd91-5fb0-447d-974f-b8c6d610fc06","resolution":{"observed_at":"2026-08-08T23:35:38.372362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-09T11:32:47.892435Z","title":"and Chen, Y .-N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-13T21:01:10.025945Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.892435Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:35e18d8c77e20e5f2696bb4c2fad4877998bb2b8d673de843270279152e0fa75","observation_id":"8dc45675-9d25-4c49-be35-f7f3e5710963","resolution":{"observed_at":"2026-08-09T11:32:47.892435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-16T10:21:26.014390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.014390Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:ccb3703d25ec2d89dea40fdb4745611828f2d88eb038ac39fbff1c27725bed5d","observation_id":"0959be33-1ff3-4d99-bf62-e0700bccf69b","resolution":{"observed_at":"2026-08-16T10:21:26.014390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-15T20:18:09.780825Z","title":"Llm -eval: Uniﬁed multi-dimensional automatic evaluation for open-domain c onversations with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13348","last_updated":"2025-05-19T16:51:12Z","snapshot_observed_at":"2026-08-16T13:56:23.651438Z","submitted_at":"2025-05-19T16:51:12Z","title":"Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:09.780825Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2505.13348"},"observation_digest":"sha256:9d964c1b6128384af30b45a3e195a5315b09ef0971cd54fcbfc148fc7f14906d","observation_id":"32005ca5-4794-4a72-ba54-e22a26fc7317","resolution":{"observed_at":"2026-08-15T20:18:09.780825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-15T20:17:05.451620Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13794","last_updated":"2025-05-20T01:02:29Z","snapshot_observed_at":"2026-08-18T02:22:26.523343Z","submitted_at":"2025-05-20T01:02:29Z","title":"LLM-based Evaluation Policy Extraction for Ecological Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:05.451620Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2505.13794"},"observation_digest":"sha256:1b79a96e886ce9d07410f34bd9c691b6f590de22607e2663c2f49b214e5a6f45","observation_id":"47ff5ca5-de94-4afb-8dc1-8e649e45097d","resolution":{"observed_at":"2026-08-15T20:17:05.451620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-07T12:09:55.224300Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06331","last_updated":"2025-05-31T03:36:16Z","snapshot_observed_at":"2026-08-18T14:43:02.359012Z","submitted_at":"2025-05-31T03:36:16Z","title":"How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.224300Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2506.06331"},"observation_digest":"sha256:866b0af5b74b7e4e68d3380ace7cad66f3902229547594a194d1e6de95d50912","observation_id":"4068be9d-418f-4d2d-8c04-8c37d0b311d4","resolution":{"observed_at":"2026-08-07T12:09:55.224300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-06T21:36:38.138381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-13T08:27:18.830708Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:38.138381Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:35acdde5046b8422fd66c7b888c1ab42881344aed2db6f0c0b56a1bcb39e5833","observation_id":"d57e1e38-1499-44f6-92d6-cd04e346b757","resolution":{"observed_at":"2026-08-06T21:36:38.138381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-06T17:27:08.221285Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10918","last_updated":"2025-07-15T02:19:52Z","snapshot_observed_at":"2026-08-18T00:15:05.681622Z","submitted_at":"2025-07-15T02:19:52Z","title":"How Stylistic Similarity Shapes Preferences in Dialogue Dataset with User and Third Party Evaluations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:27:08.221285Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2507.10918"},"observation_digest":"sha256:18342eb167491efa7f8141ac97232c648f822cc71fd4a1b47dd811e0ed19e8b1","observation_id":"aabaf863-da9c-452c-a8c8-9587455fc849","resolution":{"observed_at":"2026-08-06T17:27:08.221285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-06T14:37:37.679270Z","title":"arXiv preprint arXiv:2305.13711 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18442","last_updated":"2025-07-24T14:26:41Z","snapshot_observed_at":"2026-08-16T14:05:50.614109Z","submitted_at":"2025-07-24T14:26:41Z","title":"AraTable: Benchmarking LLMs' Reasoning and Understanding of Arabic Tabular Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:37.679270Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2507.18442"},"observation_digest":"sha256:854d3c216340908746403655ecb6651d106e367dcaba4b85216a04d399de023e","observation_id":"958f4ec2-d612-42a4-95e4-d117d75e8720","resolution":{"observed_at":"2026-08-06T14:37:37.679270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T22:54:24.564592Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06225","last_updated":"2025-08-18T12:00:32Z","snapshot_observed_at":"2026-08-18T14:07:18.712141Z","submitted_at":"2025-08-08T11:11:22Z","title":"Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:24.564592Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2508.06225"},"observation_digest":"sha256:589f28c8ab24081050f040496d0ac02b83234010845a54201f61f5157d740024","observation_id":"378b3328-2179-4531-887c-88d7a069cb16","resolution":{"observed_at":"2026-08-05T22:54:24.564592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-15T05:18:44.328500Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:11945c41b7d5b29010ef81d4a90162f64f60987d9dc356f9b5b0197904a197a5","observation_id":"188ac597-16b6-4ce8-b2f9-11e8718ccef4","resolution":{"observed_at":"2026-05-17T22:30:23.267894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2604.07892","last_updated":"2026-04-19T03:52:06Z","snapshot_observed_at":"2026-08-15T05:18:02.136975Z","submitted_at":"2026-04-09T07:01:26Z","title":"Data Selection for Multi-turn Dialogue Instruction Tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:25.546834Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2604.07892"},"observation_digest":"sha256:441934bb10ac3ccbea9e8ed1dd8c13e6afa195030c988ec7f783ad1ba120c7f7","observation_id":"6f9bc56a-9784-479c-be9d-002aa8b041c9","resolution":{"observed_at":"2026-05-11T07:55:59.683275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2604.19773","last_updated":"2026-03-27T12:13:20Z","snapshot_observed_at":"2026-08-17T13:25:49.227404Z","submitted_at":"2026-03-27T12:13:20Z","title":"PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T23:17:29.025222Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2604.19773"},"observation_digest":"sha256:cc8c24a3dae721fbec797ed3d476984f3b78daa14bb4b01529d17c13cfbc85e1","observation_id":"97735431-dc0d-43ed-9288-07d9533441c0","resolution":{"observed_at":"2026-05-14T23:18:15.753099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2606.00093","last_updated":"2026-07-31T04:03:56Z","snapshot_observed_at":"2026-08-05T23:10:44.373871Z","submitted_at":"2026-05-25T07:31:44Z","title":"Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T21:43:59.462151Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2606.00093"},"observation_digest":"sha256:ac023b6e68119c2512375036d5ee7affb4a875be3db2eab13642275a5582f075","observation_id":"c1532c2d-ded9-44c0-9eed-4c33cc0ad124","resolution":{"observed_at":"2026-06-29T21:53:58.861365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-03T02:20:17.847138Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00093","last_updated":"2026-07-31T04:03:56Z","snapshot_observed_at":"2026-08-05T23:10:44.373871Z","submitted_at":"2026-05-25T07:31:44Z","title":"Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T02:20:17.847138Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2606.00093"},"observation_digest":"sha256:105154e28bb5f066ba2ffc3bc321e085be09ebe87b0343d6da5989ea464606ca","observation_id":"f4f2a142-e68a-49d4-8bf3-393017b314b5","resolution":{"observed_at":"2026-08-03T02:20:17.847138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2606.30556","last_updated":"2026-06-29T16:51:31Z","snapshot_observed_at":"2026-08-07T13:43:00.994295Z","submitted_at":"2026-06-29T16:51:31Z","title":"Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:58.183264Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2606.30556"},"observation_digest":"sha256:92230c7321738cb2ae0c62cdd88034e90fae9fc1e7534c34e275ead22b5dc392","observation_id":"68e43071-7ef2-4fca-a085-aed917c8fdf3","resolution":{"observed_at":"2026-06-30T06:04:21.536998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-07-12T09:30:41.159870Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models.arXiv preprint arXiv:2305.13711, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02590","last_updated":"2026-07-01T07:01:40Z","snapshot_observed_at":"2026-08-17T04:58:28.296053Z","submitted_at":"2026-07-01T07:01:40Z","title":"OmniPresent: Generating Coherent Presentation Suites from Scientific Papers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T09:30:41.159870Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2607.02590"},"observation_digest":"sha256:5cba77c72ba5a0a1991b1a33fcde85de07645988c9ae20b7e5f9b6fda34f252d","observation_id":"0fb1fe54-f9c0-486b-880a-5d035780e7d0","resolution":{"observed_at":"2026-07-12T09:30:41.159870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.13711/citation-record","integrity":"/paper/2305.13711/integrity","json":"/paper/2305.13711/citation-record.json","paper":"/paper/2305.13711"},"outbound":[],"paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2305.13711."}