Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T22:56:38.270220Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 4 inbound Pith citation observations for arXiv:2506.20274.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T22:56:38.270220Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-06T15:35:22.448174Z
A source-named dated measurement, never combined with another source.
Source: pith, observed 2026-07-11T04:37:48.221956Z
95 of 95 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 1d26afb3-7c65-45cf-af7f-f3d6a4f49515 · outbound
Enterprise Large Language Model Evaluation Benchmark AutoBencher: Towards Declarative Benchmark Construction
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c6a15c97-fa48-4dbc-9ddf-8c498d482acb · outbound
Enterprise Large Language Model Evaluation Benchmark Measuring Massive Multitask Language Understanding
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3533b566-c2bd-409a-bdab-a4e8118de933 · outbound
Enterprise Large Language Model Evaluation Benchmark Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 14870780-827b-4017-abfd-0c0bcb9f89e8 · outbound
Enterprise Large Language Model Evaluation Benchmark On the Measure of Intelligence
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d4c7ccc0-ea19-4d32-8541-39d64b58b2c4 · outbound
Enterprise Large Language Model Evaluation Benchmark Holistic Evaluation of Language Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 13bc31fc-f521-45a7-b742-77be8b929ce6 · outbound
Enterprise Large Language Model Evaluation Benchmark Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 95a207cb-5792-4b9d-897f-3cfd1bc98123 · outbound
Enterprise Large Language Model Evaluation Benchmark What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3fab65a6-a87f-47b2-9c49-e0a52a4737b1 · outbound
Enterprise Large Language Model Evaluation Benchmark MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 133620ab-795b-4615-978d-344bff241c31 · outbound
Enterprise Large Language Model Evaluation Benchmark MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 50a3937c-3f72-4d2b-a6e3-f365929ce04a · outbound
Enterprise Large Language Model Evaluation Benchmark WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 64bb560a-523f-47bf-b193-92442c6303a7 · outbound
Enterprise Large Language Model Evaluation Benchmark PubMedQA:ADatasetforBiomedicalResearch Question Answering,
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 29b04a36-3183-401a-9980-2e31a5a015ba · outbound
Enterprise Large Language Model Evaluation Benchmark CMB: A Comprehensive Medical Benchmark in Chinese
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 808de6df-1352-4d5b-8f3c-b91a92e3faab · outbound
Enterprise Large Language Model Evaluation Benchmark FinBen: A Holistic Financial Benchmark for Large Language Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6ac76429-9aac-4f48-a940-fcf3674db5d0 · outbound
Enterprise Large Language Model Evaluation Benchmark FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9e6287b6-52fe-4e2e-ad5a-024229d2e6e8 · outbound
Enterprise Large Language Model Evaluation Benchmark WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3d95e4e9-f96e-43c7-a6e9-2e31fb50e29c · outbound
Enterprise Large Language Model Evaluation Benchmark BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9facde69-b28d-44f8-a3bc-1d3a07f30978 · outbound
Enterprise Large Language Model Evaluation Benchmark XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 015cc8c0-345c-45d6-8f7a-578d5c23c810 · outbound
Enterprise Large Language Model Evaluation Benchmark PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 347076fd-8cd8-417d-a8ac-74666d142968 · outbound
Enterprise Large Language Model Evaluation Benchmark LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6df36f35-623e-40c6-8368-97f94e36972a · outbound
Enterprise Large Language Model Evaluation Benchmark A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c23ae7a-5ba5-4c5b-8fa2-fd50e0ddb26d · outbound
Enterprise Large Language Model Evaluation Benchmark LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 22779890-ffe0-482e-977c-a20e2120b210 · outbound
Enterprise Large Language Model Evaluation Benchmark LawBench: Benchmarking Legal Knowledge of Large Language Models
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fd3d96f8-d9ed-4523-ad50-6c26dd1cbdd1 · outbound
Enterprise Large Language Model Evaluation Benchmark CMMLU: Measuring massive multitask language understanding in Chinese
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b86644a4-87fc-48f9-8936-06d9325cf7b7 · outbound
Enterprise Large Language Model Evaluation Benchmark Evaluating the Performance of Large Language Models on GAOKAO Benchmark
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18399b1f-3b3e-4e5f-ba14-dd2a9e07f63e · outbound
Enterprise Large Language Model Evaluation Benchmark C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 52654b07-9443-4d22-9af5-fcda18c54227 · outbound
Enterprise Large Language Model Evaluation Benchmark Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b12a7ce0-23cb-4a3a-8113-06fea8de0083 · outbound
Enterprise Large Language Model Evaluation Benchmark M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dcb23d56-9a47-4491-989f-80b31d02cb38 · outbound
Enterprise Large Language Model Evaluation Benchmark AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 28337c23-44fe-46f3-9c7b-8e6ed0cc1f67 · outbound
Enterprise Large Language Model Evaluation Benchmark Large Language Models for Data Annotation and Synthesis: A Survey
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c3dea55e-8b96-4cb9-97c7-39ffa85710e5 · outbound
Enterprise Large Language Model Evaluation Benchmark On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2779ed39-6f83-4b3a-9777-762e05bc2e53 · outbound
Enterprise Large Language Model Evaluation Benchmark Comprehensive Exploration of Synthetic Data Generation: A Survey
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 10f2024b-5644-4319-aa21-14e4442a5c3d · outbound
Enterprise Large Language Model Evaluation Benchmark Best Practices and Lessons Learned on Synthetic Data
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f27ffcb3-2c43-4073-842a-4fc88a577f5b · outbound
Enterprise Large Language Model Evaluation Benchmark Self-Consistency Improves Chain of Thought Reasoning in Language Models
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 23d3d0b9-f0db-4648-8fef-8789b05f1e9b · outbound
Enterprise Large Language Model Evaluation Benchmark Self-Prompting Large Language Models for Zero-Shot Open-Domain QA
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 5a2cbb23-2130-4378-9268-c3eaa9f2f25c · outbound
Enterprise Large Language Model Evaluation Benchmark DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3080cb20-447a-448d-bb40-8afde03381d6 · outbound
Enterprise Large Language Model Evaluation Benchmark Unresolved cited work
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb953800-ef19-4e2d-836e-2652df147c47 · outbound
Enterprise Large Language Model Evaluation Benchmark I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d579f04e-ef9b-4f6d-8c31-8dd701c90115 · outbound
Enterprise Large Language Model Evaluation Benchmark Self-Rewarding Language Models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 139a865c-3c99-47d3-bdc5-87120610f228 · outbound
Enterprise Large Language Model Evaluation Benchmark West-of-N: Synthetic Preferences for Self-Improving Reward Models
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c95bc744-5fe4-4afd-8009-e645732914b9 · outbound
Enterprise Large Language Model Evaluation Benchmark Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 11769962-4521-4a78-a9fb-7147203d8028 · outbound
Enterprise Large Language Model Evaluation Benchmark Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49aad555-c701-4ef5-80e8-962f6355f413 · outbound
Enterprise Large Language Model Evaluation Benchmark Leveraging Large Language Models for Multiple Choice Question Answering
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18075e64-31c7-42fe-a470-82412368bdc9 · outbound
Enterprise Large Language Model Evaluation Benchmark Teaching Models to Express Their Uncertainty in Words
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 751f1980-b1fa-4945-b2dd-925e99eee639 · outbound
Enterprise Large Language Model Evaluation Benchmark Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 87cfb609-01c4-4750-a836-71ea6394694f · outbound
Enterprise Large Language Model Evaluation Benchmark Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b5e3b33e-fcfb-4fc6-981f-52e92037ccf3 · outbound
Enterprise Large Language Model Evaluation Benchmark MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3bb223b9-f6ff-4e39-bc45-c28adff200c8 · outbound
Enterprise Large Language Model Evaluation Benchmark Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b02df137-4093-4e14-a4bf-7259a7925728 · outbound
Enterprise Large Language Model Evaluation Benchmark Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3896673e-55e5-450b-a4ae-94d15b69afc7 · outbound
Enterprise Large Language Model Evaluation Benchmark Self-Knowledge Guided Retrieval Augmentation for Large Language Models
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eee59b13-8eee-4afb-aaac-d1d8f7ddc305 · outbound
Enterprise Large Language Model Evaluation Benchmark Making Retrieval-Augmented Language Models Robust to Irrelevant Context
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 78d826a8-66a8-442f-9236-448efac74d03 · outbound
Enterprise Large Language Model Evaluation Benchmark Search Augmented Instruction Learning,
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation d65dc77f-5b7b-46b8-9715-4b0593eafdd6 · outbound
Enterprise Large Language Model Evaluation Benchmark Corrective Retrieval Augmented Generation
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4fdc0035-c199-4ab5-a018-885e7c3b3cd1 · outbound
Enterprise Large Language Model Evaluation Benchmark Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 506c000c-7813-4bb1-afb3-7e68efabdd04 · outbound
Enterprise Large Language Model Evaluation Benchmark LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b79e00d-3d69-47dd-a684-e6f215c232dd · outbound
Enterprise Large Language Model Evaluation Benchmark EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2adcbb2b-ad9c-4e78-9a31-c5ba286a14cf · outbound
Enterprise Large Language Model Evaluation Benchmark From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2e9102f2-ea1c-4a32-b45b-7953a01a4fe7 · outbound
Enterprise Large Language Model Evaluation Benchmark Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb5690b6-7ff5-447d-a462-7b390e3e9370 · outbound
Enterprise Large Language Model Evaluation Benchmark PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
Reference 59
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c167b644-fae9-4b4e-92d4-a899c6265f0a · outbound
Enterprise Large Language Model Evaluation Benchmark Evaluating Large Language Models at Evaluating Instruction Following
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2912892d-3c8e-4ef7-ae87-74764814edad · outbound
Enterprise Large Language Model Evaluation Benchmark Large Language Models are not Fair Evaluators
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 830957ef-80a0-49c4-91f6-9dcb9d56bcfd · outbound
Enterprise Large Language Model Evaluation Benchmark RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
Reference 62
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 585fe516-60ce-4817-84f5-f3f725e0c0a8 · outbound
Enterprise Large Language Model Evaluation Benchmark G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5773381e-02e9-499a-b183-8c697cc39ff6 · outbound
Enterprise Large Language Model Evaluation Benchmark Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Reference 64
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4db0726c-e272-4c73-8765-36a3e1716803 · outbound
Enterprise Large Language Model Evaluation Benchmark A Survey on Evaluation of Large Language Models
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 38e4ebf3-57ab-4589-864d-4d7ac14a32d5 · outbound
Enterprise Large Language Model Evaluation Benchmark A Revision of Bloom’s Taxonomy: An Overview,
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 72f2525d-010e-42d6-ae0a-33d141fcea04 · outbound
Enterprise Large Language Model Evaluation Benchmark Bloom’s Taxonomy,
Reference 67
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 86e53d7c-5187-4191-b5ce-34ccb0d64f6b · outbound
Enterprise Large Language Model Evaluation Benchmark Confluence
Reference 68
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 46327f36-fe8a-466c-8d28-e594c65326f8 · outbound
Enterprise Large Language Model Evaluation Benchmark Unresolved cited work
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d2dbb9d-74a1-44c4-80ac-6d1e777b1a40 · outbound
Enterprise Large Language Model Evaluation Benchmark Paraphrase Mining — Sentence Transformers documentation
Reference 70
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18b27fb4-82a0-4593-b28e-af65f5e1d480 · outbound
Enterprise Large Language Model Evaluation Benchmark GPT-4 Technical Report
Reference 71
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 089737ed-e306-4e46-a3ca-cbaf44920980 · outbound
Enterprise Large Language Model Evaluation Benchmark Unresolved cited work
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9ad23cb7-dbf2-4129-aa3e-5d74544709f0 · outbound
Enterprise Large Language Model Evaluation Benchmark LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI
Reference 73
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cf5c50a2-fd44-403a-b187-7191d155b612 · outbound
Enterprise Large Language Model Evaluation Benchmark Bleu: a Method for Automatic Evaluation of Machine Translation,
Reference 74
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b630f755-e53b-4170-92bd-7e9b50a473a6 · outbound
Enterprise Large Language Model Evaluation Benchmark ROUGE:APackageforAutomaticEvaluationofSummaries,
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8c5a74c5-a64b-458c-b74e-ff1663f8583a · outbound
Enterprise Large Language Model Evaluation Benchmark BLEU is Not Suitable for the Evaluation of Text Simplification,
Reference 76
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a80553d-6cf4-42e1-b187-e7343f5001b0 · outbound
Enterprise Large Language Model Evaluation Benchmark BERTScore: Evaluating Text Generation with BERT
Reference 77
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 684f0aa2-8018-4b07-b488-696038a83d3a · outbound
Enterprise Large Language Model Evaluation Benchmark BARTScore: Evaluating Generated Text as Text Generation
Reference 78
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e44ed20f-142a-4064-93a1-b9575306b251 · outbound
Enterprise Large Language Model Evaluation Benchmark LLM-based NLG Evaluation: Current Status and Challenges
Reference 79
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8f5e9a53-28fc-494a-b246-5746ac0c8b23 · outbound
Enterprise Large Language Model Evaluation Benchmark ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning
Reference 80
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f4e1cc66-fff6-4764-9e7c-c52b7b34ad10 · outbound
Enterprise Large Language Model Evaluation Benchmark ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,
Reference 81
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 11f977b2-5018-4b10-ac06-6977040725fa · outbound
Enterprise Large Language Model Evaluation Benchmark ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c4a18303-5f35-43f6-b77c-6932dd65f3fd · outbound
Enterprise Large Language Model Evaluation Benchmark ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness
Reference 83
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation aa05dce6-174c-49f4-b14b-12cfb2f233ba · outbound
Enterprise Large Language Model Evaluation Benchmark 30, 2024
Reference 84
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 527bb0bd-efe9-4575-9c3f-37f1351c591c · outbound
Enterprise Large Language Model Evaluation Benchmark Toxicity
Reference 85
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation c325eaa4-213a-464d-861e-286a8aebfbfc · outbound
Enterprise Large Language Model Evaluation Benchmark 29, 2024
Reference 86
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b11d65e7-f995-402c-8ecc-f316cf02f38a · outbound
Enterprise Large Language Model Evaluation Benchmark Hallucination
Reference 87
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b80432e5-4c9f-4d81-93ac-861219ef2bbe · outbound
Enterprise Large Language Model Evaluation Benchmark Spearman’s rank correlation coefficient,
Reference 88
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 68a7b921-f1ae-4c99-9c67-dec9f938cef5 · outbound
Enterprise Large Language Model Evaluation Benchmark Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,
Reference 89
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 99149d66-b16d-4746-b82c-d479a7faab87 · outbound
Enterprise Large Language Model Evaluation Benchmark LLaMA 3.3,
Reference 90
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation f4985e23-4100-45a8-807b-7053c4c0bbbc · outbound
Enterprise Large Language Model Evaluation Benchmark The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,
Reference 91
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 899a27e9-f9fa-47c0-a575-8ab80fa01051 · outbound
Enterprise Large Language Model Evaluation Benchmark Qwen2.5 Technical Report
Reference 92
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e8087ad6-47ac-4231-a96a-0f83174f9110 · outbound
Enterprise Large Language Model Evaluation Benchmark The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks
Reference 93
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 90c5c1cc-d775-477e-a72f-2e845f4c4ce9 · outbound
Enterprise Large Language Model Evaluation Benchmark Unresolved cited work
Reference 94
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 79aebb99-6b79-4ce5-a16c-b80d5c7d3f40 · outbound
Enterprise Large Language Model Evaluation Benchmark This method has been incorporated into the DeepEval package [72]
Reference 95
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 24b3ca47-ad68-4b1e-82ab-f56a432a0b7e · outbound
Enterprise Large Language Model Evaluation Benchmark Available: https://sbert.net/examples/applications/paraphrase-mining/README.html
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a25457eb-cdac-441f-9f2e-0abbe541a5f3 · inbound
Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers Enterprise Large Language Model Evaluation Benchmark
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a7252636-13b0-4af4-bb2e-54afe157cff0 · inbound
EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems Enterprise Large Language Model Evaluation Benchmark
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation c4c7a638-5768-48f9-aafa-92c553d67644 · inbound
Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ef1b3020-0499-453e-9b27-624dbdd4423f · inbound
Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.