Pith. sign in

Paper Citation Record · LEDGER

Enterprise Large Language Model Evaluation Benchmark

As of 7 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 4 inbound Pith citation observations for arXiv:2506.20274.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.20274 v1

Coverage vector

measured 95 of 95 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T22:56:38.270220Z

measured 99 of 99 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:35:22.448174Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-11T04:37:48.221956Z

Reference resolution

95 of 95 outbound references displayed

  • verified exact4
  • verified fuzzy8
  • unresolved83
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1d26afb3-7c65-45cf-af7f-f3d6a4f49515 · outbound

This paper cites AutoBencher: Towards Declarative Benchmark Construction.

Enterprise Large Language Model Evaluation Benchmark AutoBencher: Towards Declarative Benchmark Construction

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.682305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.682305Z digest=sha256:14b8fe944927bf7214edc39576d8c81f9c9b57bea3d37a09ebbc175e9fd4d5f8

Observation c6a15c97-fa48-4dbc-9ddf-8c498d482acb · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Enterprise Large Language Model Evaluation Benchmark Measuring Massive Multitask Language Understanding

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.775105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.775105Z digest=sha256:2e755beb29b34befe7e532c49e92eaaef14b48b11a7a02febddc9f97b45491c4

Observation 3533b566-c2bd-409a-bdab-a4e8118de933 · outbound

This paper cites Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models.

Enterprise Large Language Model Evaluation Benchmark Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.868056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.868056Z digest=sha256:e81b9b7a571396a012e84debb274ff1ffb2baea70e83c40c8bcf5237de24295f

Observation 14870780-827b-4017-abfd-0c0bcb9f89e8 · outbound

This paper cites On the Measure of Intelligence.

Enterprise Large Language Model Evaluation Benchmark On the Measure of Intelligence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.935899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.935899Z digest=sha256:95bcf5361cbccd0cc72a84a7c7071e12301bace542982fd3bc205fd124adf535

Observation d4c7ccc0-ea19-4d32-8541-39d64b58b2c4 · outbound

This paper cites Holistic Evaluation of Language Models.

Enterprise Large Language Model Evaluation Benchmark Holistic Evaluation of Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.015321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.015321Z digest=sha256:856072819ca3d6d6741709cef6b6d4b7be6d31de5c9c57f9da17ffa044a4c974

Observation 13bc31fc-f521-45a7-b742-77be8b929ce6 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Enterprise Large Language Model Evaluation Benchmark Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.088687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.088687Z digest=sha256:65915ed8ac4e4ae09c317ed88f6db50ff285911a4c376eccb4418d6080383bfc

Observation 95a207cb-5792-4b9d-897f-3cfd1bc98123 · outbound

This paper cites What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams.

Enterprise Large Language Model Evaluation Benchmark What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.178017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.178017Z digest=sha256:cdb5c90317361bea679bc80c7fb724d5ccaa3b445f05bcf28e87a1c6d0f298bf

Observation 3fab65a6-a87f-47b2-9c49-e0a52a4737b1 · outbound

This paper cites MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,.

Enterprise Large Language Model Evaluation Benchmark MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,

Reference 8

Resolution
verified exact
doi, observed 2026-08-06T22:56:39.440489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:31.268371Z digest=sha256:0e57faabafa8351678c6b67c659af7a70062f7e20d57dac771d4531e34c34e48

Observation 133620ab-795b-4615-978d-344bff241c31 · outbound

This paper cites MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering.

Enterprise Large Language Model Evaluation Benchmark MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.339236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.339236Z digest=sha256:24ec8660dfc6de9a5af08b49fb2d3f7d61c20775073a6956dd6fba5e0233cec3

Observation 50a3937c-3f72-4d2b-a6e3-f365929ce04a · outbound

This paper cites WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation.

Enterprise Large Language Model Evaluation Benchmark WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.407399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.407399Z digest=sha256:75704d66dd9f3c9b8584cd47fdb83ac11e93c859b930c98658710c73329443e8

Observation 64bb560a-523f-47bf-b193-92442c6303a7 · outbound

This paper cites PubMedQA:ADatasetforBiomedicalResearch Question Answering,.

Enterprise Large Language Model Evaluation Benchmark PubMedQA:ADatasetforBiomedicalResearch Question Answering,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.496753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.496753Z digest=sha256:2a691654a11dc9e9814a1f417552e99dbedd1bd4b18f658648e0b86c84d76ebf

Observation 29b04a36-3183-401a-9980-2e31a5a015ba · outbound

This paper cites CMB: A Comprehensive Medical Benchmark in Chinese.

Enterprise Large Language Model Evaluation Benchmark CMB: A Comprehensive Medical Benchmark in Chinese

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.572070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.572070Z digest=sha256:f40d59224c58fa115bc5b378fa76fd429abb72a8f349981e677aa551f4e868e6

Observation 808de6df-1352-4d5b-8f3c-b91a92e3faab · outbound

This paper cites FinBen: A Holistic Financial Benchmark for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark FinBen: A Holistic Financial Benchmark for Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.645688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.645688Z digest=sha256:5bc66b501563763d7f2552f8c22a2712d6b389f74e580dea4d997f8b9a710799

Observation 6ac76429-9aac-4f48-a940-fcf3674db5d0 · outbound

This paper cites FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.714437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.714437Z digest=sha256:a89af5bdd008a6128b5aa2b0ed711f1497560d4ef052b1c9e5daee88b6556ba4

Observation 9e6287b6-52fe-4e2e-ad5a-024229d2e6e8 · outbound

This paper cites WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain.

Enterprise Large Language Model Evaluation Benchmark WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.776768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.776768Z digest=sha256:31f736ca0dae81da998937ca19fcde664c3abf203a3e153c59e9f6e43123a4c1

Observation 3d95e4e9-f96e-43c7-a6e9-2e31fb50e29c · outbound

This paper cites BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark.

Enterprise Large Language Model Evaluation Benchmark BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.843525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.843525Z digest=sha256:6c03b2ddbf6cae1545520f760de32c22e0613af9247752258e3f896b3372d8a1

Observation 9facde69-b28d-44f8-a3bc-1d3a07f30978 · outbound

This paper cites XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters.

Enterprise Large Language Model Evaluation Benchmark XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.910853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.910853Z digest=sha256:ae09540d042767ec83018fd52fc878156db2640eb56a37d2e6e9bff522cc0493

Observation 015cc8c0-345c-45d6-8f7a-578d5c23c810 · outbound

This paper cites PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance.

Enterprise Large Language Model Evaluation Benchmark PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.976188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.976188Z digest=sha256:71cbf09a581c79de2211256af523096b2e9ad67edf9ca5fff91abe12d8ceaad6

Observation 347076fd-8cd8-417d-a8ac-74666d142968 · outbound

This paper cites LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,.

Enterprise Large Language Model Evaluation Benchmark LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.063517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.063517Z digest=sha256:cce3d273c624bc3e54d14c43b0349b5528a4c51ad0ddf62ef28c9b4e084e6661

Observation 6df36f35-623e-40c6-8368-97f94e36972a · outbound

This paper cites A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction.

Enterprise Large Language Model Evaluation Benchmark A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.171821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.171821Z digest=sha256:2ee50f7dba95217d53c30c9faa87b805464e0bf9ed293b11dc79e2a36f192b61

Observation 0c23ae7a-5ba5-4c5b-8fa2-fd50e0ddb26d · outbound

This paper cites LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models.

Enterprise Large Language Model Evaluation Benchmark LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.246086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.246086Z digest=sha256:87321aaad173cc9795b4ee906fb3add8e690cf9d523df73de32c7794ff3c3a70

Observation 22779890-ffe0-482e-977c-a20e2120b210 · outbound

This paper cites LawBench: Benchmarking Legal Knowledge of Large Language Models.

Enterprise Large Language Model Evaluation Benchmark LawBench: Benchmarking Legal Knowledge of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.291657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.291657Z digest=sha256:896db90e2190f2632f823cb3ab27c832563fd5c937d45e48885664391792c12d

Observation fd3d96f8-d9ed-4523-ad50-6c26dd1cbdd1 · outbound

This paper cites CMMLU: Measuring massive multitask language understanding in Chinese.

Enterprise Large Language Model Evaluation Benchmark CMMLU: Measuring massive multitask language understanding in Chinese

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.344640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.344640Z digest=sha256:48b3cd172974e19e1fa9d0ef1b1dcab140e570b90edfa7c41d4d1e4a2e22d463

Observation b86644a4-87fc-48f9-8936-06d9325cf7b7 · outbound

This paper cites Evaluating the Performance of Large Language Models on GAOKAO Benchmark.

Enterprise Large Language Model Evaluation Benchmark Evaluating the Performance of Large Language Models on GAOKAO Benchmark

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.401251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.401251Z digest=sha256:6946cead74b7c8ebd5a75f804b3ff51a343053baf6c0bcfb1aaa46aeb4fb0c5e

Observation 18399b1f-3b3e-4e5f-ba14-dd2a9e07f63e · outbound

This paper cites C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models.

Enterprise Large Language Model Evaluation Benchmark C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.480672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.480672Z digest=sha256:ce8687b556902a5c0b036714c8524b3ba91dd64d234ec17490eda442b072a0db

Observation 52654b07-9443-4d22-9af5-fcda18c54227 · outbound

This paper cites Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,.

Enterprise Large Language Model Evaluation Benchmark Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.551128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.551128Z digest=sha256:21c98e240b59f7bf3f4c718ff72bb08cd801a1b198d2f506fcf65c0970507154

Observation b12a7ce0-23cb-4a3a-8113-06fea8de0083 · outbound

This paper cites M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models.

Enterprise Large Language Model Evaluation Benchmark M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.619412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.619412Z digest=sha256:cf6fa329f870987608ba42a63e0e277b66eab6fcde58d95c4a97e4cca10a2841

Observation dcb23d56-9a47-4491-989f-80b31d02cb38 · outbound

This paper cites AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.

Enterprise Large Language Model Evaluation Benchmark AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.689119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.689119Z digest=sha256:7af5acf9ee5de8a80067bf422776f498cffbe2bfc4d389e2c21bb42fdd91e9e0

Observation 28337c23-44fe-46f3-9c7b-8e6ed0cc1f67 · outbound

This paper cites Large Language Models for Data Annotation and Synthesis: A Survey.

Enterprise Large Language Model Evaluation Benchmark Large Language Models for Data Annotation and Synthesis: A Survey

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.777385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.777385Z digest=sha256:656679e1786f10ffeef1f595a81082823b742a0ec6b29df01e80d9f260ffe1c1

Observation c3dea55e-8b96-4cb9-97c7-39ffa85710e5 · outbound

This paper cites On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey.

Enterprise Large Language Model Evaluation Benchmark On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.834913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.834913Z digest=sha256:31cd0c96e96a39fea65b0fcf1d281dda5a8b7c627d0e2324f73acf8c1afc25d0

Observation 2779ed39-6f83-4b3a-9777-762e05bc2e53 · outbound

This paper cites Comprehensive Exploration of Synthetic Data Generation: A Survey.

Enterprise Large Language Model Evaluation Benchmark Comprehensive Exploration of Synthetic Data Generation: A Survey

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.901945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.901945Z digest=sha256:4db624697903806c0344142f432acde384162bd20e21fd254f8b18d28773b296

Observation 10f2024b-5644-4319-aa21-14e4442a5c3d · outbound

This paper cites Best Practices and Lessons Learned on Synthetic Data.

Enterprise Large Language Model Evaluation Benchmark Best Practices and Lessons Learned on Synthetic Data

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.969986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.969986Z digest=sha256:ca5b8b4ac37b9c7e4afd7c151fc47d162bc45bb828b2296b0acaee3084182c08

Observation f27ffcb3-2c43-4073-842a-4fc88a577f5b · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.055751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.055751Z digest=sha256:7c462aa9c5577ce5720e15e9e2bdf1a53f771025fb326bd7d600c1934c3f9bee

Observation 23d3d0b9-f0db-4648-8fef-8789b05f1e9b · outbound

This paper cites Self-Prompting Large Language Models for Zero-Shot Open-Domain QA.

Enterprise Large Language Model Evaluation Benchmark Self-Prompting Large Language Models for Zero-Shot Open-Domain QA

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:56:39.032496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:33.122478Z digest=sha256:e2fd904455bc5dff6226f3ea9bae2f57194829c8c198fe97c9b59604f32fd4e8

Observation 5a2cbb23-2130-4378-9268-c3eaa9f2f25c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Enterprise Large Language Model Evaluation Benchmark DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.202456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.202456Z digest=sha256:c5dcc10a03f21ee0c8049654be10bd56b756b65a53c90ae7a88431b4db64c0bd

Observation 3080cb20-447a-448d-bb40-8afde03381d6 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.269035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.269035Z digest=sha256:9523c2b6b720f63d09d964b51314b280f09e1f6503972e402829ec8a9d3f8887

Observation bb953800-ef19-4e2d-836e-2652df147c47 · outbound

This paper cites I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm.

Enterprise Large Language Model Evaluation Benchmark I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.340671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.340671Z digest=sha256:c2bb7492848dfed89cc11c8b0c94e18c0019fc2221570f6529c925d6804dfe8b

Observation d579f04e-ef9b-4f6d-8c31-8dd701c90115 · outbound

This paper cites Self-Rewarding Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Rewarding Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.409397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.409397Z digest=sha256:314f5901b9432c5ab9af6ba385daadc8ff1d21bb7a32176467be8665b0051bea

Observation 139a865c-3c99-47d3-bdc5-87120610f228 · outbound

This paper cites West-of-N: Synthetic Preferences for Self-Improving Reward Models.

Enterprise Large Language Model Evaluation Benchmark West-of-N: Synthetic Preferences for Self-Improving Reward Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.472641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.472641Z digest=sha256:10e00be6f7e8ba17b926ac1fcf3fc17285b8644d49c9672040ee90695c3336d5

Observation c95bc744-5fe4-4afd-8009-e645732914b9 · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

Enterprise Large Language Model Evaluation Benchmark Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.549019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.549019Z digest=sha256:0ddd4314c5600d199beb5c85c49fa59770ed7a5cebc108331cb37156b7973f2b

Observation 11769962-4521-4a78-a9fb-7147203d8028 · outbound

This paper cites Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies.

Enterprise Large Language Model Evaluation Benchmark Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.612212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.612212Z digest=sha256:d5282c414887e784f37acc987f4d3d247b885474eaedf54c173e862a42754e2f

Observation 49aad555-c701-4ef5-80e8-962f6355f413 · outbound

This paper cites Leveraging Large Language Models for Multiple Choice Question Answering.

Enterprise Large Language Model Evaluation Benchmark Leveraging Large Language Models for Multiple Choice Question Answering

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.668975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.668975Z digest=sha256:5d61c7dbebcef4959742f82e3bc2b4235fc8702635221bbf383e4757fc542dc3

Observation 18075e64-31c7-42fe-a470-82412368bdc9 · outbound

This paper cites Teaching Models to Express Their Uncertainty in Words.

Enterprise Large Language Model Evaluation Benchmark Teaching Models to Express Their Uncertainty in Words

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.793508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.793508Z digest=sha256:a03d3d0248a2356b6e3baa4f927ecc15258268b979e7a22df456ad2bbc2d97f1

Observation 751f1980-b1fa-4945-b2dd-925e99eee639 · outbound

This paper cites Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,.

Enterprise Large Language Model Evaluation Benchmark Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.873613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.873613Z digest=sha256:a3c012c114fd1548c12b263d56b48577e8976b7f7659ef159a8ac06d03863cd2

Observation 87cfb609-01c4-4750-a836-71ea6394694f · outbound

This paper cites Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely.

Enterprise Large Language Model Evaluation Benchmark Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.954784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.954784Z digest=sha256:8c4198c4f025d253d5d3e92ada51418d4196994439358eeb87f830e3bc330375

Observation b5e3b33e-fcfb-4fc6-981f-52e92037ccf3 · outbound

This paper cites MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation.

Enterprise Large Language Model Evaluation Benchmark MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.045454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.045454Z digest=sha256:2044dd3af6223ea667e54c45d9a904e3763d23ac9e098fb4491238fd0743c74c

Observation 3bb223b9-f6ff-4e39-bc45-c28adff200c8 · outbound

This paper cites Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity.

Enterprise Large Language Model Evaluation Benchmark Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.123277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.123277Z digest=sha256:8fdfb8a730598f8747f69e4091412c37c98460f89964ce8f3003f09781fbc5d9

Observation b02df137-4093-4e14-a4bf-7259a7925728 · outbound

This paper cites Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection.

Enterprise Large Language Model Evaluation Benchmark Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.211230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.211230Z digest=sha256:07c9da19adb7c6814bd1958598c9caeee43d8e9ccc58ee97446f0c7fcc342159

Observation 3896673e-55e5-450b-a4ae-94d15b69afc7 · outbound

This paper cites Self-Knowledge Guided Retrieval Augmentation for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Knowledge Guided Retrieval Augmentation for Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.287298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.287298Z digest=sha256:afcc8330965f2486ae6aac8b889a8c12cf2621c912138a8184def96abdd44545

Observation eee59b13-8eee-4afb-aaac-d1d8f7ddc305 · outbound

This paper cites Making Retrieval-Augmented Language Models Robust to Irrelevant Context.

Enterprise Large Language Model Evaluation Benchmark Making Retrieval-Augmented Language Models Robust to Irrelevant Context

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.381084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.381084Z digest=sha256:f3745c994bcc7a4f1ff480460e68ee604190b5e2e1648803886c68d508c7d2dc

Observation 78d826a8-66a8-442f-9236-448efac74d03 · outbound

This paper cites Search Augmented Instruction Learning,.

Enterprise Large Language Model Evaluation Benchmark Search Augmented Instruction Learning,

Reference 51

Resolution
verified exact
doi, observed 2026-08-06T22:56:38.781049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:34.500769Z digest=sha256:13a41726adba4f006c6b1ff5ba1d502871e27386b464d9a953334a9938d3dcd0

Observation d65dc77f-5b7b-46b8-9715-4b0593eafdd6 · outbound

This paper cites Corrective Retrieval Augmented Generation.

Enterprise Large Language Model Evaluation Benchmark Corrective Retrieval Augmented Generation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.594451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.594451Z digest=sha256:9eff529a2b9af3f80d220ff04dd90faf4a0489bb0daa98a44ab708b98cd05199

Observation 4fdc0035-c199-4ab5-a018-885e7c3b3cd1 · outbound

This paper cites Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge.

Enterprise Large Language Model Evaluation Benchmark Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.674305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.674305Z digest=sha256:adbab02c9c99462a93a65cd80cab692be279e51f0a837cc56187e6f8d21fc347

Observation 506c000c-7813-4bb1-afb3-7e68efabdd04 · outbound

This paper cites LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation.

Enterprise Large Language Model Evaluation Benchmark LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.783848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.783848Z digest=sha256:e0d225945f5d5bea1a0f730c4dc2697bd0bfc3e094bcbee8f6021a062b1892ef

Observation 6b79e00d-3d69-47dd-a684-e6f215c232dd · outbound

This paper cites EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),.

Enterprise Large Language Model Evaluation Benchmark EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.892126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.892126Z digest=sha256:d551a033f7af7c6066ef0b9521c724bb608c8948a01402b727266cc036f36754

Observation 2adcbb2b-ad9c-4e78-9a31-c5ba286a14cf · outbound

This paper cites From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,.

Enterprise Large Language Model Evaluation Benchmark From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.970117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.970117Z digest=sha256:2f4433a0ea8ea33ea5f0b3e4cd453be55a2ef530ddfa9f647fe3bec0a8d6f46a

Observation 2e9102f2-ea1c-4a32-b45b-7953a01a4fe7 · outbound

This paper cites Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges.

Enterprise Large Language Model Evaluation Benchmark Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.063138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.063138Z digest=sha256:78a48b5b7ce028027039d9dc55aa5ac985dcfcff3bd8ed2563bb99dd08260a87

Observation bb5690b6-7ff5-447d-a462-7b390e3e9370 · outbound

This paper cites PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization.

Enterprise Large Language Model Evaluation Benchmark PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.136253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.136253Z digest=sha256:ec61e1f338a9f17ae1615da2613ed33aaaaf1abe42afc3f5972818194da5a926

Observation c167b644-fae9-4b4e-92d4-a899c6265f0a · outbound

This paper cites Evaluating Large Language Models at Evaluating Instruction Following.

Enterprise Large Language Model Evaluation Benchmark Evaluating Large Language Models at Evaluating Instruction Following

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.224892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.224892Z digest=sha256:0c616d7c5168f606920d3f9043aff648829d44bf4b25ba818f0d61c34084f9cb

Observation 2912892d-3c8e-4ef7-ae87-74764814edad · outbound

This paper cites Large Language Models are not Fair Evaluators.

Enterprise Large Language Model Evaluation Benchmark Large Language Models are not Fair Evaluators

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.306523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.306523Z digest=sha256:581033578bd84b2696a033d746e6a97344ed2471dcf4d8f212605ad432b9cad6

Observation 830957ef-80a0-49c4-91f6-9dcb9d56bcfd · outbound

This paper cites RevisEval: Improving LLM-as-a-Judge via Response-Adapted References.

Enterprise Large Language Model Evaluation Benchmark RevisEval: Improving LLM-as-a-Judge via Response-Adapted References

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.381259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.381259Z digest=sha256:24c7fc1c315e039a58634c6118529caf3da3d4f7b2d148eee38b6011d7f73db9

Observation 585fe516-60ce-4817-84f5-f3f725e0c0a8 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

Enterprise Large Language Model Evaluation Benchmark G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.487517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.487517Z digest=sha256:a08a815eb11b2f7b1976ae8393657a1e91e81b5da06659c735a3d803cb688c6a

Observation 5773381e-02e9-499a-b183-8c697cc39ff6 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Enterprise Large Language Model Evaluation Benchmark Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.554583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.554583Z digest=sha256:ce445a3046b315aadfdac610475e6ecfbc46a1a3a9e055dfbfc8fd958172c13e

Observation 4db0726c-e272-4c73-8765-36a3e1716803 · outbound

This paper cites A Survey on Evaluation of Large Language Models.

Enterprise Large Language Model Evaluation Benchmark A Survey on Evaluation of Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.666171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.666171Z digest=sha256:49ad850e09e3306a1637c200e6e7021355dc2d788ece401a441b96883afcbcae

Observation 38e4ebf3-57ab-4589-864d-4d7ac14a32d5 · outbound

This paper cites A Revision of Bloom’s Taxonomy: An Overview,.

Enterprise Large Language Model Evaluation Benchmark A Revision of Bloom’s Taxonomy: An Overview,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.747231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.747231Z digest=sha256:118f43100eae7e628136fe03ceb22cd12b498b599c11c67e7001dc32937db38b

Observation 72f2525d-010e-42d6-ae0a-33d141fcea04 · outbound

This paper cites Bloom’s Taxonomy,.

Enterprise Large Language Model Evaluation Benchmark Bloom’s Taxonomy,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.835468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.835468Z digest=sha256:a36b15854091b712917b4c2f3f1848c03ca2274703e0dcb9ee81da3993e12e73

Observation 86e53d7c-5187-4191-b5ce-34ccb0d64f6b · outbound

This paper cites Confluence.

Enterprise Large Language Model Evaluation Benchmark Confluence

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.915905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.915905Z digest=sha256:dc9dc48d6b41d2e77e4ca6d87b00210c2835745f51335638e9b2a0e4c2f0e244

Observation 46327f36-fe8a-466c-8d28-e594c65326f8 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.964164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.964164Z digest=sha256:4052be0247d61c08a143391efca0b38ec0cac8b0fa359ec718e701d180454190

Observation 1d2dbb9d-74a1-44c4-80ac-6d1e777b1a40 · outbound

This paper cites Paraphrase Mining — Sentence Transformers documentation.

Enterprise Large Language Model Evaluation Benchmark Paraphrase Mining — Sentence Transformers documentation

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.038525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.038525Z digest=sha256:52b927d0576ee9255c1d67165f018a81b6f62bc823e622fab7f4766d0b1b3e70

Observation 18b27fb4-82a0-4593-b28e-af65f5e1d480 · outbound

This paper cites GPT-4 Technical Report.

Enterprise Large Language Model Evaluation Benchmark GPT-4 Technical Report

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.198741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.198741Z digest=sha256:ea098c75c9da617947592c2174d7aca56207830687136b58f645b3cdfa721449

Observation 089737ed-e306-4e46-a3ca-cbaf44920980 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.250422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.250422Z digest=sha256:8beea14b488eb2bb5c0f2e406c538649b4c9b03be840bef1505ae5dbf87a44d4

Observation 9ad23cb7-dbf2-4129-aa3e-5d74544709f0 · outbound

This paper cites LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI.

Enterprise Large Language Model Evaluation Benchmark LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.315106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.315106Z digest=sha256:bcc7dd20d0707ceb22e6229247d15914d1ee46decf92b286becad8409dc5822a

Observation cf5c50a2-fd44-403a-b187-7191d155b612 · outbound

This paper cites Bleu: a Method for Automatic Evaluation of Machine Translation,.

Enterprise Large Language Model Evaluation Benchmark Bleu: a Method for Automatic Evaluation of Machine Translation,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.395797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.395797Z digest=sha256:aeaa342fc5a0f8ab6d0b308bb88267f9698878cc0b5ab2108de8dab005f4ae53

Observation b630f755-e53b-4170-92bd-7e9b50a473a6 · outbound

This paper cites ROUGE:APackageforAutomaticEvaluationofSummaries,.

Enterprise Large Language Model Evaluation Benchmark ROUGE:APackageforAutomaticEvaluationofSummaries,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.493280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.493280Z digest=sha256:f6f9d8e4c29b354c93a54af68aa1df49236019d52867ae48accd3e309eb82729

Observation 8c5a74c5-a64b-458c-b74e-ff1663f8583a · outbound

This paper cites BLEU is Not Suitable for the Evaluation of Text Simplification,.

Enterprise Large Language Model Evaluation Benchmark BLEU is Not Suitable for the Evaluation of Text Simplification,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.620781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.620781Z digest=sha256:dd00523c65b5b7e54308018a39282906771e6c84446b5621283d4f87262f0c5c

Observation 8a80553d-6cf4-42e1-b187-e7343f5001b0 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

Enterprise Large Language Model Evaluation Benchmark BERTScore: Evaluating Text Generation with BERT

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.720000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.720000Z digest=sha256:f1d558ef1e2a1d872b9b12ce4ca145359dbff7d2aa90e7e1e31fe19489bc9124

Observation 684f0aa2-8018-4b07-b488-696038a83d3a · outbound

This paper cites BARTScore: Evaluating Generated Text as Text Generation.

Enterprise Large Language Model Evaluation Benchmark BARTScore: Evaluating Generated Text as Text Generation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.789128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.789128Z digest=sha256:91e38572db9d8b58e2e5ba57f632af7a1aa867954ee8a403ecad44bda7408657

Observation e44ed20f-142a-4064-93a1-b9575306b251 · outbound

This paper cites LLM-based NLG Evaluation: Current Status and Challenges.

Enterprise Large Language Model Evaluation Benchmark LLM-based NLG Evaluation: Current Status and Challenges

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.905484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.905484Z digest=sha256:b81c20ba04b5bce9e3b38faa715ac911671f143529ab3f038edfc24d10ba91d6

Observation 8f5e9a53-28fc-494a-b246-5746ac0c8b23 · outbound

This paper cites ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning.

Enterprise Large Language Model Evaluation Benchmark ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.982426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.982426Z digest=sha256:a16bbe548316a135da80f8cbb1f393caf006c383791f61008f63d21f7594231d

Observation f4e1cc66-fff6-4764-9e7c-c52b7b34ad10 · outbound

This paper cites ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,.

Enterprise Large Language Model Evaluation Benchmark ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.051830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.051830Z digest=sha256:b0d751a58fc27269283d831b710398fbfeff840a7f9b3a306f78b60939875864

Observation 11f977b2-5018-4b10-ac06-6977040725fa · outbound

This paper cites ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,.

Enterprise Large Language Model Evaluation Benchmark ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.176977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.176977Z digest=sha256:34ccd72f786cc35a7989ca654b8c5241bf1835956c851001319fd40afb88b7db

Observation c4a18303-5f35-43f6-b77c-6932dd65f3fd · outbound

This paper cites ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness.

Enterprise Large Language Model Evaluation Benchmark ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness

Reference 83

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:56:38.425927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.255627Z digest=sha256:1df95a14a0f7b62c9f1cd28a75f89eb347e00e1e6ec2386529fd8d6bf9b1ef4f

Observation aa05dce6-174c-49f4-b14b-12cfb2f233ba · outbound

This paper cites 30, 2024.

Enterprise Large Language Model Evaluation Benchmark 30, 2024

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.367742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.367742Z digest=sha256:7809ab5a007fe4dbb9eca38493758bc86f54bfb120e49c7db71faa30b475d198

Observation 527bb0bd-efe9-4575-9c3f-37f1351c591c · outbound

This paper cites Toxicity.

Enterprise Large Language Model Evaluation Benchmark Toxicity

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:41.053684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.459003Z digest=sha256:49e394f325071a0871f0b6cb7a05bfb0dd0b4967d59facc379dcf7cad3a2adc7

Observation c325eaa4-213a-464d-861e-286a8aebfbfc · outbound

This paper cites 29, 2024.

Enterprise Large Language Model Evaluation Benchmark 29, 2024

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.828319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.539722Z digest=sha256:b816e94d7fef7b45c0a5c36b2d960a2f6f2a3ecdc909bd296d5c7f4b93a59bb3

Observation b11d65e7-f995-402c-8ecc-f316cf02f38a · outbound

This paper cites Hallucination.

Enterprise Large Language Model Evaluation Benchmark Hallucination

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.638498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.632673Z digest=sha256:4983bdd410323fe5bbcf34599cb58559b388e19635d32b488fadec09a65761c3

Observation b80432e5-4c9f-4d81-93ac-861219ef2bbe · outbound

This paper cites Spearman’s rank correlation coefficient,.

Enterprise Large Language Model Evaluation Benchmark Spearman’s rank correlation coefficient,

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.486401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.712094Z digest=sha256:9c6d3fa0b42c4425fe7d906e6a1f49f72304c17f63df737a7c26f37093b302b7

Observation 68a7b921-f1ae-4c99-9c67-dec9f938cef5 · outbound

This paper cites Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,.

Enterprise Large Language Model Evaluation Benchmark Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.318963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.849046Z digest=sha256:fd3b15b0f31ad0ab6e8f35f3509a795135e34ed45b7982f93065e00a9a0460ab

Observation 99149d66-b16d-4746-b82c-d479a7faab87 · outbound

This paper cites LLaMA 3.3,.

Enterprise Large Language Model Evaluation Benchmark LLaMA 3.3,

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.180796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:37.933498Z digest=sha256:3a33d753e2f07904b0bb24cdcf082df9b32dce0e0749a5d8a9f50a1b0f46abb2

Observation f4985e23-4100-45a8-807b-7053c4c0bbbc · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,.

Enterprise Large Language Model Evaluation Benchmark The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.029006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:38.011275Z digest=sha256:83b485e6e58ad95711ad6f78ce8ecbfd0d56fc7780c208f181d0416090cbe0ab

Observation 899a27e9-f9fa-47c0-a575-8ab80fa01051 · outbound

This paper cites Qwen2.5 Technical Report.

Enterprise Large Language Model Evaluation Benchmark Qwen2.5 Technical Report

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:38.092131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:38.092131Z digest=sha256:8671e94ee0dc45b2761fa150f8c8dbef96db998de0d91e928e1758dbfc211dae

Observation e8087ad6-47ac-4231-a96a-0f83174f9110 · outbound

This paper cites The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks.

Enterprise Large Language Model Evaluation Benchmark The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:38.165147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:38.165147Z digest=sha256:c8eaa5d5574b6e8a51a57cb68a1a3edbd1a03fff8b780a9e4d87173d3179bd2d

Observation 90c5c1cc-d775-477e-a72f-2e845f4c4ce9 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 94

Resolution
unresolved
raw_fallback, observed 2026-08-06T22:56:39.900943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:38.244953Z digest=sha256:deaded91ee5b4c2b5b30312f8d248307d1f276f1955a387f7c43aba35e07aac6

Observation 79aebb99-6b79-4ce5-a16c-b80d5c7d3f40 · outbound

This paper cites This method has been incorporated into the DeepEval package [72].

Enterprise Large Language Model Evaluation Benchmark This method has been incorporated into the DeepEval package [72]

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:39.775138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T22:56:38.270220Z digest=sha256:0c798cc3e9d89343691891e2809816a91952a58dac130b213b684588abaf26dd

Observation 24b3ca47-ad68-4b1e-82ab-f56a432a0b7e · outbound

This paper cites Available: https://sbert.net/examples/applications/paraphrase-mining/README.html.

Enterprise Large Language Model Evaluation Benchmark Available: https://sbert.net/examples/applications/paraphrase-mining/README.html

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.111401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.111401Z digest=sha256:20df3e4437dd4e6772675b93f2ef5f7b0a43b7c568f9a56d4bdea6deb43aaaeb

Pith citing papers

Observation a25457eb-cdac-441f-9f2e-0abbe541a5f3 · inbound

Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers cites this paper.

Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers Enterprise Large Language Model Evaluation Benchmark

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T15:35:22.448174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:35:22.448174Z digest=sha256:53780af66c690e0d9d6065f9ab5eae4f8d21934e54762da412812f43b4bfa1fb

Observation a7252636-13b0-4af4-bb2e-54afe157cff0 · inbound

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems cites this paper.

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems Enterprise Large Language Model Evaluation Benchmark

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-11T04:37:48.225034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-11T04:31:30.304599Z digest=sha256:7804d82b7be48a812a3e67977adedc6bfd0965e61a96a16078922abd6a1fa7cf

Observation c4c7a638-5768-48f9-aafa-92c553d67644 · inbound

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning cites this paper.

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T21:31:51.354468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T21:31:51.354468Z digest=sha256:913d02f2a7aa47e17080459591cb66f18ea698325a3288f2dc35adce8c558ed0

Observation ef1b3020-0499-453e-9b27-624dbdd4423f · inbound

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning cites this paper.

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T00:49:50.800327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T00:49:50.800327Z digest=sha256:84ae7dac642622e1b8c9940663a4625c9cbfcc0645ab092eea61e311aea5e72b