Pith. sign in

Paper Citation Record · LEDGER

Enterprise Large Language Model Evaluation Benchmark

As of 13 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 4 inbound Pith citation observations for arXiv:2506.20274.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.20274 v1

Coverage vector

measured 95 of 95 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T22:56:38.270220Z

measured 99 of 99 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:35:22.448174Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-11T04:37:48.221956Z

Reference resolution

95 of 95 outbound references displayed

  • verified exact4
  • verified fuzzy8
  • unresolved83
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1d26afb3-7c65-45cf-af7f-f3d6a4f49515 · outbound

This paper cites AutoBencher: Towards Declarative Benchmark Construction.

Enterprise Large Language Model Evaluation Benchmark AutoBencher: Towards Declarative Benchmark Construction

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.682305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.682305Z digest=sha256:1e6f6285b997e3905f0cfa97e7e209db37cff374c17ff8a677227107e99589cd

Observation c6a15c97-fa48-4dbc-9ddf-8c498d482acb · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Enterprise Large Language Model Evaluation Benchmark Measuring Massive Multitask Language Understanding

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.775105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.775105Z digest=sha256:65aadf271f0ea2a504b885708097d98ee5b6739fef582ab51b0dd565d507d4ca

Observation 3533b566-c2bd-409a-bdab-a4e8118de933 · outbound

This paper cites Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models.

Enterprise Large Language Model Evaluation Benchmark Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.868056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.868056Z digest=sha256:23c8a64aaf6fb00f74f042e81144331b7a2004b85c3c91ed5400c40d11aff415

Observation 14870780-827b-4017-abfd-0c0bcb9f89e8 · outbound

This paper cites On the Measure of Intelligence.

Enterprise Large Language Model Evaluation Benchmark On the Measure of Intelligence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:30.935899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:30.935899Z digest=sha256:1536081857331045ed41758b3d3581a1aa8077f2372b01153f317dc9906696a4

Observation d4c7ccc0-ea19-4d32-8541-39d64b58b2c4 · outbound

This paper cites Holistic Evaluation of Language Models.

Enterprise Large Language Model Evaluation Benchmark Holistic Evaluation of Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.015321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.015321Z digest=sha256:0c57807ce2d638dfc85778d85a313f0e54227a594cf6dff226cd2beb46bca85d

Observation 13bc31fc-f521-45a7-b742-77be8b929ce6 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Enterprise Large Language Model Evaluation Benchmark Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.088687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.088687Z digest=sha256:f771dd6bce387986b854011e5893d9f9c0ecfe437974e613da244bd38c731631

Observation 95a207cb-5792-4b9d-897f-3cfd1bc98123 · outbound

This paper cites What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams.

Enterprise Large Language Model Evaluation Benchmark What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.178017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.178017Z digest=sha256:1b9f37ef7147d89dfae18342a0eab1af147957bff95f68f4a7c158f6b4eab7e8

Observation 3fab65a6-a87f-47b2-9c49-e0a52a4737b1 · outbound

This paper cites MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,.

Enterprise Large Language Model Evaluation Benchmark MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,

Reference 8

Resolution
verified exact
doi, observed 2026-08-06T22:56:39.440489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:31.268371Z digest=sha256:c851259f5e2ff9344533aec49b57ef6ad145db54e3bf856e641e606df200e5ae

Observation 133620ab-795b-4615-978d-344bff241c31 · outbound

This paper cites MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering.

Enterprise Large Language Model Evaluation Benchmark MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.339236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.339236Z digest=sha256:478af5df47714f7430c4688eb9ffb5f1b71272bc14fc8f922878c1dc7940843a

Observation 50a3937c-3f72-4d2b-a6e3-f365929ce04a · outbound

This paper cites WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation.

Enterprise Large Language Model Evaluation Benchmark WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.407399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.407399Z digest=sha256:00fca42e80ce493b0fcd65a3c10c5ebf8635361b9be2f1ace2dba407c98f2ef5

Observation 64bb560a-523f-47bf-b193-92442c6303a7 · outbound

This paper cites PubMedQA:ADatasetforBiomedicalResearch Question Answering,.

Enterprise Large Language Model Evaluation Benchmark PubMedQA:ADatasetforBiomedicalResearch Question Answering,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.496753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.496753Z digest=sha256:4326925e21322d4aad60a9a8f2446f89c4ca59c2a887c1b39e8071ae9153bbae

Observation 29b04a36-3183-401a-9980-2e31a5a015ba · outbound

This paper cites CMB: A Comprehensive Medical Benchmark in Chinese.

Enterprise Large Language Model Evaluation Benchmark CMB: A Comprehensive Medical Benchmark in Chinese

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.572070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.572070Z digest=sha256:2cce91fc69edbead7cc1c3964297dfb3d732f57e85683e9194b3bd3b6dea8d0c

Observation 808de6df-1352-4d5b-8f3c-b91a92e3faab · outbound

This paper cites FinBen: A Holistic Financial Benchmark for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark FinBen: A Holistic Financial Benchmark for Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.645688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.645688Z digest=sha256:8c3afa08965f3e1717db7c5755c4fc909960e1bae54b510ceadbbacd3dd876a1

Observation 6ac76429-9aac-4f48-a940-fcf3674db5d0 · outbound

This paper cites FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.714437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.714437Z digest=sha256:822a0e36da11c2bff34ac7e0daa18b451a13bd1509dc911695a35c67e5632df7

Observation 9e6287b6-52fe-4e2e-ad5a-024229d2e6e8 · outbound

This paper cites WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain.

Enterprise Large Language Model Evaluation Benchmark WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.776768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.776768Z digest=sha256:144528aafd99bdbf7f72beb57dbb0212114184d95041ba0c93473b428aacb1c8

Observation 3d95e4e9-f96e-43c7-a6e9-2e31fb50e29c · outbound

This paper cites BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark.

Enterprise Large Language Model Evaluation Benchmark BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.843525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.843525Z digest=sha256:15c3c8392b02cc4378ff0baeb095f2d0159db3cf29972cf81611155d7a20a6f9

Observation 9facde69-b28d-44f8-a3bc-1d3a07f30978 · outbound

This paper cites XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters.

Enterprise Large Language Model Evaluation Benchmark XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.910853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.910853Z digest=sha256:8281edff83f620d475861ed24e885563248064b96df157d5880c4cc80d1c62c5

Observation 015cc8c0-345c-45d6-8f7a-578d5c23c810 · outbound

This paper cites PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance.

Enterprise Large Language Model Evaluation Benchmark PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:31.976188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:31.976188Z digest=sha256:c1482fef644aa0a632fb48e2db024d4f715f14bbf4eb1d546edf18529a0e7cc9

Observation 347076fd-8cd8-417d-a8ac-74666d142968 · outbound

This paper cites LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,.

Enterprise Large Language Model Evaluation Benchmark LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.063517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.063517Z digest=sha256:5ccfac91388544845bb82722436030fc3032c0daa0fab1d1ad561517f46d60df

Observation 6df36f35-623e-40c6-8368-97f94e36972a · outbound

This paper cites A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction.

Enterprise Large Language Model Evaluation Benchmark A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.171821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.171821Z digest=sha256:ddca90641b83f581a53288066666f6aee9c0addbf67461a9493fb1d2245e4d64

Observation 0c23ae7a-5ba5-4c5b-8fa2-fd50e0ddb26d · outbound

This paper cites LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models.

Enterprise Large Language Model Evaluation Benchmark LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.246086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.246086Z digest=sha256:dd184e97d745435b1e249df2a5360e6c634ed583a20d999f494535d2de0f88e4

Observation 22779890-ffe0-482e-977c-a20e2120b210 · outbound

This paper cites LawBench: Benchmarking Legal Knowledge of Large Language Models.

Enterprise Large Language Model Evaluation Benchmark LawBench: Benchmarking Legal Knowledge of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.291657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.291657Z digest=sha256:f521c7a36e9dc6aacdbde35eb9eed75dba66fc554871f45f392e04f10bf2d778

Observation fd3d96f8-d9ed-4523-ad50-6c26dd1cbdd1 · outbound

This paper cites CMMLU: Measuring massive multitask language understanding in Chinese.

Enterprise Large Language Model Evaluation Benchmark CMMLU: Measuring massive multitask language understanding in Chinese

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.344640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.344640Z digest=sha256:00c5fac2654617954d1dd6fb138edeb3be60f2bbb6eb731d06a67481d825da13

Observation b86644a4-87fc-48f9-8936-06d9325cf7b7 · outbound

This paper cites Evaluating the Performance of Large Language Models on GAOKAO Benchmark.

Enterprise Large Language Model Evaluation Benchmark Evaluating the Performance of Large Language Models on GAOKAO Benchmark

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.401251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.401251Z digest=sha256:076553d3a8aacd32da8afdac1474cd2e48ac1be6bd26d19714d016e94e7473f5

Observation 18399b1f-3b3e-4e5f-ba14-dd2a9e07f63e · outbound

This paper cites C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models.

Enterprise Large Language Model Evaluation Benchmark C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.480672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.480672Z digest=sha256:3ad8bcf3bc37758a3ad3c079fe373cac04d4459b0eb355d04fe41623ff54699c

Observation 52654b07-9443-4d22-9af5-fcda18c54227 · outbound

This paper cites Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,.

Enterprise Large Language Model Evaluation Benchmark Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.551128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.551128Z digest=sha256:cdca923fb48020beffdb0be86fed15ef34aacdeece5e326a41e1cc5799906b4d

Observation b12a7ce0-23cb-4a3a-8113-06fea8de0083 · outbound

This paper cites M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models.

Enterprise Large Language Model Evaluation Benchmark M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.619412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.619412Z digest=sha256:be634eb0c32f2c0ad42486e48d9d39bddd13332f1b4ffd526166093b53c609e5

Observation dcb23d56-9a47-4491-989f-80b31d02cb38 · outbound

This paper cites AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.

Enterprise Large Language Model Evaluation Benchmark AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.689119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.689119Z digest=sha256:a76491f7a08c79d7f5fae8c2882f7a7e8a17733832195f3de13d358f66347963

Observation 28337c23-44fe-46f3-9c7b-8e6ed0cc1f67 · outbound

This paper cites Large Language Models for Data Annotation and Synthesis: A Survey.

Enterprise Large Language Model Evaluation Benchmark Large Language Models for Data Annotation and Synthesis: A Survey

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.777385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.777385Z digest=sha256:57f02acc04525fa95be7b10bdbfc0b29537f197e2026d5ef81e10323a7d5931b

Observation c3dea55e-8b96-4cb9-97c7-39ffa85710e5 · outbound

This paper cites On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey.

Enterprise Large Language Model Evaluation Benchmark On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.834913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.834913Z digest=sha256:8640a3131a0149b32ade20080902d7d1e82bfb0b7ca5427856bfaca3ad74b065

Observation 2779ed39-6f83-4b3a-9777-762e05bc2e53 · outbound

This paper cites Comprehensive Exploration of Synthetic Data Generation: A Survey.

Enterprise Large Language Model Evaluation Benchmark Comprehensive Exploration of Synthetic Data Generation: A Survey

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.901945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.901945Z digest=sha256:373e67690f63b5d54ca305c1c7d2f8e7cdee32e337f5f910c82e243d2d1c8326

Observation 10f2024b-5644-4319-aa21-14e4442a5c3d · outbound

This paper cites Best Practices and Lessons Learned on Synthetic Data.

Enterprise Large Language Model Evaluation Benchmark Best Practices and Lessons Learned on Synthetic Data

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:32.969986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:32.969986Z digest=sha256:10aa4f959b3e8dbb8fc63f251340fd40e1be1a47ce7144ff5738dca1dc9d3d86

Observation f27ffcb3-2c43-4073-842a-4fc88a577f5b · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.055751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.055751Z digest=sha256:d1be78c40417217e777d4737cbec28eb0e63169ce65a4dd61f3af4c151d60641

Observation 23d3d0b9-f0db-4648-8fef-8789b05f1e9b · outbound

This paper cites Self-Prompting Large Language Models for Zero-Shot Open-Domain QA.

Enterprise Large Language Model Evaluation Benchmark Self-Prompting Large Language Models for Zero-Shot Open-Domain QA

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:56:39.032496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:33.122478Z digest=sha256:fc4eeb51505ba50e979f07b541eb5dbf5c9e6fc1ddf04ca8dadc8edbf2bb120d

Observation 5a2cbb23-2130-4378-9268-c3eaa9f2f25c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Enterprise Large Language Model Evaluation Benchmark DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.202456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.202456Z digest=sha256:31e429820794624ca210ca1d5d980dee7f08b7444f35005b118eb7190ca2af68

Observation 3080cb20-447a-448d-bb40-8afde03381d6 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.269035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.269035Z digest=sha256:fdededbb86504a68bebbb3eb6545023a025eb7d7b69ee68b164b2c074aa4539d

Observation bb953800-ef19-4e2d-836e-2652df147c47 · outbound

This paper cites I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm.

Enterprise Large Language Model Evaluation Benchmark I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.340671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.340671Z digest=sha256:e955fdcddb341548e2d4ccdf78c80ee9bebe773ec427c9861e33d621d16857d4

Observation d579f04e-ef9b-4f6d-8c31-8dd701c90115 · outbound

This paper cites Self-Rewarding Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Rewarding Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.409397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.409397Z digest=sha256:11218216dffd85a5488de7baf4fa8ec06a95b7d272ad4bb6fbb06e0c8b91a6c4

Observation 139a865c-3c99-47d3-bdc5-87120610f228 · outbound

This paper cites West-of-N: Synthetic Preferences for Self-Improving Reward Models.

Enterprise Large Language Model Evaluation Benchmark West-of-N: Synthetic Preferences for Self-Improving Reward Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.472641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.472641Z digest=sha256:77c512143fefb6842b5e9decfaf326dd9bcea2a47c4181390de808a0ce301af3

Observation c95bc744-5fe4-4afd-8009-e645732914b9 · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

Enterprise Large Language Model Evaluation Benchmark Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.549019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.549019Z digest=sha256:1a1b9e8ac54ed285bbace61b2b86c81f2bd92de83086e9926538600974190f3f

Observation 11769962-4521-4a78-a9fb-7147203d8028 · outbound

This paper cites Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies.

Enterprise Large Language Model Evaluation Benchmark Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.612212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.612212Z digest=sha256:af7b87dd7087d731c34972643e04abf48a8c54f8b293b047e0b6293ead50d44e

Observation 49aad555-c701-4ef5-80e8-962f6355f413 · outbound

This paper cites Leveraging Large Language Models for Multiple Choice Question Answering.

Enterprise Large Language Model Evaluation Benchmark Leveraging Large Language Models for Multiple Choice Question Answering

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.668975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.668975Z digest=sha256:89b823901494cc68bb94960b1f143ba5bffa363cf344cb7c2d609c426abd4ad5

Observation 18075e64-31c7-42fe-a470-82412368bdc9 · outbound

This paper cites Teaching Models to Express Their Uncertainty in Words.

Enterprise Large Language Model Evaluation Benchmark Teaching Models to Express Their Uncertainty in Words

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.793508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.793508Z digest=sha256:37a9f104189749518f57007899ac4cee21854d64d7eab202a22c2c7d12049a81

Observation 751f1980-b1fa-4945-b2dd-925e99eee639 · outbound

This paper cites Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,.

Enterprise Large Language Model Evaluation Benchmark Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.873613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.873613Z digest=sha256:f8f75cc0645996dc696be38bd95ffd46d12e370797e7c1ba241bb4bd64db1546

Observation 87cfb609-01c4-4750-a836-71ea6394694f · outbound

This paper cites Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely.

Enterprise Large Language Model Evaluation Benchmark Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:33.954784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:33.954784Z digest=sha256:64055f198b06f241baa83a1da6b2360b80975fe038188f2502f139959bddb606

Observation b5e3b33e-fcfb-4fc6-981f-52e92037ccf3 · outbound

This paper cites MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation.

Enterprise Large Language Model Evaluation Benchmark MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.045454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.045454Z digest=sha256:a45d5f2fcafdd6f82d8a8b23abf5bfa604c7ad89f0588a293941801370f92b10

Observation 3bb223b9-f6ff-4e39-bc45-c28adff200c8 · outbound

This paper cites Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity.

Enterprise Large Language Model Evaluation Benchmark Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.123277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.123277Z digest=sha256:70a8e265673dc561cf38a90053de6a1c04c4711057f7fd9c11b466dd600249f0

Observation b02df137-4093-4e14-a4bf-7259a7925728 · outbound

This paper cites Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection.

Enterprise Large Language Model Evaluation Benchmark Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.211230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.211230Z digest=sha256:4f5411f00ee85fc73cf150dc59294d7c5edc7f764e3b95bd3c35f5072803a5cc

Observation 3896673e-55e5-450b-a4ae-94d15b69afc7 · outbound

This paper cites Self-Knowledge Guided Retrieval Augmentation for Large Language Models.

Enterprise Large Language Model Evaluation Benchmark Self-Knowledge Guided Retrieval Augmentation for Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.287298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.287298Z digest=sha256:6feb1fd4e5b884ffded7a767ff3b3a3243d3a3c817f97edeb5e90c2d4272a893

Observation eee59b13-8eee-4afb-aaac-d1d8f7ddc305 · outbound

This paper cites Making Retrieval-Augmented Language Models Robust to Irrelevant Context.

Enterprise Large Language Model Evaluation Benchmark Making Retrieval-Augmented Language Models Robust to Irrelevant Context

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.381084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.381084Z digest=sha256:a52efba8849209fdda2333a5eecae8e9a3e4fd5520a0deff6659e883fdab1d3c

Observation 78d826a8-66a8-442f-9236-448efac74d03 · outbound

This paper cites Search Augmented Instruction Learning,.

Enterprise Large Language Model Evaluation Benchmark Search Augmented Instruction Learning,

Reference 51

Resolution
verified exact
doi, observed 2026-08-06T22:56:38.781049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:34.500769Z digest=sha256:913dd349f3163d27ee7bd0d1a79e31f59f7f2fc2216c0f871e395ff9acd7ddd7

Observation d65dc77f-5b7b-46b8-9715-4b0593eafdd6 · outbound

This paper cites Corrective Retrieval Augmented Generation.

Enterprise Large Language Model Evaluation Benchmark Corrective Retrieval Augmented Generation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.594451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.594451Z digest=sha256:bcce8d16ac9457652c8509cae06b325383c9617c066a8477abeaa33138f54d70

Observation 4fdc0035-c199-4ab5-a018-885e7c3b3cd1 · outbound

This paper cites Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge.

Enterprise Large Language Model Evaluation Benchmark Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.674305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.674305Z digest=sha256:55abd1d7d5f4676819eba0b18b6a7ade4700e7c5f6567453a270409d6d5fc190

Observation 506c000c-7813-4bb1-afb3-7e68efabdd04 · outbound

This paper cites LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation.

Enterprise Large Language Model Evaluation Benchmark LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.783848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.783848Z digest=sha256:42764a2d89b5076db053fc3c9c2195c066af30099d616e43f75df7f4532c4828

Observation 6b79e00d-3d69-47dd-a684-e6f215c232dd · outbound

This paper cites EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),.

Enterprise Large Language Model Evaluation Benchmark EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.892126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.892126Z digest=sha256:497786f4fe0297b007d010279b024bb35bfe6f6650e5cf602076b2a42d0d7588

Observation 2adcbb2b-ad9c-4e78-9a31-c5ba286a14cf · outbound

This paper cites From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,.

Enterprise Large Language Model Evaluation Benchmark From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:34.970117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:34.970117Z digest=sha256:863bb7ab6fa8ca856484f730271edf48eb03a8c3c2fa37e5ab58f3194d02e3b4

Observation 2e9102f2-ea1c-4a32-b45b-7953a01a4fe7 · outbound

This paper cites Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges.

Enterprise Large Language Model Evaluation Benchmark Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.063138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.063138Z digest=sha256:13b3f17a36982bb3635e51cefe220abc654d7d19f5a59ab7350cd6a11ece26b0

Observation bb5690b6-7ff5-447d-a462-7b390e3e9370 · outbound

This paper cites PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization.

Enterprise Large Language Model Evaluation Benchmark PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.136253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.136253Z digest=sha256:36d95243a0423730f20e14530c6fc55388f0453410459dc136878c26c86e7fc5

Observation c167b644-fae9-4b4e-92d4-a899c6265f0a · outbound

This paper cites Evaluating Large Language Models at Evaluating Instruction Following.

Enterprise Large Language Model Evaluation Benchmark Evaluating Large Language Models at Evaluating Instruction Following

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.224892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.224892Z digest=sha256:d7d675f8336c2758e2d34e92b2ce032cc9e491d4364291d7e8dc3e287c4d007b

Observation 2912892d-3c8e-4ef7-ae87-74764814edad · outbound

This paper cites Large Language Models are not Fair Evaluators.

Enterprise Large Language Model Evaluation Benchmark Large Language Models are not Fair Evaluators

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.306523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.306523Z digest=sha256:ca8f348320701d860dc9ec9727e67271f7e692eb58d4407cd1fa237af0d94c66

Observation 830957ef-80a0-49c4-91f6-9dcb9d56bcfd · outbound

This paper cites RevisEval: Improving LLM-as-a-Judge via Response-Adapted References.

Enterprise Large Language Model Evaluation Benchmark RevisEval: Improving LLM-as-a-Judge via Response-Adapted References

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.381259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.381259Z digest=sha256:a651a9aa60d7acbcb6322014f886acd742889b7f1ce96b4f8acddd77b887f139

Observation 585fe516-60ce-4817-84f5-f3f725e0c0a8 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

Enterprise Large Language Model Evaluation Benchmark G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.487517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.487517Z digest=sha256:d8db2b9d2f261a268a5b95913d84b29a54bc7ac28ad9e4e24267a77eba7f4c66

Observation 5773381e-02e9-499a-b183-8c697cc39ff6 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Enterprise Large Language Model Evaluation Benchmark Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.554583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.554583Z digest=sha256:41b5af065ba18340c818d6827eb71934b8f2cad023b7395a113c2515534056e3

Observation 4db0726c-e272-4c73-8765-36a3e1716803 · outbound

This paper cites A Survey on Evaluation of Large Language Models.

Enterprise Large Language Model Evaluation Benchmark A Survey on Evaluation of Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.666171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.666171Z digest=sha256:3c7f858c6f7bc5b104383e393b74dc8164c8388e24f834320f9f946a31b6569c

Observation 38e4ebf3-57ab-4589-864d-4d7ac14a32d5 · outbound

This paper cites A Revision of Bloom’s Taxonomy: An Overview,.

Enterprise Large Language Model Evaluation Benchmark A Revision of Bloom’s Taxonomy: An Overview,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.747231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.747231Z digest=sha256:1bc52fe8fac32c1c5c49124b3361020c0f4fc1340af1992b0b0ae8fe208f1f5e

Observation 72f2525d-010e-42d6-ae0a-33d141fcea04 · outbound

This paper cites Bloom’s Taxonomy,.

Enterprise Large Language Model Evaluation Benchmark Bloom’s Taxonomy,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.835468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.835468Z digest=sha256:0d3293b110c54c5cc77f86b77062f3f162048cc987a1411003380f871f7c45d6

Observation 86e53d7c-5187-4191-b5ce-34ccb0d64f6b · outbound

This paper cites Confluence.

Enterprise Large Language Model Evaluation Benchmark Confluence

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.915905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.915905Z digest=sha256:e7a55847872cafcd6b47359b7cb55299cac3a11d8d1b1f266755c031e22628ad

Observation 46327f36-fe8a-466c-8d28-e594c65326f8 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:35.964164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:35.964164Z digest=sha256:8201c18762b9359f4fd8aad0741fc21f17d960ed65f65d526691f7461e0d8b38

Observation 1d2dbb9d-74a1-44c4-80ac-6d1e777b1a40 · outbound

This paper cites Paraphrase Mining — Sentence Transformers documentation.

Enterprise Large Language Model Evaluation Benchmark Paraphrase Mining — Sentence Transformers documentation

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.038525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.038525Z digest=sha256:325c18af55ec61e54b1b858b6c963428dd099fb299bb623b4a0e95b1d2c574ac

Observation 18b27fb4-82a0-4593-b28e-af65f5e1d480 · outbound

This paper cites GPT-4 Technical Report.

Enterprise Large Language Model Evaluation Benchmark GPT-4 Technical Report

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.198741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.198741Z digest=sha256:e9746f078a25b1e68345eb262373f8317a4d1422ee6962ccd42d72a1fb400f17

Observation 089737ed-e306-4e46-a3ca-cbaf44920980 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.250422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.250422Z digest=sha256:40021ac02b432b89305301fa74c0f542e61fa2ef31e28b977c4f0d1558a8812e

Observation 9ad23cb7-dbf2-4129-aa3e-5d74544709f0 · outbound

This paper cites LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI.

Enterprise Large Language Model Evaluation Benchmark LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.315106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.315106Z digest=sha256:89834e6319e6533f6a072e378cb30c570f2eb64846a2161b9ebc57f330b3442a

Observation cf5c50a2-fd44-403a-b187-7191d155b612 · outbound

This paper cites Bleu: a Method for Automatic Evaluation of Machine Translation,.

Enterprise Large Language Model Evaluation Benchmark Bleu: a Method for Automatic Evaluation of Machine Translation,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.395797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.395797Z digest=sha256:4a6ebf117d148910ad4395afa67e6515ab83c66be8662bda286a65d32fc33183

Observation b630f755-e53b-4170-92bd-7e9b50a473a6 · outbound

This paper cites ROUGE:APackageforAutomaticEvaluationofSummaries,.

Enterprise Large Language Model Evaluation Benchmark ROUGE:APackageforAutomaticEvaluationofSummaries,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.493280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.493280Z digest=sha256:ff97f5b7d4a36037dea75940dd05a5a1501b2baff77c871324c03463624582a3

Observation 8c5a74c5-a64b-458c-b74e-ff1663f8583a · outbound

This paper cites BLEU is Not Suitable for the Evaluation of Text Simplification,.

Enterprise Large Language Model Evaluation Benchmark BLEU is Not Suitable for the Evaluation of Text Simplification,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.620781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.620781Z digest=sha256:90cba59d3fe6e7a71868bf8c29dc6c6abbcd9ef8d59d288c08083e8bde643f37

Observation 8a80553d-6cf4-42e1-b187-e7343f5001b0 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

Enterprise Large Language Model Evaluation Benchmark BERTScore: Evaluating Text Generation with BERT

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.720000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.720000Z digest=sha256:5f13791c7d9cfccfc0dc32c0115193470ff5dc7e1d9fc2013f1a0ddaa0c1d9d4

Observation 684f0aa2-8018-4b07-b488-696038a83d3a · outbound

This paper cites BARTScore: Evaluating Generated Text as Text Generation.

Enterprise Large Language Model Evaluation Benchmark BARTScore: Evaluating Generated Text as Text Generation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.789128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.789128Z digest=sha256:76985dc1dab16ee81a6797df00ef0516fa656da8a18f679c04877217f8543c18

Observation e44ed20f-142a-4064-93a1-b9575306b251 · outbound

This paper cites LLM-based NLG Evaluation: Current Status and Challenges.

Enterprise Large Language Model Evaluation Benchmark LLM-based NLG Evaluation: Current Status and Challenges

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.905484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.905484Z digest=sha256:02d8b5821f54ac9ed90bdaeeb82cea69ffa0ea299f5bc178f8dde21bf1be5cc3

Observation 8f5e9a53-28fc-494a-b246-5746ac0c8b23 · outbound

This paper cites ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning.

Enterprise Large Language Model Evaluation Benchmark ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.982426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.982426Z digest=sha256:4aa5b8ed03786f944b1134e88c376bcae21f07872d4b50c435554aa88318dbf8

Observation f4e1cc66-fff6-4764-9e7c-c52b7b34ad10 · outbound

This paper cites ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,.

Enterprise Large Language Model Evaluation Benchmark ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.051830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.051830Z digest=sha256:84fe008687d70d3c4d6f0cfeebfa6540f899e8430d03c1df4328c7db0d06e5cd

Observation 11f977b2-5018-4b10-ac06-6977040725fa · outbound

This paper cites ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,.

Enterprise Large Language Model Evaluation Benchmark ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.176977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.176977Z digest=sha256:55536c2e1068e855a9b3bb10767b4e3b87aa172e0f9a18f33eff9a8599229e8f

Observation c4a18303-5f35-43f6-b77c-6932dd65f3fd · outbound

This paper cites ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness.

Enterprise Large Language Model Evaluation Benchmark ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness

Reference 83

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:56:38.425927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.255627Z digest=sha256:7432f0a84d32fb690f9d1a3284d7be5ab5c22c0bd1505e7b9f413f7bb3a0f03c

Observation aa05dce6-174c-49f4-b14b-12cfb2f233ba · outbound

This paper cites 30, 2024.

Enterprise Large Language Model Evaluation Benchmark 30, 2024

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:37.367742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:37.367742Z digest=sha256:fe543baca5dfa7effef9e45f43017e4982434bc5947eb7a8fed051637ac4cb91

Observation 527bb0bd-efe9-4575-9c3f-37f1351c591c · outbound

This paper cites Toxicity.

Enterprise Large Language Model Evaluation Benchmark Toxicity

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:41.053684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.459003Z digest=sha256:e69c4c99441bf6536e2580010aea332c7b238234cad3f90c228af2dfd69603d6

Observation c325eaa4-213a-464d-861e-286a8aebfbfc · outbound

This paper cites 29, 2024.

Enterprise Large Language Model Evaluation Benchmark 29, 2024

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.828319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.539722Z digest=sha256:69ddf885459a5cc43aeabdc60e7f6006c5e933b5899b421c4c3c5e7763fee4cd

Observation b11d65e7-f995-402c-8ecc-f316cf02f38a · outbound

This paper cites Hallucination.

Enterprise Large Language Model Evaluation Benchmark Hallucination

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.638498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.632673Z digest=sha256:ff46fa29e5a973392619d2ea3d282138855082de9946f1426d191c4a208a43aa

Observation b80432e5-4c9f-4d81-93ac-861219ef2bbe · outbound

This paper cites Spearman’s rank correlation coefficient,.

Enterprise Large Language Model Evaluation Benchmark Spearman’s rank correlation coefficient,

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.486401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.712094Z digest=sha256:dd8a23899b87e1c061f1bcdcc58c9ead19f0ee63cc912259336855083dab2a21

Observation 68a7b921-f1ae-4c99-9c67-dec9f938cef5 · outbound

This paper cites Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,.

Enterprise Large Language Model Evaluation Benchmark Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.318963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.849046Z digest=sha256:06aed9edb4e7df26bcff15a263d940dff81b3f9d61671c0fb9b6a3e55077ca14

Observation 99149d66-b16d-4746-b82c-d479a7faab87 · outbound

This paper cites LLaMA 3.3,.

Enterprise Large Language Model Evaluation Benchmark LLaMA 3.3,

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.180796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:37.933498Z digest=sha256:d5f3e8e0a9115b563e4df0df7e70d9532770bb03d69deabc89c01d9d794c592b

Observation f4985e23-4100-45a8-807b-7053c4c0bbbc · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,.

Enterprise Large Language Model Evaluation Benchmark The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:40.029006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:38.011275Z digest=sha256:2af858d4f9f0ed5c576f2de815b81ecd94c6f9741028f20454f2b83bcd65959b

Observation 899a27e9-f9fa-47c0-a575-8ab80fa01051 · outbound

This paper cites Qwen2.5 Technical Report.

Enterprise Large Language Model Evaluation Benchmark Qwen2.5 Technical Report

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:38.092131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:38.092131Z digest=sha256:c3d3f56d369856c6b37946dfeef694aac40f571c2ce27393de22f4021457b909

Observation e8087ad6-47ac-4231-a96a-0f83174f9110 · outbound

This paper cites The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks.

Enterprise Large Language Model Evaluation Benchmark The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:38.165147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:38.165147Z digest=sha256:cc264179a0a2a634398c4acb283be0b5e19880e207c9f5c49175891bc4517edf

Observation 90c5c1cc-d775-477e-a72f-2e845f4c4ce9 · outbound

This paper cites an unresolved cited work.

Enterprise Large Language Model Evaluation Benchmark Unresolved cited work

Reference 94

Resolution
unresolved
raw_fallback, observed 2026-08-06T22:56:39.900943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:38.244953Z digest=sha256:133a48aec9956d1c73aeb968b81f3cd053607866e1ec86eccbe7587f6573ea63

Observation 79aebb99-6b79-4ce5-a16c-b80d5c7d3f40 · outbound

This paper cites This method has been incorporated into the DeepEval package [72].

Enterprise Large Language Model Evaluation Benchmark This method has been incorporated into the DeepEval package [72]

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:56:39.775138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T22:56:38.270220Z digest=sha256:0706cde4da3ce7d7ab2b9f940aa055da247260aef634169c25cbf4f1a2f827db

Observation 24b3ca47-ad68-4b1e-82ab-f56a432a0b7e · outbound

This paper cites Available: https://sbert.net/examples/applications/paraphrase-mining/README.html.

Enterprise Large Language Model Evaluation Benchmark Available: https://sbert.net/examples/applications/paraphrase-mining/README.html

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T22:56:36.111401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:56:36.111401Z digest=sha256:3306000c545af3b80dd21f1f9ec04cc05cf22d82a3deb41b1ac27d7fb9be727a

Pith citing papers

Observation a25457eb-cdac-441f-9f2e-0abbe541a5f3 · inbound

Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers cites this paper.

Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers Enterprise Large Language Model Evaluation Benchmark

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T15:35:22.448174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:35:22.448174Z digest=sha256:ced075c32f9e5352c68d5b508828c21a98c28d41821bca676ab67c09e7fb28c5

Observation a7252636-13b0-4af4-bb2e-54afe157cff0 · inbound

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems cites this paper.

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems Enterprise Large Language Model Evaluation Benchmark

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-11T04:37:48.225034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-07-11T04:31:30.304599Z digest=sha256:fe9fe6e88a01514c89dba14bf3b75f26637cd382ce272963a868b8320bb3acfa

Observation c4c7a638-5768-48f9-aafa-92c553d67644 · inbound

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning cites this paper.

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T21:31:51.354468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T21:31:51.354468Z digest=sha256:f45ecbe20b5736482b8f77c441be877cd2cd42c1ab57aeb44d294f915536a3a4

Observation ef1b3020-0499-453e-9b27-624dbdd4423f · inbound

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning cites this paper.

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning Enterprise Large Language Model Evaluation Benchmark

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T00:49:50.800327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T00:49:50.800327Z digest=sha256:3519f7db82dc25cdc0e3af78243483a968d59b9366342aea702d81770bdaad29