Pith. sign in

Paper Citation Record · LEDGER

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks

As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2504.14039.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.14039 v1

Coverage vector

measured 27 of 27 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:01:31.461050Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T16:21:18.483029Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T18:16:11.503799Z

Reference resolution

27 of 27 outbound references displayed

  • verified exact0
  • verified fuzzy4
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 243db047-b1bd-4a26-bc73-269e32d69c53 · outbound

This paper cites PromptSource: An Integrated Development Environment and Repository for Natural Language Prompts.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks PromptSource: An Integrated Development Environment and Repository for Natural Language Prompts

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.336619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.336619Z digest=sha256:c8720730ad1a28c4b828f5f871037539c048b18fa92324ec93b76232e79bea81

Observation 9c51126b-cc54-49cb-9df2-06b5469e42f7 · outbound

This paper cites Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.343187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.343187Z digest=sha256:5b6ccbab9136e0892a7edc060570940062c9b266fad09ee647528e96986ca6fb

Observation e2430c4b-1e30-4de9-b5a6-fa571ef65659 · outbound

This paper cites CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.348307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.348307Z digest=sha256:c07f766556f0ce0a6f09ffa1a2ba53f1195bd1c3e33d5cfd7421680b4de5a422

Observation 3a87dbfc-f786-4f7c-a054-802783b232cb · outbound

This paper cites SECURE: Benchmarking Large Language Models for Cybersecurity.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks SECURE: Benchmarking Large Language Models for Cybersecurity

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.353139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.353139Z digest=sha256:e966c08fc13c22ebf56e4990dfa300425a3673d458916474edd6461a0dbc21f0

Observation 0c38c05b-8733-47b6-8c6d-18a5a200348c · outbound

This paper cites Lessons from the Trenches on Reproducible Evaluation of Language Models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Lessons from the Trenches on Reproducible Evaluation of Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.358076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.358076Z digest=sha256:1bb6f537a20d6617501bc948b640a8fbd63fe0fa7a853320e9e55591dfae53c1

Observation 313abe81-bff7-4440-8cac-2b226a726fee · outbound

This paper cites an unresolved cited work.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.363329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.363329Z digest=sha256:0169a5d02274af2c358200d46cf235e7608761bc51e97608e427997ca4615ec7

Observation 88dcf26a-c69d-4da8-9115-19410e580af6 · outbound

This paper cites Evaluating Superhuman Models with Consistency Checks.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Evaluating Superhuman Models with Consistency Checks

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.368451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.368451Z digest=sha256:7ebf1234c962ad853e9f7d331706f0e40b363574352ef6dacd3b3c66a0410318

Observation acff226d-cf73-4073-8d60-97dd577a17d3 · outbound

This paper cites A framework for few-shot language model evaluation, 12 2023.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks A framework for few-shot language model evaluation, 12 2023

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.373183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.373183Z digest=sha256:767b04a6aed4cd3c69b71df9f33782b1f240d1d9efe82b73edc988b4272b4218

Observation 09d3bdb1-28b8-4a23-90a8-a4f6c45bb64e · outbound

This paper cites Measurement and Fairness.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Measurement and Fairness

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.377637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.377637Z digest=sha256:292f94924e2ca6d0186bfb3cbd0d593a84b1364d12f17385402e05fd0330b938

Observation 3ceda8b9-4bb1-46af-9560-e7485d4d4f86 · outbound

This paper cites SEvenLLM: Benchmarking, Eliciting, and Enhancing Abilities of Large Language Models in Cyber Threat Intelligence.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks SEvenLLM: Benchmarking, Eliciting, and Enhancing Abilities of Large Language Models in Cyber Threat Intelligence

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.382441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.382441Z digest=sha256:3df240d65dde7cb0449dfe780973e9d77f6a1d663968268d8fb5970024aafe62

Observation d05a05ba-6c23-4f4f-9569-6de44eb14441 · outbound

This paper cites Seceval: A comprehensive benchmark for eval- uating cybersecurity knowledge of foundation models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Seceval: A comprehensive benchmark for eval- uating cybersecurity knowledge of foundation models

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:01:32.006642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T12:01:31.387051Z digest=sha256:b70dc634bd56be56020f99114319c1f5b44de8803789ccdcf9e256ef4c95e2af

Observation cf77ecd3-503e-4bc6-aa72-f110d08e7625 · outbound

This paper cites The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.391346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.391346Z digest=sha256:c969ba75620d124b024ab90c651adf98b7e72eb299022cefe6a7d780c17e32fb

Observation 40a79429-96d1-48da-961d-a9b8afb933b7 · outbound

This paper cites ROUGE: A package for automatic evaluation of summaries.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks ROUGE: A package for automatic evaluation of summaries

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:01:31.990460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T12:01:31.396250Z digest=sha256:a64eca56db32aa3d5a7c75dc67b4be4acae55a30c70e9b68668d36d7917f7afd

Observation 89da18fe-18d3-4128-ab03-f233e45f5cc0 · outbound

This paper cites SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.400840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.400840Z digest=sha256:46f90e7e36a67a7318a11a90dc457c9ea928293f73e44c26e19ee40085ade824

Observation 692c1e35-aa40-4370-8630-f4ad00f0e8bf · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.405565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.405565Z digest=sha256:1967bce0748739cc5980ab788b6dfe00302c8112c5b106e0f00d16066c2dd43b

Observation 13e0382f-c17c-4226-8a95-c333b5fe7729 · outbound

This paper cites State of What Art? A Call for Multi-Prompt LLM Evaluation.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks State of What Art? A Call for Multi-Prompt LLM Evaluation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.410067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.410067Z digest=sha256:750a7d900bc6455721ced96215bca20e05c3f8f7ddbd8c9d2928ded0138a69dd

Observation 807142c3-38b0-45f1-b62e-61073d9f8e5e · outbound

This paper cites Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.414686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.414686Z digest=sha256:6d6981840c15b6badcb743868314fe9407bd09a7082ca7474f974df3bb9b0d23

Observation b1e30fb3-fd28-4cf1-bb9d-2484d3b7cd8f · outbound

This paper cites Jinja2 Documentation, 2024.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Jinja2 Documentation, 2024

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:01:31.974843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T12:01:31.419032Z digest=sha256:86b90a3de1f3fba8020b7813f38728cc87581a79b38857b313812ede18c0e579

Observation 4bc161a4-aab5-429b-b3e9-b68d7cf27dfe · outbound

This paper cites First Tragedy, then Parse: History Repeats Itself in the New Era of Large Language Models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks First Tragedy, then Parse: History Repeats Itself in the New Era of Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.423531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.423531Z digest=sha256:8383aa548b7b1e1664f755586d7fe6cec83f26f9ca6ce59ee1b3cc6e1af319f3

Observation e52be142-08b5-4129-a223-2cbdae6225f2 · outbound

This paper cites Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt for- matting, 2024.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt for- matting, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:01:31.959706Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T12:01:31.428320Z digest=sha256:5e3ce8e11b0ce0aed0cb329b9574640e5f167c0be2a6bcae59d4a8d76e77a068

Observation c826add8-ad35-48ae-a152-2a3d399737ab · outbound

This paper cites Large Language Models are Inconsistent and Biased Evaluators.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Large Language Models are Inconsistent and Biased Evaluators

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.433321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.433321Z digest=sha256:69ef8ebb236650a98bc43444ea3d545b4724dc7a532bdbb2a6326bcf329698b6

Observation 3c2b4058-a6ac-46fe-b104-ad97b75c80a2 · outbound

This paper cites It Takes Two to Tango: Navigating Conceptualizations of NLP Tasks and Measurements of Performance.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks It Takes Two to Tango: Navigating Conceptualizations of NLP Tasks and Measurements of Performance

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.438248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.438248Z digest=sha256:2488d0b2e6090ead63c137d16fb96dd3dc3aca539309eba41debda952c21088d

Observation 0d61b9a3-360a-440f-8743-57679b614f7f · outbound

This paper cites CyberMetric: A Benchmark Dataset based on Retrieval-Augmented Generation for Evaluating LLMs in Cybersecurity Knowledge.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks CyberMetric: A Benchmark Dataset based on Retrieval-Augmented Generation for Evaluating LLMs in Cybersecurity Knowledge

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.442971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.442971Z digest=sha256:4bddb35e991b433d4dad48596d1106879648872e67737de8e367ac997d978fe8

Observation a7f2cb32-15ef-4bcf-818e-89b9aaee5a60 · outbound

This paper cites Evaluating Evaluation Metrics: A Framework for Analyzing NLG Evaluation Metrics using Measurement Theory.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Evaluating Evaluation Metrics: A Framework for Analyzing NLG Evaluation Metrics using Measurement Theory

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.447787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.447787Z digest=sha256:da273b56a2dbf63f871fc03e57bd9a952ec49bb88e5493e455eed0ff547fce89

Observation 5b3f79fc-2b08-4467-bf0a-ad11d353c58a · outbound

This paper cites Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.452260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.452260Z digest=sha256:5e310302b2337b48eb79e51e8620e50c44e9921eba9e21b190a8e29fb9cbf8bf

Observation 426e0c94-8ccc-4abf-a0c1-bcdde1e06c57 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.456864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.456864Z digest=sha256:55a0d54b48e141708b2bdf1624e6ba685360bef0aa91f57a3efa0dbcce98da8f

Observation bc37ec53-3f00-410b-9698-170f711e3da8 · outbound

This paper cites DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks.

MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T12:01:31.461050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:01:31.461050Z digest=sha256:a7b19ad0a2c6094d76856a2bf1cb894d574ba6934775d5d33e615d310bd74050

Pith citing papers

Observation 1873b43c-28bf-4f49-85f1-1054990fea01 · inbound

Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach cites this paper.

Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:16:11.511985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T16:21:18.483029Z digest=sha256:70e656b6ccea48c2307dfecb63f869499e48bbf8088340a252e0b427cb41a441