Pith. sign in

Paper Citation Record · LEDGER

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering

As of 21 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2505.11626.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11626 v2

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:54:11.149565Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1a4157aa-e4c2-4dcb-b484-67966e5daaa0 · outbound

This paper cites On the Implications of Verbose LLM Outputs: A Case Study in Translation Evaluation.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering On the Implications of Verbose LLM Outputs: A Case Study in Translation Evaluation

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.056992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.056992Z digest=sha256:a62b198626a41194af7f7ee988840947953d726d1728597dd1aed7c55dd0def3

Observation 983ee137-86aa-44e4-8552-afeed173b7d8 · outbound

This paper cites Benchmarking Large Language Models in Retrieval-Augmented Generation.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Benchmarking Large Language Models in Retrieval-Augmented Generation

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.062823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.062823Z digest=sha256:377a118c7b556ece96dc240b67dcb93c96499acb43a5f11da4df61d93dab7d8b

Observation e9b16980-251e-49f8-8497-9f43469acf4b · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.067834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.067834Z digest=sha256:0b6591d90bd03785d6d7ef4e4a8862317e6bf543841cab506d162557bf942909

Observation 55c6b930-07e6-49b1-9d7c-57eef70f3e1f · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.072039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.072039Z digest=sha256:2fd15bed0f2e65f4f8e3290e9248f6678dc93d23d7735446d7d530a36b3169c5

Observation e0421fdb-7048-41d3-9606-9cc36b9a3002 · outbound

This paper cites RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.076524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.076524Z digest=sha256:4b8556c142b5a914295a24e2e2ada44899dd7d4e7d6bf2cc9ab1ca3ee79aa8dc

Observation b35d40e2-7459-4b48-86cc-a0f38d2b2340 · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.080683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.080683Z digest=sha256:0d07d0005b3fb7f96d92b6b929f04af323678a547bfb482e5525f98e20ff5670

Observation a95d924f-e2a5-47e5-8fae-26be52c6c15e · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:54:11.488290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:54:11.084644Z digest=sha256:b2c585bc9575a2ad2101ccc6ee0b4d948d69e4cbe66059942d648ce0d3d29048

Observation f67914cc-5c55-4236-9b8b-77643ae51e85 · outbound

This paper cites u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.087914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.087914Z digest=sha256:e32c8b8fa435ac828e69fe6bef13622c6cc0d3e614ec9d679e01043850387a51

Observation 06d20c87-8387-4ccc-8de0-439cffb04bd0 · outbound

This paper cites Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.091634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.091634Z digest=sha256:10c8ee6165daa0f5432a98d3143d02d5cfc1fdd8ffe9781b6d970d26cf390fc5

Observation a81f40d0-01cf-4eb4-9166-3ec5daef4bf2 · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.095542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.095542Z digest=sha256:a88beb6057eae4f15e5975bde82a15fe6251ba0252774b92d5900ffcc8703a67

Observation 6836ee2f-cee5-4388-96ce-0aa42eca2911 · outbound

This paper cites RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.104007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.104007Z digest=sha256:e579bed3809257b1b1e01bab8e5486abfd60123a83c08a0850115cf8437099dc

Observation 359ec317-a9b0-44d9-9cf8-bc16e8d665ac · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.108250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.108250Z digest=sha256:2ee5655758e66cfa21c43db7d6ad9b5c6abec1252ac185150da16c0fb6615e38

Observation c8cce0e1-e241-437c-b25e-ee329992f015 · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.112574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.112574Z digest=sha256:c5e803903140c6e5e4c8b82214cd8b12cfea2cb0586f058cb5242ff6a2e35e11

Observation 911f0dda-ceee-4f8b-89b5-f201970bc939 · outbound

This paper cites Voorhees and Dawn M.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Voorhees and Dawn M

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:54:11.462575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:54:11.116963Z digest=sha256:145d425dd4c6482d433e147017d58147e81b6f5e17dd41eb4b4fecc9411f41d5

Observation 20245776-984b-4e38-b4b0-f44bc5508572 · outbound

This paper cites Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.120911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.120911Z digest=sha256:c2fc3c0b514bf560960d05e944c2b1ab5446ee164b3a75a59ecce0b524a0f2b2

Observation 23d79491-f4b0-4f3d-982d-d7caecf411ca · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:54:11.449017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:54:11.126859Z digest=sha256:b3249e3c34834fa89ce074ae3a1583fcfbb88069a962d446f8068f4604d3cdce

Observation e4b16625-41d1-4873-99a5-2eff33cbcb6d · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.131772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.131772Z digest=sha256:eec00ac6d8cddd4e6c16bfa032111bf74fc078f8eb2888e84cd4e4ed46c9d5da

Observation 1f0ab0e6-f297-4800-a43b-430b1e1b2deb · outbound

This paper cites an unresolved cited work.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.135878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.135878Z digest=sha256:a543c1ca3fdcb653890d97de682183ce0ada75245ad367714919179d8c0ddb45

Observation b7341dc8-8191-4b8d-92e8-06bf42955ce1 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering BERTScore: Evaluating Text Generation with BERT

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.140181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.140181Z digest=sha256:af5926d8ff8e7269f2eb28604fc95b58f708e88a6b730ce9be4b39b802263f3e

Observation aaf66915-09cd-4192-b8a8-63a2887c9a92 · outbound

This paper cites Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.145342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.145342Z digest=sha256:25741163923367c9b86d5c4ad2ee181b96744c53e03a762fcddff257cece461c

Observation aebac910-93df-439d-b562-2dbd3c71fa1d · outbound

This paper cites Xing, Hao Zhang, Joseph E.

THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering Xing, Hao Zhang, Joseph E

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T20:54:11.149565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:54:11.149565Z digest=sha256:112bbd590747450c6c5b347b5b20c7def1646d4482c56c164a467a42bda2b34d

Pith citing papers

No inbound Pith citation observations are available.