{"as_of":"2026-08-21T22:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a21095bc178783c580d349c64dbcc068be69f773210a44e21fa8e0df857ae24","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:54:11.149565Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11626/citation-record","integrity":"/paper/2505.11626/integrity","json":"/paper/2505.11626/citation-record.json","paper":"/paper/2505.11626"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.00863","last_updated":"2024-10-01T16:59:01Z","snapshot_observed_at":"2026-08-16T13:13:39.413972Z","submitted_at":"2024-10-01T16:59:01Z","title":"On the Implications of Verbose LLM Outputs: A Case Study in Translation Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00863","snapshot_observed_at":"2026-08-15T20:54:11.056992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.056992Z"},"links":{"cited_paper":"/paper/2410.00863","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:a62b198626a41194af7f7ee988840947953d726d1728597dd1aed7c55dd0def3","observation_id":"1a4157aa-e4c2-4dcb-b484-67966e5daaa0","resolution":{"observed_at":"2026-08-15T20:54:11.056992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01431","last_updated":"2023-12-20T11:54:11Z","snapshot_observed_at":"2026-08-18T12:39:46.626894Z","submitted_at":"2023-09-04T08:28:44Z","title":"Benchmarking Large Language Models in Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01431","snapshot_observed_at":"2026-08-15T20:54:11.062823Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.062823Z"},"links":{"cited_paper":"/paper/2309.01431","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:377a118c7b556ece96dc240b67dcb93c96499acb43a5f11da4df61d93dab7d8b","observation_id":"983ee137-86aa-44e4-8552-afeed173b7d8","resolution":{"observed_at":"2026-08-15T20:54:11.062823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.067834Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.067834Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:0b6591d90bd03785d6d7ef4e4a8862317e6bf543841cab506d162557bf942909","observation_id":"e9b16980-251e-49f8-8497-9f43469acf4b","resolution":{"observed_at":"2026-08-15T20:54:11.067834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.072039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.072039Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:2fd15bed0f2e65f4f8e3290e9248f6678dc93d23d7735446d7d530a36b3169c5","observation_id":"55c6b930-07e6-49b1-9d7c-57eef70f3e1f","resolution":{"observed_at":"2026-08-15T20:54:11.072039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14486","last_updated":"2024-05-23T12:18:11Z","snapshot_observed_at":"2026-08-16T13:50:14.333996Z","submitted_at":"2024-05-23T12:18:11Z","title":"RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14486","snapshot_observed_at":"2026-08-15T20:54:11.076524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.076524Z"},"links":{"cited_paper":"/paper/2405.14486","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:4b8556c142b5a914295a24e2e2ada44899dd7d4e7d6bf2cc9ab1ca3ee79aa8dc","observation_id":"e0421fdb-7048-41d3-9606-9cc36b9a3002","resolution":{"observed_at":"2026-08-15T20:54:11.076524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.080683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.080683Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:0d07d0005b3fb7f96d92b6b929f04af323678a547bfb482e5525f98e20ff5670","observation_id":"b35d40e2-7459-4b48-86cc-a0f38d2b2340","resolution":{"observed_at":"2026-08-15T20:54:11.080683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.484508Z","title":null,"venue":null,"work_id":"3a7ea434-44f1-4eba-b3b6-5a6473b7ef2a","year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.084644Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:b2c585bc9575a2ad2101ccc6ee0b4d948d69e4cbe66059942d648ce0d3d29048","observation_id":"a95d924f-e2a5-47e5-8fae-26be52c6c15e","resolution":{"observed_at":"2026-08-15T20:54:11.488290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.087914Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.087914Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:e32c8b8fa435ac828e69fe6bef13622c6cc0d3e614ec9d679e01043850387a51","observation_id":"f67914cc-5c55-4236-9b8b-77643ae51e85","resolution":{"observed_at":"2026-08-15T20:54:11.087914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.091634Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.091634Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:10c8ee6165daa0f5432a98d3143d02d5cfc1fdd8ffe9781b6d970d26cf390fc5","observation_id":"06d20c87-8387-4ccc-8de0-439cffb04bd0","resolution":{"observed_at":"2026-08-15T20:54:11.091634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.095542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.095542Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:a88beb6057eae4f15e5975bde82a15fe6251ba0252774b92d5900ffcc8703a67","observation_id":"a81f40d0-01cf-4eb4-9166-3ec5daef4bf2","resolution":{"observed_at":"2026-08-15T20:54:11.095542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08067","last_updated":"2024-08-17T00:30:04Z","snapshot_observed_at":"2026-08-21T13:47:28.249740Z","submitted_at":"2024-08-15T10:20:54Z","title":"RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08067","snapshot_observed_at":"2026-08-15T20:54:11.104007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.104007Z"},"links":{"cited_paper":"/paper/2408.08067","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:e579bed3809257b1b1e01bab8e5486abfd60123a83c08a0850115cf8437099dc","observation_id":"6836ee2f-cee5-4388-96ce-0aa42eca2911","resolution":{"observed_at":"2026-08-15T20:54:11.104007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.108250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.108250Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:2ee5655758e66cfa21c43db7d6ad9b5c6abec1252ac185150da16c0fb6615e38","observation_id":"359ec317-a9b0-44d9-9cf8-bc16e8d665ac","resolution":{"observed_at":"2026-08-15T20:54:11.108250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.112574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.112574Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:c5e803903140c6e5e4c8b82214cd8b12cfea2cb0586f058cb5242ff6a2e35e11","observation_id":"c8cce0e1-e241-437c-b25e-ee329992f015","resolution":{"observed_at":"2026-08-15T20:54:11.112574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.458311Z","title":"Voorhees and Dawn M","venue":null,"work_id":"88a77f87-324b-4a54-895d-a74ebc752f31","year":2000},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.116963Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:145d425dd4c6482d433e147017d58147e81b6f5e17dd41eb4b4fecc9411f41d5","observation_id":"911f0dda-ceee-4f8b-89b5-f201970bc939","resolution":{"observed_at":"2026-08-15T20:54:11.462575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18064","last_updated":"2024-11-07T04:03:04Z","snapshot_observed_at":"2026-08-21T08:34:01.817114Z","submitted_at":"2024-06-26T04:49:41Z","title":"Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18064","snapshot_observed_at":"2026-08-15T20:54:11.120911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.120911Z"},"links":{"cited_paper":"/paper/2406.18064","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:c2fc3c0b514bf560960d05e944c2b1ab5446ee164b3a75a59ecce0b524a0f2b2","observation_id":"20245776-984b-4e38-b4b0-f44bc5508572","resolution":{"observed_at":"2026-08-15T20:54:11.120911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.443687Z","title":null,"venue":null,"work_id":"5c27138e-57d4-442f-8784-88bebeeed911","year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.126859Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:b3249e3c34834fa89ce074ae3a1583fcfbb88069a962d446f8068f4604d3cdce","observation_id":"23d79491-f4b0-4f3d-982d-d7caecf411ca","resolution":{"observed_at":"2026-08-15T20:54:11.449017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.131772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.131772Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:eec00ac6d8cddd4e6c16bfa032111bf74fc078f8eb2888e84cd4e4ed46c9d5da","observation_id":"e4b16625-41d1-4873-99a5-2eff33cbcb6d","resolution":{"observed_at":"2026-08-15T20:54:11.131772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.135878Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.135878Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:a543c1ca3fdcb653890d97de682183ce0ada75245ad367714919179d8c0ddb45","observation_id":"1f0ab0e6-f297-4800-a43b-430b1e1b2deb","resolution":{"observed_at":"2026-08-15T20:54:11.135878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T20:54:11.140181Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.140181Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:af5926d8ff8e7269f2eb28604fc95b58f708e88a6b730ce9be4b39b802263f3e","observation_id":"b7341dc8-8191-4b8d-92e8-06bf42955ce1","resolution":{"observed_at":"2026-08-15T20:54:11.140181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07858","last_updated":"2024-12-07T22:11:27Z","snapshot_observed_at":"2026-08-20T18:53:55.899004Z","submitted_at":"2024-11-12T15:15:20Z","title":"Verbosity $\\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07858","snapshot_observed_at":"2026-08-15T20:54:11.145342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.145342Z"},"links":{"cited_paper":"/paper/2411.07858","citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:25741163923367c9b86d5c4ad2ee181b96744c53e03a762fcddff257cece461c","observation_id":"aaf66915-09cd-4192-b8a8-63a2887c9a92","resolution":{"observed_at":"2026-08-15T20:54:11.145342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:54:11.149565Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:54:11.149565Z"},"links":{"citing_paper":"/paper/2505.11626"},"observation_digest":"sha256:112bbd590747450c6c5b347b5b20c7def1646d4482c56c164a467a42bda2b34d","observation_id":"aebac910-93df-439d-b562-2dbd3c71fa1d","resolution":{"observed_at":"2026-08-15T20:54:11.149565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11626","last_updated":"2025-06-03T19:21:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T16:49:09.740468Z","submitted_at":"2025-05-16T18:42:04Z","title":"THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2505.11626."}