{"as_of":"2026-08-19T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab88f348ac3fd2c3baa98ef1476db76557cc9d3b44fe1552b4c3b4c328318f95","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:52:50.682341Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:39:30.304142Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T20:58:45.171226Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"cited_work":{"arxiv_id":"2504.20119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20119","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can llms be trusted for evaluating rag systems? a survey of methods and datasets","venue":null,"work_id":"3292c40d-264e-4537-8b72-e57ebd513a0a","year":2025},"citing_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-13T20:58:45.060041Z"},"links":{"cited_paper":"/paper/2504.20119","citing_paper":"/paper/2507.13334"},"observation_digest":"sha256:529654dc3fc1e4a842066225aa59c38e112cbc848bdf361a84a1cff7d41a65d3","observation_id":"065b5508-60fc-413d-9e7c-f652b27a5e9f","resolution":{"observed_at":"2026-05-13T20:58:45.173586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20119","snapshot_observed_at":"2026-08-06T20:39:30.304142Z","title":"Brown, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21099","last_updated":"2025-07-03T05:36:08Z","snapshot_observed_at":"2026-08-18T12:54:53.079302Z","submitted_at":"2025-07-03T05:36:08Z","title":"Rewrite-to-Rank: Optimizing Ad Visibility via Retrieval-Aware Text Rewriting","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:30.304142Z"},"links":{"cited_paper":"/paper/2504.20119","citing_paper":"/paper/2507.21099"},"observation_digest":"sha256:f893a989949776a68fa05bc615cba469675a494270b3ccffe07ed67a18f078b4","observation_id":"8e119205-8ef6-4d02-9bd1-3ce6d6dfaf79","resolution":{"observed_at":"2026-08-06T20:39:30.304142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20119/citation-record","integrity":"/paper/2504.20119/integrity","json":"/paper/2504.20119/citation-record.json","paper":"/paper/2504.20119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-16T05:52:50.301627Z","title":"Retrieval-augmented generation for large lan guage models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.301627Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:e90eb20f476e9105fe8e6c48f54ca0013755e22e23fdcdef97700c2ae3d3b8ba","observation_id":"f34183de-1a7b-4400-8d65-9579e70d1bfe","resolution":{"observed_at":"2026-08-16T05:52:50.301627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.237919Z","title":"Si ren’s Song in the AI Ocean: A Survey on Hallucination in Large Langu age Models,","venue":null,"work_id":"47f233cb-d0b1-49b6-b57c-2cb1ce5c12ee","year":2023},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.307198Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:2c7fb452449cea72825edf66337575757a7d10e1ae28dbe7bc1ce5deadb4c3e1","observation_id":"760f13f0-68a5-48fb-95e7-c919bd96b33e","resolution":{"observed_at":"2026-08-16T05:52:52.242603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-16T05:52:50.317258Z","title":"Retrieval-Augmented Generation for Knowledge- Intensive NLP Tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.317258Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:9142c3d163beee49925d3ff52ff1be05a84f22dc36160fc4a0a8cf93807cc8ed","observation_id":"664fcab1-507d-4238-8aa8-5ad4f7ba42e7","resolution":{"observed_at":"2026-08-16T05:52:50.317258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.222147Z","title":"CRUD-RAG: A comprehensive chines e benchmark for retrieval-augmented generation of large lan guage models","venue":null,"work_id":"c9b6789e-1013-4e95-9b47-fd20a60d5163","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.322909Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:e10c4becb19ecfcba42afb7d352dc8ae8d71319b84472970af92cebb2bccf6eb","observation_id":"bf273c94-36fe-497d-949c-4126e62d3c64","resolution":{"observed_at":"2026-08-16T05:52:52.227058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1060329","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:51.938341Z","title":"Performance evaluation of vector embeddings with retrieval- augmented generation,","venue":null,"work_id":"33e6caa2-b891-41d4-841a-597f744a7ab3","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.330430Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:2a1d4bb39bd1732322b334507a3e9477d2182dd784cb8f806896e73ac5f50dc2","observation_id":"4d9c402b-f066-4d11-b359-ff0ee5633b6e","resolution":{"observed_at":"2026-08-16T05:52:51.946105Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-13T16:22:14.977210Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-16T05:52:50.338817Z","title":"RA GAS: Automated evaluation of retrieval augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.338817Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:b2f43671f32d1707a4decc652f0ab6b21f5f9372289c0e55921b4017081db5e8","observation_id":"5ea4758c-fc90-43f0-82b2-6e0c427eb72c","resolution":{"observed_at":"2026-08-16T05:52:50.338817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.206349Z","title":"AR ES: An automated evaluation framework for retrieval-augmented g eneration systems","venue":null,"work_id":"5dc9afb4-1ca1-457b-bbe2-f5b9c556cf50","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.344510Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:b989731d7877574a71a95d3a28b75a1049fbbacb70ab9e5854f1b98395356e9e","observation_id":"abc963ba-231c-4279-8b8d-e507e433487e","resolution":{"observed_at":"2026-08-16T05:52:52.212350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13781","last_updated":"2024-04-21T21:22:28Z","snapshot_observed_at":"2026-08-18T09:39:30.437190Z","submitted_at":"2024-04-21T21:22:28Z","title":"Evaluating Retrieval Quality in Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13781","snapshot_observed_at":"2026-08-16T05:52:50.349252Z","title":"Evaluating retrieval qual- ity in retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.349252Z"},"links":{"cited_paper":"/paper/2404.13781","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:3dbaa2a782a531ae1d9fe54e172f3ff87fd52f3d447d35568718f573108e5cf6","observation_id":"433b7aa9-45aa-446f-aee8-a5d9bcb1e677","resolution":{"observed_at":"2026-08-16T05:52:50.349252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08275","last_updated":"2024-07-11T08:24:16Z","snapshot_observed_at":"2026-08-16T13:35:11.011736Z","submitted_at":"2024-07-11T08:24:16Z","title":"Beyond Benchmarks: Evaluating Embedding Model Similarity for Retrieval Augmented Generation Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08275","snapshot_observed_at":"2026-08-16T05:52:50.354394Z","title":"Beyond benchmarks: Evaluating embedding mo del similarity for retrieval augmented generation systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.354394Z"},"links":{"cited_paper":"/paper/2407.08275","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:35f75d9a3a5b59c8b9685766e4808929537708c015cdaabce8372c14ad20df0d","observation_id":"b8e54e03-e717-43b0-bc5f-257ab86bb0a2","resolution":{"observed_at":"2026-08-16T05:52:50.354394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15391","last_updated":"2024-01-27T11:41:48Z","snapshot_observed_at":"2026-08-13T01:06:03.395715Z","submitted_at":"2024-01-27T11:41:48Z","title":"MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15391","snapshot_observed_at":"2026-08-16T05:52:50.359772Z","title":"MultiHop-RAG: Benchmarking retri eval- augmented generation for multi-hop queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.359772Z"},"links":{"cited_paper":"/paper/2401.15391","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:8cb401eda8c655fbded0c6aee7ab9e053d9c7c3e22a5cd40602594ac31ac14c6","observation_id":"7d407466-2bfd-41fb-80d6-07fd166235ea","resolution":{"observed_at":"2026-08-16T05:52:50.359772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05654","last_updated":"2024-06-17T03:01:39Z","snapshot_observed_at":"2026-08-16T13:44:50.530979Z","submitted_at":"2024-06-09T05:33:51Z","title":"DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05654","snapshot_observed_at":"2026-08-16T05:52:50.364571Z","title":"DomainRAG: A chinese benchmark for evaluating domain-speciﬁc retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.364571Z"},"links":{"cited_paper":"/paper/2406.05654","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:011bd092d79257bab07345d1a90c9416ca2e90e03a910eda679913df967939fa","observation_id":"863e1ce2-011b-4fb1-8a21-91269fc194f2","resolution":{"observed_at":"2026-08-16T05:52:50.364571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.188784Z","title":"Customized retriev al augmented generation and benchmarking for EDA tool documen tation QA","venue":null,"work_id":"940405c2-b59c-48ac-8c00-18116ba239b5","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.369399Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:42f33a756ec5c660d575d187add1d5151280f51a1dcb74871489e5d19ba0fd9c","observation_id":"222d1de1-a190-4c71-9c61-0062011222cd","resolution":{"observed_at":"2026-08-16T05:52:52.194419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07437","last_updated":"2024-07-03T04:59:32Z","snapshot_observed_at":"2026-08-16T13:53:19.974601Z","submitted_at":"2024-05-13T02:33:25Z","title":"Evaluation of Retrieval-Augmented Generation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07437","snapshot_observed_at":"2026-08-16T05:52:50.373822Z","title":"Evalu ation of retrieval-augmented generation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.373822Z"},"links":{"cited_paper":"/paper/2405.07437","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:66d206fddef17728c9783074bac8de5b013be6836630d164d02fb70fa3af6b1d","observation_id":"4649fa2f-5b3f-433e-9322-26de9bf3a533","resolution":{"observed_at":"2026-08-16T05:52:50.373822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.172851Z","title":"Benchmarking of retrieval augmented gene ration: A comprehensive systematic literature review on evaluatio n dimensions, evaluation metrics and datasets,","venue":null,"work_id":"30e510ac-12ee-4880-b437-a26814986093","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.378843Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:4c6e5ad1895f808851840b75547ccc8ab6ca9cbdb7a274146658127f134dccfa","observation_id":"31900d05-d94d-4eba-888f-9a5cfc055c2b","resolution":{"observed_at":"2026-08-16T05:52:52.177982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.159981Z","title":"Guidelines for perform ing systematic literature reviews in software engineering,","venue":null,"work_id":"7c846451-eff4-4357-bde5-2340da3548cb","year":2007},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.384845Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:7bd0c5274215c1807096ab010430893f8a400c4afb53e03b394d6d33e21adb74","observation_id":"c598f289-f925-4191-8d7e-1abdc0611479","resolution":{"observed_at":"2026-08-16T05:52:52.164412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10343","last_updated":"2024-08-19T18:30:18Z","snapshot_observed_at":"2026-08-16T13:25:24.761276Z","submitted_at":"2024-08-19T18:30:18Z","title":"LegalBench-RAG: A Benchmark for Retrieval-Augmented Generation in the Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10343","snapshot_observed_at":"2026-08-16T05:52:50.389629Z","title":"LegalBench-RAG: A benchma rk for retrieval-augmented generation in the legal domain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.389629Z"},"links":{"cited_paper":"/paper/2408.10343","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:66ad67263445ab49d047a0e3ceb34878493d1ec4845a93e8abf3052a0210cac7","observation_id":"2d54bdb2-d04a-46c6-88bb-2f0b9b1c984d","resolution":{"observed_at":"2026-08-16T05:52:50.389629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13178","last_updated":"2024-02-23T16:46:58Z","snapshot_observed_at":"2026-08-16T14:16:52.463979Z","submitted_at":"2024-02-20T17:44:06Z","title":"Benchmarking Retrieval-Augmented Generation for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13178","snapshot_observed_at":"2026-08-16T05:52:50.395011Z","title":"Benchmarking retrieval-augmented generation for medicine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.395011Z"},"links":{"cited_paper":"/paper/2402.13178","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:7ef9ce187bc199fb3c4ecbeffbfefb0e4d39af8bd20f3ee211581f3d92a781fc","observation_id":"c2ea125d-8cba-4a47-9ea9-2ccb7c7b084a","resolution":{"observed_at":"2026-08-16T05:52:50.395011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11800","last_updated":"2025-06-09T14:33:22Z","snapshot_observed_at":"2026-08-18T18:44:26.590203Z","submitted_at":"2024-08-21T17:43:11Z","title":"WeQA: A Benchmark for Retrieval Augmented Generation in Wind Energy Domain","version":3},"cited_work":{"arxiv_id":"2408.11800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11800","snapshot_observed_at":"2026-08-16T05:52:51.730712Z","title":"WeQA: A Benchmark for Retrieval Augmented Generation in Wind Energy Domain","venue":"cs.CL","work_id":"2a5816df-f23a-4083-96cd-a4eeee82b040","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.400147Z"},"links":{"cited_paper":"/paper/2408.11800","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:d8388013691f092f92822412fda7b512be1fa5101bd4e8143da9237b7ee07aa3","observation_id":"1c568a59-c57e-47db-92e1-ead6206945cf","resolution":{"observed_at":"2026-08-16T05:52:51.735818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.145221Z","title":null,"venue":null,"work_id":"85094688-a593-4c38-ac7b-afbdfc27baaf","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.404935Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:30b8fce5796e38731c26960de082ad8eb275f8fb005f9719fc8dafa00392f0c0","observation_id":"f09c2fc8-abf3-49d0-a589-d5b725207f05","resolution":{"observed_at":"2026-08-16T05:52:52.150219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08067","last_updated":"2024-08-17T00:30:04Z","snapshot_observed_at":"2026-08-18T03:59:35.492868Z","submitted_at":"2024-08-15T10:20:54Z","title":"RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08067","snapshot_observed_at":"2026-08-16T05:52:50.409946Z","title":"RAGChecker: A ﬁne-grained framewor k for diagnosing retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.409946Z"},"links":{"cited_paper":"/paper/2408.08067","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:9a5d553d7a422e40f609b9362fca2f0a4f47ccfda5f0161bf9f05a645541dc65","observation_id":"70b752f4-32c9-4b6a-a9bf-b3289421f9e2","resolution":{"observed_at":"2026-08-16T05:52:50.409946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08488","last_updated":"2024-07-22T18:41:53Z","snapshot_observed_at":"2026-08-16T13:35:05.019172Z","submitted_at":"2024-07-11T13:22:17Z","title":"Lynx: An Open Source Hallucination Evaluation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08488","snapshot_observed_at":"2026-08-16T05:52:50.415581Z","title":"Lynx: An open source hallucination evaluation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.415581Z"},"links":{"cited_paper":"/paper/2407.08488","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:0083078a52c62af80f87bd08c45178959ff8537e4f9bf112d1856c8ce7e2affd","observation_id":"528dcb6e-1b04-4567-a02e-235eb98cd349","resolution":{"observed_at":"2026-08-16T05:52:50.415581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01080","last_updated":"2024-07-03T12:49:34Z","snapshot_observed_at":"2026-08-16T13:38:12.958837Z","submitted_at":"2024-07-01T08:35:04Z","title":"Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01080","snapshot_observed_at":"2026-08-16T05:52:50.420495Z","title":"Face4rag: Factual c onsistency evaluation for retrieval augmented generation in chinese","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.420495Z"},"links":{"cited_paper":"/paper/2407.01080","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:e8760de6187a6a024a46b90dda5e287dec67014c0f94df7e78695a8f0ddbae68","observation_id":"17d82c36-4ea8-4aa7-ba5c-32476f4b41c4","resolution":{"observed_at":"2026-08-16T05:52:50.420495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14567","last_updated":"2025-05-04T04:28:02Z","snapshot_observed_at":"2026-08-16T13:07:59.044006Z","submitted_at":"2024-10-18T16:11:29Z","title":"ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions","version":4},"cited_work":{"arxiv_id":"2410.14567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14567","snapshot_observed_at":"2026-08-16T05:52:51.660626Z","title":"ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions","venue":"cs.CL","work_id":"36f73393-77d1-4e84-9288-d4224af27824","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.426002Z"},"links":{"cited_paper":"/paper/2410.14567","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:307344e14df69300c062c2c2b00a7061e11011f2293dfe6ec73c7301d1b100eb","observation_id":"4f85a63a-5ac9-456f-b9fe-d4ebdb5ecde8","resolution":{"observed_at":"2026-08-16T05:52:51.665496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00820","last_updated":"2024-02-26T12:56:17Z","snapshot_observed_at":"2026-08-19T08:16:35.464430Z","submitted_at":"2024-02-26T12:56:17Z","title":"Retrieval Augmented Generation Systems: Automatic Dataset Creation, Evaluation and Boolean Agent Setup","version":1},"cited_work":{"arxiv_id":"2403.00820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00820","snapshot_observed_at":"2026-08-16T05:52:51.640946Z","title":"Retrieval Augmented Generation Systems: Automatic Dataset Creation, Evaluation and Boolean Agent Setup","venue":"cs.IR","work_id":"72ab60da-b7af-4e41-ad26-17d916dc5ce2","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.431940Z"},"links":{"cited_paper":"/paper/2403.00820","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:9bc0a49f1370d19fbc1a2c9e86fb2801603f8cddf44a5345d9c7fa7b1440cff8","observation_id":"5bcf4cb5-4836-4161-ab98-03647423129b","resolution":{"observed_at":"2026-08-16T05:52:51.646049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09818","last_updated":"2024-10-01T08:55:44Z","snapshot_observed_at":"2026-08-16T13:43:03.305863Z","submitted_at":"2024-06-14T08:21:42Z","title":"ClimRetrieve: A Benchmarking Dataset for Information Retrieval from Corporate Climate Disclosures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09818","snapshot_observed_at":"2026-08-16T05:52:50.437094Z","title":"ClimRe- trieve: A benchmarking dataset for information retrieval f rom corporate climate disclosures","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.437094Z"},"links":{"cited_paper":"/paper/2406.09818","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:fc1098f4dc1b9f682ac110f1ef0dc7444724c81f04f65c541353cbd2d7f71125","observation_id":"56e0374f-bf28-4473-a81d-f0a1073ab108","resolution":{"observed_at":"2026-08-16T05:52:50.437094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13998","last_updated":"2024-10-03T00:13:19Z","snapshot_observed_at":"2026-08-18T00:20:46.859093Z","submitted_at":"2024-07-19T03:02:51Z","title":"RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13998","snapshot_observed_at":"2026-08-16T05:52:50.442866Z","title":"RAG-QA arena: Evaluating domain robustne ss for long-form retrieval augmented question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.442866Z"},"links":{"cited_paper":"/paper/2407.13998","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:23a2a2fa3bba10a61e4a6a9216fcb2d35675a9fe81d4a4710d22635a7e871ab9","observation_id":"b2fc9442-9968-4114-aba5-5599d87a2b86","resolution":{"observed_at":"2026-08-16T05:52:50.442866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02937","last_updated":"2025-05-26T06:14:02Z","snapshot_observed_at":"2026-08-16T13:02:50.877820Z","submitted_at":"2024-11-05T09:27:21Z","title":"Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02937","snapshot_observed_at":"2026-08-16T05:52:50.447905Z","title":"Benchmarking multimodal retrieval augmented generation with dynamic VQ A dataset and self-adaptive planning agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.447905Z"},"links":{"cited_paper":"/paper/2411.02937","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:9c8ca0cde070cf6177632c1be1890457cf0944a86bd0e5f8dd212c5c32f1fe91","observation_id":"329397d0-8c65-4954-bf5d-21cff6bafe4e","resolution":{"observed_at":"2026-08-16T05:52:50.447905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15531","last_updated":"2024-10-20T22:59:34Z","snapshot_observed_at":"2026-08-16T13:07:36.624490Z","submitted_at":"2024-10-20T22:59:34Z","title":"Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage","version":1},"cited_work":{"arxiv_id":"2410.15531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.15531","snapshot_observed_at":"2026-08-16T05:52:51.556807Z","title":"Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage","venue":"cs.CL","work_id":"7ad7cbe7-b4b7-4302-bb2b-0b2e6ba99e8e","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.452577Z"},"links":{"cited_paper":"/paper/2410.15531","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:fecfad911fc8695b57fd595cfee7dbd4b833949fe57bfee143b8eb605ed3beb2","observation_id":"8161b24b-4802-4582-a81d-ac58d95465b0","resolution":{"observed_at":"2026-08-16T05:52:51.563878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11891","last_updated":"2024-02-19T07:06:52Z","snapshot_observed_at":"2026-08-16T14:17:27.846421Z","submitted_at":"2024-02-19T07:06:52Z","title":"FeB4RAG: Evaluating Federated Search in the Context of Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11891","snapshot_observed_at":"2026-08-16T05:52:50.457455Z","title":"FeB4r ag: Evaluating federated search in the context of retrieval aug mented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.457455Z"},"links":{"cited_paper":"/paper/2402.11891","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:e844e7d131d5b693d9874e86f857fc16aa015f4f2fdc2b9ba90c7dfb228cc8e0","observation_id":"88d04068-5e49-4db6-9aec-b2fd03b14dce","resolution":{"observed_at":"2026-08-16T05:52:50.457455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23000","last_updated":"2025-01-27T11:58:00Z","snapshot_observed_at":"2026-08-16T13:04:33.313530Z","submitted_at":"2024-10-30T13:29:36Z","title":"Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23000","snapshot_observed_at":"2026-08-16T05:52:50.462406Z","title":"Long$ˆ2$RAG: Evaluating long-context & long-form retrie val- augmented generation with key point recall","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.462406Z"},"links":{"cited_paper":"/paper/2410.23000","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:71791c5aa32233d8dfb1cd32bd5030ef61c256df8a1000d7e5932589e89ba174","observation_id":"7fb67258-e95d-47ff-9d84-333c815b8a3b","resolution":{"observed_at":"2026-08-16T05:52:50.462406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12248","last_updated":"2024-10-16T05:20:32Z","snapshot_observed_at":"2026-08-16T13:08:56.637314Z","submitted_at":"2024-10-16T05:20:32Z","title":"CoFE-RAG: A Comprehensive Full-chain Evaluation Framework for Retrieval-Augmented Generation with Enhanced Data Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12248","snapshot_observed_at":"2026-08-16T05:52:50.467121Z","title":"CoFE-RAG : A comprehensive full-chain evaluation framework for retri eval- augmented generation with enhanced data diversity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.467121Z"},"links":{"cited_paper":"/paper/2410.12248","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:5f6c6f3c1f7fff735c3b3e39ccc43d89d8e0881a6e87ddae8aacf2b9484ced8f","observation_id":"5c912b17-48f1-494d-a217-2c0d989ddc56","resolution":{"observed_at":"2026-08-16T05:52:50.467121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-19T16:36:17.445569Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-08-16T05:52:50.475100Z","title":"Fact, fetch, and reason: A uniﬁ ed evaluation of retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.475100Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:d6eee326f88274fa7d930a958425aa433a21f56f43d2d2485b2ae65e5243d7c4","observation_id":"1774fc7b-69ba-4c3d-966c-1134d127121c","resolution":{"observed_at":"2026-08-16T05:52:50.475100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01262","last_updated":"2025-03-03T22:45:57Z","snapshot_observed_at":"2026-08-16T13:28:57.803383Z","submitted_at":"2024-08-02T13:35:11Z","title":"RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01262","snapshot_observed_at":"2026-08-16T05:52:50.482124Z","title":"RAGEval: Scenario speciﬁc RAG evaluation dataset generation framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.482124Z"},"links":{"cited_paper":"/paper/2408.01262","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:b7db66c55f17a333574fc74b4f7a7024fcdbe98fedaff51d18876a7b63a55303","observation_id":"2ecba298-6c25-4802-bedb-e60fb3efa999","resolution":{"observed_at":"2026-08-16T05:52:50.482124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1068343","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:51.439933Z","title":"Multimodal re- trieval augmented generation evaluation benchmark,","venue":null,"work_id":"7d93fe8c-760c-4145-afe0-df71f8295576","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.487181Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:1229fc273d536856bd090cc99ade710292ceb2f733cf3386aa48f6902556a6c7","observation_id":"302c887c-bd6c-4031-8cf4-d1c81a7bfc53","resolution":{"observed_at":"2026-08-16T05:52:51.448336Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01431","last_updated":"2023-12-20T11:54:11Z","snapshot_observed_at":"2026-08-18T12:39:46.626894Z","submitted_at":"2023-09-04T08:28:44Z","title":"Benchmarking Large Language Models in Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01431","snapshot_observed_at":"2026-08-16T05:52:50.492510Z","title":"Benchmarking large l anguage models in retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.492510Z"},"links":{"cited_paper":"/paper/2309.01431","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:f70d3ff1f6464f50dfe54e850eb826b77a1b2a2b907b4175d3e22d82c6e47642","observation_id":"7195bb04-fbbb-4c6e-a375-2ee7cd946089","resolution":{"observed_at":"2026-08-16T05:52:50.492510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03727","last_updated":"2025-04-24T22:33:02Z","snapshot_observed_at":"2026-08-19T17:51:28.455764Z","submitted_at":"2024-09-30T06:27:53Z","title":"FaithEval: Can Your Language Model Stay Faithful to Context, Even If \"The Moon is Made of Marshmallows\"","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03727","snapshot_observed_at":"2026-08-16T05:52:50.497905Z","title":"FaithEval: Can your language model stay faithf ul to context, even if","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.497905Z"},"links":{"cited_paper":"/paper/2410.03727","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:2f8bb933a7870503c18bfbf37e8542957d6a4520ff32405be9eafe364474ce00","observation_id":"ad4bc8f3-17c6-4878-aa9c-be5e52e03f2d","resolution":{"observed_at":"2026-08-16T05:52:50.497905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:50.502664Z","title":"A knowledge-cen tric benchmarking framework and empirical study for retrieval- augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.502664Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:b3de7e56bc241a3c1fa138e6683a97229187ce965439f44966746595e872cbbb","observation_id":"11ec0065-3897-4409-a431-8f516cf8210c","resolution":{"observed_at":"2026-08-16T05:52:50.502664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19804","last_updated":"2025-03-27T04:36:46Z","snapshot_observed_at":"2026-08-16T13:14:20.549416Z","submitted_at":"2024-09-29T22:04:26Z","title":"Does RAG Introduce Unfairness in LLMs? Evaluating Fairness in Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19804","snapshot_observed_at":"2026-08-16T05:52:50.507117Z","title":"Does RAG intro duce unfairness in LLMs? evaluating fairness in retrieval-augm ented generation systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.507117Z"},"links":{"cited_paper":"/paper/2409.19804","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:3bb8394a4c615ff88bf9d20a6bc481157d4f6d406845b70d89ca0fddd11b70a9","observation_id":"21227e61-2181-4306-83d2-504c4cc10c8e","resolution":{"observed_at":"2026-08-16T05:52:50.507117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07691","last_updated":"2024-09-12T01:51:06Z","snapshot_observed_at":"2026-08-16T13:19:17.554803Z","submitted_at":"2024-09-12T01:51:06Z","title":"Enhancing Q&A Text Retrieval with Ranking Models: Benchmarking, fine-tuning and deploying Rerankers for RAG","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07691","snapshot_observed_at":"2026-08-16T05:52:50.512404Z","title":"Enhancing q&a text retrieval with ranking models: Benchmarking, ﬁne-tuning and deploying rerankers for RAG","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.512404Z"},"links":{"cited_paper":"/paper/2409.07691","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:2eac65f577891546ad68bb153bc493344f7fd047c69524e84cdca3f5a9eff262","observation_id":"1cf8f6ce-944a-4a3e-8e68-5c66ab3e0451","resolution":{"observed_at":"2026-08-16T05:52:50.512404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23090","last_updated":"2024-10-30T15:06:32Z","snapshot_observed_at":"2026-08-17T22:31:10.514954Z","submitted_at":"2024-10-30T15:06:32Z","title":"CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23090","snapshot_observed_at":"2026-08-16T05:52:50.518272Z","title":"CORAL: Benchmarking multi- turn conversational retrieval-augmentation generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.518272Z"},"links":{"cited_paper":"/paper/2410.23090","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:055fd90d02c23ce6e6343cc236b03156c64c6c1d5961747f55ca30a7d99021ed","observation_id":"5bddf35e-797d-4b25-814b-5b1f8bc23558","resolution":{"observed_at":"2026-08-16T05:52:50.518272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15763","last_updated":"2024-09-26T05:43:08Z","snapshot_observed_at":"2026-08-16T13:15:59.754446Z","submitted_at":"2024-09-24T05:39:53Z","title":"IRSC: A Zero-shot Evaluation Benchmark for Information Retrieval through Semantic Comprehension in Retrieval-Augmented Generation Scenarios","version":2},"cited_work":{"arxiv_id":"2409.15763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15763","snapshot_observed_at":"2026-08-16T05:52:51.195121Z","title":"IRSC: A Zero-shot Evaluation Benchmark for Information Retrieval through Semantic Comprehension in Retrieval-Augmented Generation Scenarios","venue":"cs.IR","work_id":"cbd2a4ba-4e56-408d-b2f2-a065f414b9fc","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.523580Z"},"links":{"cited_paper":"/paper/2409.15763","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:5e610043449c8dff1f9ca32277f199e23b8d4c43518a746e64e472ef66294504","observation_id":"c129df0a-dbf9-4101-926e-8ef43fa8674d","resolution":{"observed_at":"2026-08-16T05:52:51.200754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05925","last_updated":"2024-07-08T13:32:14Z","snapshot_observed_at":"2026-08-17T10:02:24.796626Z","submitted_at":"2024-07-08T13:32:14Z","title":"Towards Optimizing and Evaluating a Retrieval Augmented QA Chatbot using LLMs with Human in the Loop","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05925","snapshot_observed_at":"2026-08-16T05:52:50.529508Z","title":"Towards op timizing and evaluating a retrieval augmented QA chatbot using LLMs with human in the loop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.529508Z"},"links":{"cited_paper":"/paper/2407.05925","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:2d9ba7bd05b4fdae255d1d7c85538c102315fd6f2ef62b80d2d594fbed587fd5","observation_id":"0e88ca3d-683d-4cad-ab11-859631eeb11d","resolution":{"observed_at":"2026-08-16T05:52:50.529508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15187","last_updated":"2024-10-31T10:10:28Z","snapshot_observed_at":"2026-08-18T13:13:11.498109Z","submitted_at":"2024-06-21T14:29:39Z","title":"UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-world Document Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15187","snapshot_observed_at":"2026-08-16T05:52:50.534038Z","title":"UDA: A benchmark suite for re trieval augmented generation in real-world document analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.534038Z"},"links":{"cited_paper":"/paper/2406.15187","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:ab4656cb3fdd1ccf67cd3acc9e97fd59b9f08bb133852ea04abe1326dad7abc3","observation_id":"8c3ef1f8-77ff-4c04-a5fc-e60e00bb6253","resolution":{"observed_at":"2026-08-16T05:52:50.534038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14783","last_updated":"2024-10-08T15:10:42Z","snapshot_observed_at":"2026-08-16T13:40:54.984541Z","submitted_at":"2024-06-20T23:20:34Z","title":"Evaluating RAG-Fusion with RAGElo: an Automated Elo-based Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14783","snapshot_observed_at":"2026-08-16T05:52:50.538867Z","title":"Evaluating R AG-fusion with RAGElo: an automated elo-based framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.538867Z"},"links":{"cited_paper":"/paper/2406.14783","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:7189bb1bd1338facde4cf8876023fe7647c625a1a77ea77bd19143a2c27a43ea","observation_id":"585f5aa8-a99f-48b3-ad4d-5952571535be","resolution":{"observed_at":"2026-08-16T05:52:50.538867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11005","last_updated":"2025-01-16T10:05:17Z","snapshot_observed_at":"2026-08-18T18:46:54.189928Z","submitted_at":"2024-06-25T20:23:15Z","title":"RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11005","snapshot_observed_at":"2026-08-16T05:52:50.543996Z","title":"RAGBench: Explainab le benchmark for retrieval-augmented generation systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.543996Z"},"links":{"cited_paper":"/paper/2407.11005","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:769cc697a6c9b95f806c08bf3e603a7c7599846c01bb4f36f9a778a46d8279be","observation_id":"2de3d60c-1d92-4164-9944-e00e1d8e0be5","resolution":{"observed_at":"2026-08-16T05:52:50.543996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03759","last_updated":"2024-08-16T21:59:59Z","snapshot_observed_at":"2026-08-16T13:25:55.192396Z","submitted_at":"2024-08-16T21:59:59Z","title":"VERA: Validation and Evaluation of Retrieval-Augmented Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03759","snapshot_observed_at":"2026-08-16T05:52:50.548589Z","title":"VERA: V alidation and evaluation of retrieval-augmented systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.548589Z"},"links":{"cited_paper":"/paper/2409.03759","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:79cdc33d0d2e99375871e5a17b7d7144a39383c47aa648284f2521280abe63bf","observation_id":"ba24deba-a572-403b-9415-aa5f05bded64","resolution":{"observed_at":"2026-08-16T05:52:50.548589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06458","last_updated":"2024-06-10T16:46:22Z","snapshot_observed_at":"2026-08-16T13:44:28.248244Z","submitted_at":"2024-06-10T16:46:22Z","title":"Evaluating the Retrieval Component in LLM-Based Question Answering Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06458","snapshot_observed_at":"2026-08-16T05:52:50.553454Z","title":"Evaluating the re trieval component in LLM-based question answering systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.553454Z"},"links":{"cited_paper":"/paper/2406.06458","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:c17bd9522bda7886dea892f1d510ab3b28593cddfef9edfd318592d54478d20c","observation_id":"ec33de68-b87c-4551-abaa-33da5318b6ca","resolution":{"observed_at":"2026-08-16T05:52:50.553454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03888","last_updated":"2024-09-24T11:39:42Z","snapshot_observed_at":"2026-08-16T14:12:13.626260Z","submitted_at":"2024-03-06T17:48:06Z","title":"FaaF: Facts as a Function for the evaluation of generated text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03888","snapshot_observed_at":"2026-08-16T05:52:50.559787Z","title":"FaaF: Facts as a function f or the evaluation of generated text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.559787Z"},"links":{"cited_paper":"/paper/2403.03888","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:f2a0eda145686fbcdcc3efaa17d99ba83413f941b52bdaacaad7344e0efab191","observation_id":"39bea0a5-e93c-4509-929e-2ab72754cdd1","resolution":{"observed_at":"2026-08-16T05:52:50.559787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08801","last_updated":"2024-10-11T13:36:13Z","snapshot_observed_at":"2026-08-16T13:10:19.831288Z","submitted_at":"2024-10-11T13:36:13Z","title":"A Methodology for Evaluating RAG Systems: A Case Study On Configuration Dependency Validation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08801","snapshot_observed_at":"2026-08-16T05:52:50.565643Z","title":"A method ology for evaluating RAG systems: A case study on conﬁguration depend ency validation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.565643Z"},"links":{"cited_paper":"/paper/2410.08801","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:a7c998d1853d6f8c9757f301d3913781f5e4ef59292200a63350785242444085","observation_id":"3810b43b-48e0-4066-9eb7-f71c72fc9a47","resolution":{"observed_at":"2026-08-16T05:52:50.565643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01102","last_updated":"2024-07-01T09:09:27Z","snapshot_observed_at":"2026-08-19T21:45:47.807371Z","submitted_at":"2024-07-01T09:09:27Z","title":"BERGEN: A Benchmarking Library for Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01102","snapshot_observed_at":"2026-08-16T05:52:50.571397Z","title":"BERGEN: A benchmarking library for retrieval-augmented generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.571397Z"},"links":{"cited_paper":"/paper/2407.01102","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:58b57129c648cb3990e9621477757a6a0d483d3436ac2758724cd0c4cd3e3d18","observation_id":"757a155d-ae07-4ede-98a0-602c866bdc70","resolution":{"observed_at":"2026-08-16T05:52:50.571397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.130508Z","title":"Evaluating lar ge language models for arabic sentiment analysis: A comparati ve study using retrieval-augmented generation,","venue":null,"work_id":"2e1ae8de-91de-4a72-8934-e4a8db00062c","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.577667Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:a5ffe4982b1f91aab54c94b860be41096e7ac6ef717c8ac562bcf9d00e03baff","observation_id":"08c49097-cf5e-40ef-9e54-db072fa65db5","resolution":{"observed_at":"2026-08-16T05:52:52.135952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.108404Z","title":"ReEval: Automatic hallucination evaluation for retrieval-augmen ted large language models via transferable adversarial attacks,","venue":null,"work_id":"f5874ca9-07f8-463e-b067-fab29efc8cdc","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.583168Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:86bba4b9ad1a73b47c0f6953db7c584f43170411d5511e8a5ef9282d50fa7e3a","observation_id":"a3ce4fb8-9f2b-4f88-a7a9-0c89a5d76270","resolution":{"observed_at":"2026-08-16T05:52:52.113985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13622","last_updated":"2024-05-22T13:14:11Z","snapshot_observed_at":"2026-08-16T13:50:38.064160Z","submitted_at":"2024-05-22T13:14:11Z","title":"Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13622","snapshot_observed_at":"2026-08-16T05:52:50.587880Z","title":"Automated evaluation of retrieval-augmented language models with ta sk-speciﬁc exam generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.587880Z"},"links":{"cited_paper":"/paper/2405.13622","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:4a86685ef272b5a3b20840e21a63182f5d9707548f860d4243d759ff8910708e","observation_id":"78fc351b-0be1-4490-98a0-4d3620a01469","resolution":{"observed_at":"2026-08-16T05:52:50.587880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04744","last_updated":"2024-11-01T05:30:17Z","snapshot_observed_at":"2026-08-16T17:20:20.539409Z","submitted_at":"2024-06-07T08:43:07Z","title":"CRAG -- Comprehensive RAG Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04744","snapshot_observed_at":"2026-08-16T05:52:50.594834Z","title":"CRAG – comprehensive RAG benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.594834Z"},"links":{"cited_paper":"/paper/2406.04744","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:74550c2b6060cc4ab6e82268dd98bfc51277c59fe0d47f95f0e786cde5815f8b","observation_id":"99c2ea8c-678c-4857-8c58-56dff351cb75","resolution":{"observed_at":"2026-08-16T05:52:50.594834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.091022Z","title":"Automatic questi on answering for the linguistic domain – an evaluation of LLM knowledge ba se extension with RAG,","venue":null,"work_id":"95affc05-06d6-44a2-9125-4683d54f4e6c","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.601436Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:dba640aac16459b2c54655bd6d2b6b633230b91fcf3faf3c0bf9e6152ac7b2ca","observation_id":"1e480352-fdb3-4fd9-9b21-ff842d616c8d","resolution":{"observed_at":"2026-08-16T05:52:52.097013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06399","last_updated":"2024-08-03T15:12:02Z","snapshot_observed_at":"2026-08-16T13:44:29.912224Z","submitted_at":"2024-06-10T15:52:49Z","title":"Should We Fine-Tune or RAG? Evaluating Different Techniques to Adapt LLMs for Dialogue","version":3},"cited_work":{"arxiv_id":"2406.06399","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06399","snapshot_observed_at":"2026-08-16T05:52:50.990175Z","title":"Should We Fine-Tune or RAG? Evaluating Different Techniques to Adapt LLMs for Dialogue","venue":"cs.CL","work_id":"b261e81e-1030-4dc4-8857-72c0db5e980e","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.606011Z"},"links":{"cited_paper":"/paper/2406.06399","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:220be2ebed6ce238ec130ad7f63c53a45dfe3d502a7c844cbd4235ef0178e93a","observation_id":"ee5418b3-67ec-40e7-9a9a-5fa8faa3f34e","resolution":{"observed_at":"2026-08-16T05:52:50.998056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.073463Z","title":"Benchmarking retrieval augme nted genera- tion in quantitative ﬁnance,","venue":null,"work_id":"05bd33f8-8d84-488e-b73d-e854704a9c26","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.611136Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:10f73fcf026132a4012e4cd5406479685ed77cdf165cb4d97bad0db6fadce7d6","observation_id":"12ad363b-eb04-463d-b03b-51d12e6c5d51","resolution":{"observed_at":"2026-08-16T05:52:52.078932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.054978Z","title":null,"venue":null,"work_id":"857e6078-ad7f-488f-ac82-205e2cd12618","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.615167Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:ef44eafea0224928c7afd181bcc5c3af272d3677b2d6562666f2b4caadbfa1b7","observation_id":"f495307d-e889-4653-a3f6-362212845869","resolution":{"observed_at":"2026-08-16T05:52:52.061193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18064","last_updated":"2024-11-07T04:03:04Z","snapshot_observed_at":"2026-08-16T13:39:33.568488Z","submitted_at":"2024-06-26T04:49:41Z","title":"Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18064","snapshot_observed_at":"2026-08-16T05:52:50.619509Z","title":"Ev aluating quality of answers for retrieval-augmented generation: A s trong LLM is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.619509Z"},"links":{"cited_paper":"/paper/2406.18064","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:f33f8383190d8f2bed1b587c20431202efce7465d5c1c0834f516ea4432c8e6a","observation_id":"ae415f85-0fc8-427f-9958-03f8fabe28f7","resolution":{"observed_at":"2026-08-16T05:52:50.619509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13716","last_updated":"2025-03-29T01:11:30Z","snapshot_observed_at":"2026-08-16T13:08:20.567442Z","submitted_at":"2024-10-17T16:18:49Z","title":"MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13716","snapshot_observed_at":"2026-08-16T05:52:50.625795Z","title":"MIRAGE- bench: Automatic multilingual benchmark arena for retriev al-augmented generation systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.625795Z"},"links":{"cited_paper":"/paper/2410.13716","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:3f165c2b907591a8df7878a7d2963951782afb96db0d7bc8544ba8d9865c8ffc","observation_id":"5d49749a-4131-49d1-8729-74cc71a8e6fe","resolution":{"observed_at":"2026-08-16T05:52:50.625795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11424","last_updated":"2024-06-17T11:22:25Z","snapshot_observed_at":"2026-08-18T05:17:47.363864Z","submitted_at":"2024-06-17T11:22:25Z","title":"Evaluating the Efficacy of Open-Source LLMs in Enterprise-Specific RAG Systems: A Comparative Study of Performance and Scalability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11424","snapshot_observed_at":"2026-08-16T05:52:50.631621Z","title":"Evaluating the efﬁcacy of open-sour ce LLMs in enterprise-speciﬁc RAG systems: A comparative study of per formance and scalability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.631621Z"},"links":{"cited_paper":"/paper/2406.11424","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:76226af7e9063b00f0b72a6232538900449623bfa0c8b08737fdb05798fce869","observation_id":"4764630f-bec1-4f0a-bc9f-3d31dfa11ba9","resolution":{"observed_at":"2026-08-16T05:52:50.631621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.039263Z","title":"BERT: Pre-training of deep bidirectional transformers for language understan ding,","venue":null,"work_id":"54720def-0361-4f87-bf98-e706d2e54a2c","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.636369Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:be3c06e7c5ba7777c1e8aa16b2c01482e7dbf5474f2385fe47c032c802f960f5","observation_id":"b796f565-4997-4db8-b319-27dba7745f4a","resolution":{"observed_at":"2026-08-16T05:52:52.044193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1810.0480","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:50.911530Z","title":"Available: http://arxiv.org/abs/1810.0480 5","venue":null,"work_id":"9acde466-cf4e-4b62-bda7-6ecf11587aea","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.640689Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:a11ec991d6be287521a53f84eaa68b0d7bd5dcddc09df2d46772f13f1ff30df9","observation_id":"2a4accce-5f40-4819-bd6b-87fb3b6afcad","resolution":{"observed_at":"2026-08-16T05:52:50.923054Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-16T05:52:50.644874Z","title":"Sentence-BERT: Sentence embeddings using siamese BERT-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.644874Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:27aa7affb4332e73595ed9f14dc3337059f6e4b80848e906862471683b89c2ce","observation_id":"d1282e4a-4315-4d5e-867f-4957748d6e58","resolution":{"observed_at":"2026-08-16T05:52:50.644874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-16T05:52:50.649252Z","title":"BERTScore: Evaluating text generation with BERT","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.649252Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:5aef67a98e47d41806f3d7e2386882305c704f1c422431bcfc83b32fd6915307","observation_id":"248157ed-26fb-4d5c-9058-47a950d09450","resolution":{"observed_at":"2026-08-16T05:52:50.649252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07197","last_updated":"2022-10-13T17:17:03Z","snapshot_observed_at":"2026-08-19T17:50:55.053057Z","submitted_at":"2022-10-13T17:17:03Z","title":"Towards a Unified Multi-Dimensional Evaluator for Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07197","snapshot_observed_at":"2026-08-16T05:52:50.653425Z","title":"Towards a uniﬁed multi-dimensional evaluator f or text generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.653425Z"},"links":{"cited_paper":"/paper/2210.07197","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:34c84297efe288dcf694123cccc072b8a7ce263e5107c7d64a0e887a1542149b","observation_id":"69d2c35a-ad0d-4dc0-b2eb-2ebf193af01a","resolution":{"observed_at":"2026-08-16T05:52:50.653425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.024205Z","title":"[Online]","venue":null,"work_id":"439e79e0-0a56-43b0-8b59-cf776e4be49d","year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.659121Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:f28c7dceb9f637c1c46c9333fd40a1f4a9c3f81df5361a8aa5cfcc8658ae4af8","observation_id":"5e2ada04-eafe-4b87-8235-6a879d8215aa","resolution":{"observed_at":"2026-08-16T05:52:52.029329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:52.007752Z","title":"Evaluation of orca 2 against other LLMs for retrieval augmented generation,","venue":null,"work_id":"ca799b11-8bb9-4578-9986-7ef9c160e4c4","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.663099Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:d81855fb2e9021b3d529845238e757bcea509583df8aca2151487ddc82dfc2c2","observation_id":"e214b3a4-4bca-4ef3-b9e7-5ba3a0a558df","resolution":{"observed_at":"2026-08-16T05:52:52.013493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12558","last_updated":"2025-02-21T19:04:28Z","snapshot_observed_at":"2026-08-18T16:39:26.947799Z","submitted_at":"2024-09-19T08:26:45Z","title":"RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12558","snapshot_observed_at":"2026-08-16T05:52:50.668532Z","title":"RAD-bench: Evaluating large language mode ls capabilities in retrieval augmented dialogues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.668532Z"},"links":{"cited_paper":"/paper/2409.12558","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:9dd2a42fba261460e8bd7ce2f21731b5aaff25ca537eaab55295c745ef7ff48e","observation_id":"037d4ad9-20fd-4f75-85d7-27851b8d649f","resolution":{"observed_at":"2026-08-16T05:52:50.668532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19019","last_updated":"2024-09-24T23:33:07Z","snapshot_observed_at":"2026-08-18T09:37:30.248660Z","submitted_at":"2024-09-24T23:33:07Z","title":"RAGProbe: An Automated Approach for Evaluating RAG Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19019","snapshot_observed_at":"2026-08-16T05:52:50.673328Z","title":"RAGProbe: An automated approach for evaluating RAG applic ations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.673328Z"},"links":{"cited_paper":"/paper/2409.19019","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:0200721f1490b355e4fbefd850923d2be1803f612cbcd907e6f84c66f44f7fce","observation_id":"2d0c1ad4-d94f-428c-92e0-ba674e36cdb5","resolution":{"observed_at":"2026-08-16T05:52:50.673328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02932","last_updated":"2024-10-03T19:25:05Z","snapshot_observed_at":"2026-08-16T13:12:48.762373Z","submitted_at":"2024-10-03T19:25:05Z","title":"Intrinsic Evaluation of RAG Systems for Deep-Logic Questions","version":1},"cited_work":{"arxiv_id":"2410.02932","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02932","snapshot_observed_at":"2026-08-16T05:52:50.723753Z","title":"Intrinsic Evaluation of RAG Systems for Deep-Logic Questions","venue":"cs.AI","work_id":"323e4fb6-915e-42a3-a440-d668f7e74233","year":2024},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.677948Z"},"links":{"cited_paper":"/paper/2410.02932","citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:3c72809758e127b845cd36d224fb6c68b858540d84dbbf0f4065615575d118c4","observation_id":"356a5e99-87fe-4f18-83a6-bdbf0ac13744","resolution":{"observed_at":"2026-08-16T05:52:50.730844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:51.988035Z","title":"[Online]","venue":null,"work_id":"e57aff84-4902-4a50-b658-a0aa94e10027","year":2023},"citing_paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:50.682341Z"},"links":{"citing_paper":"/paper/2504.20119"},"observation_digest":"sha256:b41720c9ead6f460f12d67b558214a20b358db8849c795ef0bc04bd2494fc6af","observation_id":"fc822c81-0989-41fc-8227-947ea4baa4ce","resolution":{"observed_at":"2026-08-16T05:52:51.993401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.20119","last_updated":"2025-05-01T13:03:37Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-17T19:46:38.442290Z","submitted_at":"2025-04-28T08:22:19Z","title":"Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":10,"verified_fuzzy":14},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2504.20119."}