{"as_of":"2026-08-10T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12b275f455d3b89d11ba4f611ff82a9d6a89ce43fdc1a3b335ec0c40d7202269","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T03:56:49.260151Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:01:58.830209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24334","snapshot_observed_at":"2026-07-31T18:01:58.830209Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24332","last_updated":"2026-07-27T12:09:03Z","snapshot_observed_at":"2026-08-09T08:20:28.132885Z","submitted_at":"2026-07-27T12:09:03Z","title":"Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T18:01:58.830209Z"},"links":{"cited_paper":"/paper/2604.24334","citing_paper":"/paper/2607.24332"},"observation_digest":"sha256:15c1d61dc8a9554603bb1285aefa5017ddc8c7e13e704a2477f0e4f8f8c4a066","observation_id":"93496f4a-4c83-4546-bc98-236f84f9ee3d","resolution":{"observed_at":"2026-07-31T18:01:58.830209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.24334/citation-record","integrity":"/paper/2604.24334/integrity","json":"/paper/2604.24334/citation-record.json","paper":"/paper/2604.24334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / www","venue":null,"work_id":"c42d4dfa-e260-4376-94f7-ce33cf74aff7","year":2025},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:83487b00b7df49466fd2b8e12c1ead62255964aedff8c55d9063d9e3ffb4a56e","observation_id":"cc4fcaea-35e3-4889-b594-0d9c8f1af851","resolution":{"observed_at":"2026-05-26T21:28:22.864723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","venue":null,"work_id":"fd6c65f2-cde0-449b-bde3-a905c0426b5e","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:fac6f152db92360096097ded6b293823b1231fa97a5b0b5929ab4950a33414f1","observation_id":"ce0bebd5-d644-49c2-b63c-e1e20c800688","resolution":{"observed_at":"2026-05-26T21:28:22.893578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent dirichlet allocation","venue":null,"work_id":"c8ee83be-3f9a-44b5-9b01-0fb67364480a","year":2003},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:07ceb3d61f8a175c33b9f84d198a79484c469b63d1c1febb28b554c53f3b90cc","observation_id":"4cd5a2b4-3581-40b1-88e8-31291e0ac286","resolution":{"observed_at":"2026-05-26T21:28:22.887290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-07-06T12:16:41.817858Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:90af6b333619a12d2f922a3b25823ddc77070abf8d36806e3f5fbeb8ae6cf210","observation_id":"7d25e897-9d36-4f74-9943-908df51fb0c0","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the resemblance and containment of documents","venue":null,"work_id":"9d7ce181-a20a-4ded-8e0e-6670c35c758c","year":1997},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:b105efaa620f16eed362c564ac15b0d12bab42b77e92e51f80378cc6ba467d77","observation_id":"b20a6e91-1996-417d-8565-65ae950b9319","resolution":{"observed_at":"2026-05-26T21:28:22.889999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identifying and filtering near-duplicate documents","venue":null,"work_id":"38c19335-52fd-48d7-8b25-5b9838bc4781","year":2000},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:21f31e6973b05459f90526c1d94e0ac92462a7f679d0d8f68085e67320de2161","observation_id":"6be7762d-ccb1-4605-8209-7287d75558fe","resolution":{"observed_at":"2026-05-26T21:28:22.881745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":"2402.03216","doi":"10.48550/arxiv.2402.03216","metadata_source":"pith","pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","venue":"cs.CL","work_id":"a9435752-4e49-42bd-95b4-0fec975633c8","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:dd6c1cf02ee51422547eabca85d0838cb69b205909de909c098f234d67c92906","observation_id":"5ba8a442-3f5f-43be-8662-df87d84bf28f","resolution":{"observed_at":"2026-05-11T22:39:03.722424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03849","last_updated":"2022-10-07T23:48:50Z","snapshot_observed_at":"2026-08-07T22:01:39.197177Z","submitted_at":"2022-10-07T23:48:50Z","title":"ConvFinQA: Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering","version":1},"cited_work":{"arxiv_id":"2210.03849","doi":"10.48550/arxiv.2210.03849","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ConvFinQA: Exploring the chain of numerical reasoning in 20 conversational finance question answering","venue":"arXiv (Cornell University)","work_id":"36c74fad-5676-4ef0-bbc7-fb4f7022c0da","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2210.03849","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:08ea1554471e28cca656b24a139f83de638c2a6a726529a5e80bdba8c35c1798","observation_id":"10e574d9-3ce3-4e00-a19a-445892a20c60","resolution":{"observed_at":"2026-05-09T00:14:28.150782Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"original-date: 2022-10-05T17:58:44Z","venue":null,"work_id":"59a1d8af-25a2-4203-acd1-e6384b9ce0a0","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:98be862f7765832dc513b29f02f78138580c4e678eadbff4a0395b382fff64a4","observation_id":"40145df3-59a1-4c7a-a37f-021fc81ae235","resolution":{"observed_at":"2026-05-26T21:28:22.878683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:2a26cd2cc2e052e7297427519dd7e764128ee1b20c4c4b31213de6d835b85c6d","observation_id":"76a5cc8b-b925-4b06-a6d6-586e06a9c24c","resolution":{"observed_at":"2026-05-15T17:25:08.436185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20936","last_updated":"2025-02-28T10:46:52Z","snapshot_observed_at":"2026-08-07T21:59:24.938319Z","submitted_at":"2025-02-28T10:46:52Z","title":"WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval","version":1},"cited_work":{"arxiv_id":"2502.20936","doi":"10.48550/arxiv.2502.20936","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2502.20936 [cs]","venue":"arXiv (Cornell University)","work_id":"93ce87c4-9ad8-433d-80c2-8f91520715d1","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2502.20936","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:6f34f245228fe3e63f9c673fb6bd122c547af1543f55a2fab7b7270bbd8fa2a9","observation_id":"4db77d1c-8d2c-4a0d-aac6-758f34577928","resolution":{"observed_at":"2026-05-09T00:14:28.063092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.99.url:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Precise Zero-Shot Dense Retrieval without Relevance Labels","venue":null,"work_id":"bc6481d8-652d-42a1-8e81-5134671f1ba4","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:6908e85061f572b6ebdc05edadbfec1b2fcf76d13a73ef275169bec979ac3e76","observation_id":"d7d2643d-5ae1-4d91-8668-905a3b79c5c0","resolution":{"observed_at":"2026-05-09T00:14:28.167176Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2312.10997","doi":"10.1186/1476-072x-8-72","metadata_source":"pith","pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","venue":"cs.CL","work_id":"b80d2790-6cd9-4c87-b3c4-de404f99a80e","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:872ff68644a2657a3867f654e49514ba29ccaec1add7c81f0b6e50c5081c8495","observation_id":"272458cc-b7e2-4f5f-8455-263e294be037","resolution":{"observed_at":"2026-05-09T00:14:28.145332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":"2203.05794","doi":"10.1037/0003","metadata_source":"pith","pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","venue":"cs.CL","work_id":"fe7000f5-9930-49ed-ba20-6975a338b713","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:2cf7c9db19e8b2164eabdf20f7dec46e4877d1c3a1e1ada034c6e1925b3f51c3","observation_id":"5d7d6a41-21ef-4fe7-a258-b3adf716a04d","resolution":{"observed_at":"2026-05-11T21:51:33.648345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":"2002.08909","doi":"10.48550/arxiv.2002.08909","metadata_source":"pith","pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","venue":"cs.CL","work_id":"a397ddf8-b0b7-4e32-9d59-fb6ea67ac287","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:8bfcbb511568f07cb8d524a288d842359acf4c48859c2eae4cabe5fd63eaac94","observation_id":"730af53a-1eee-484b-9d96-151eada96ef2","resolution":{"observed_at":"2026-05-15T09:59:16.231557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ed56a3a1-0295-41f8-8a1b-d8f3e9b4c8b4","year":null},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:ef4d007651788c0ab2794c2c1d4c7823d5c6766e4e899cb943bf74575a84e052","observation_id":"793c7ae9-0a6e-4fd5-8981-0a72b4b757f5","resolution":{"observed_at":"2026-05-26T21:28:22.871515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04701","last_updated":"2025-07-07T17:49:51Z","snapshot_observed_at":"2026-08-08T08:39:08.267633Z","submitted_at":"2024-09-07T03:54:46Z","title":"Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models","version":3},"cited_work":{"arxiv_id":"2409.04701","doi":"10.48550/arxiv.2409.04701","metadata_source":"pith","pith_arxiv_id":"2409.04701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Late chunking: Contextual chunk embeddings using long-context embedding models","venue":"cs.CL","work_id":"e1da74cb-c1c9-4b5b-a16e-7d3cda276fc3","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2409.04701","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:a9a4de147c576e700eeb8b145dcaeda82827858fd9eabfdb90116b9c14e7637c","observation_id":"c1551767-024f-4310-8e36-69cffa56c4ba","resolution":{"observed_at":"2026-05-11T21:51:33.688605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.1212303","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:16:57.966770Z","title":"author Montani, I","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"21f271e7-c123-4e13-856a-053f2da387a8","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:2a52e54d6865578c4a40420b910f06d68d67a6f6371a2fdc99703b83d65a341b","observation_id":"28ea42ca-97d6-4b8e-88d4-5bf01a324eea","resolution":{"observed_at":"2026-05-09T00:14:28.171140Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:08:47.996614+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:08:47.996614+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.eacl-main.74","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","venue":null,"work_id":"b7f86aa5-b9b1-42ad-b0cc-8d6f7ab85b04","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:59d12829304963185ac35f542cf11bdcd339f7f7ba750c590b9b7eef5d05e74e","observation_id":"bae61d07-2286-4ae3-9ab2-8b939eb81a2a","resolution":{"observed_at":"2026-05-09T00:14:28.136380Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-30T14:55:32.844017+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T14:55:32.844017+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":"2004.04906","doi":"10.48550/arxiv.2004.04906","metadata_source":"pith","pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","venue":"cs.CL","work_id":"3d6f2008-b001-4542-ba3f-192f6880c74b","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:671a554b81b07e2227fdc842889598978f5a6f2f58c90789cc22e9e825075338","observation_id":"2f6cdeaa-b1aa-42cc-ae09-7b4fb6d06969","resolution":{"observed_at":"2026-05-15T21:24:42.733368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.577.url:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deduplicating Training Data Makes Language Models Better","venue":null,"work_id":"049e8cd2-dea2-4cee-82da-0c6358bb886c","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:928f8627ce2177f74773ca8abb66bef1d018be6a20f6bebd379ccc442f1f9049","observation_id":"3f2e66ff-f9d3-4558-8622-ae98dc496755","resolution":{"observed_at":"2026-05-09T00:14:28.090922Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ullman.Mining of Massive Datasets","venue":null,"work_id":"2be79296-3ee2-49d9-9088-398ed48d222b","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:914a5e034985e4491acb4494e46603c9df4b26113dfe45d8366d8dfd582698f2","observation_id":"3994e180-d176-4b78-a5cf-24838028c059","resolution":{"observed_at":"2026-05-26T21:28:22.897070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":"2005.11401","doi":"10.1145/3626772.3657717","metadata_source":"pith","pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","venue":"cs.CL","work_id":"27eaec54-c105-4969-8188-da5f0fca3688","year":2020},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:41270a27f94beddc6c8fd057f129b41417b9fdcbe04481447f71f0460c801d7f","observation_id":"47188752-5c92-45b9-bea2-d69bc39d64d8","resolution":{"observed_at":"2026-05-10T20:41:58.301631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:3c902edd0f712588a475ba86738828d50bed91d6b829a207fa47360130e75474","observation_id":"c21c33ae-9956-45b9-93e1-33b9ccccbdc7","resolution":{"observed_at":"2026-05-11T21:51:33.679466Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":"2202.12837","doi":"10.48550/arxiv.2202.12837","metadata_source":"pith","pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","venue":"cs.CL","work_id":"d2b537df-825d-4427-9575-fc0664c0962a","year":2022},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:8f1d01ba7ccf1c449aca94d8802441ad745bbc8b1baab659ae4d71ab697b5aa1","observation_id":"92b3a032-107f-4028-a845-66d0504c2fe4","resolution":{"observed_at":"2026-05-15T09:51:47.316034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:22:50.486187+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"48ec9e82-aaab-445a-9935-dc932ae7d481","year":2023},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:bebbc7e296fada1788a1ef8ebcbfe5d6588f89ef8153a27443aa87104b8d071a","observation_id":"f7b58db5-6f3b-48ca-8af1-997509c250ba","resolution":{"observed_at":"2026-05-26T21:28:22.900616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"June 2021.URL: https : / / huggingface","venue":null,"work_id":"6dddd8af-9d84-4cc0-af8c-0bd08addfbd5","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:9d32316bd6e8264fb4b0dca369e20ee0961a2a5faab59ffa6b09240739858af8","observation_id":"3b7b0a0b-1ac8-4e9b-b59c-c4690a7b66f6","resolution":{"observed_at":"2026-05-26T21:28:22.868612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:bdca6fff53292706fea2a1880a00e4408def3ef9491cfdb505dfcf111f1f4a5d","observation_id":"84e6e3cb-cfa3-4355-a40b-24763ad83690","resolution":{"observed_at":"2026-05-10T14:54:09.090339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10276","doi":"10.48550/arxiv.2510.10276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the middle: An emergent property from information retrieval demands in LLMs","venue":"ArXiv.org","work_id":"55be2a17-4c66-4a7e-a242-a7fc4c579c96","year":2025},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:3a07aadf4d5b31df92853e9e39a9752d6f1644eec8b8f56adfef749ebcf796c4","observation_id":"49f505c4-764e-4c9b-95d9-357e99fbcc63","resolution":{"observed_at":"2026-05-09T00:14:28.128955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18059","last_updated":"2024-01-31T18:30:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-31T18:30:21Z","title":"RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval","version":1},"cited_work":{"arxiv_id":"2401.18059","doi":"10.48550/arxiv.2401.18059","metadata_source":"pith","pith_arxiv_id":"2401.18059","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval","venue":"cs.CL","work_id":"e941569c-fee0-4d1f-bfe0-7e888d152264","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2401.18059","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:766893f8c44eb8a9f3a291f5fe8ff85c869482e6c88619f26bf10e6eb3c6c8ad","observation_id":"30cac83d-b86c-4697-a24b-0cc0189587f9","resolution":{"observed_at":"2026-05-15T13:07:16.607810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"en-US.URL: https://bidenwhitehouse.archives.gov/state-of-the-union- 2024/(visited on 12/17/2025)","venue":null,"work_id":"fc6463da-13a3-4ee8-a201-b71ed9281bdd","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:c2e8d89d237adedf42e8653ce291274fd3fccb2c1b57f3aa2323d35342442f6c","observation_id":"625311e8-c691-476e-a5f7-32a7d1917661","resolution":{"observed_at":"2026-05-26T21:28:22.875069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval","venue":null,"work_id":"693393e3-7adb-41a4-a639-2c0b82936a93","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:4a6a56fac36af0001a8776ffa7b880aa3faa168f468b18a244fa8b163ef31505","observation_id":"bf412ea7-e9d5-498d-9890-4915a14f13f9","resolution":{"observed_at":"2026-05-26T21:28:22.884716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02485","last_updated":"2024-07-02T17:59:17Z","snapshot_observed_at":"2026-08-07T22:02:41.295637Z","submitted_at":"2024-07-02T17:59:17Z","title":"RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs","version":1},"cited_work":{"arxiv_id":"2407.02485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02485","snapshot_observed_at":"2026-07-02T22:27:25.337234Z","title":"RankRAG: Unifying context ranking with retrieval-augmented generation in LLMs","venue":null,"work_id":"799746f1-22c1-47b4-b912-8651f2095e41","year":2024},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2407.02485","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:9dbe262bdb48b0f3eb9248567c016ee3c25e7738a4941bd363fb9a10e7cc5eef","observation_id":"7fd9338a-9da1-4db5-8038-b4699f576411","resolution":{"observed_at":"2026-05-11T21:51:33.676238Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":2,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":2,"verified_exact":9,"verified_fuzzy":10},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2604.24334."}