{"as_of":"2026-08-20T08:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10f656bc3691585e0ababd86e57ab243264133fa413053df8c3e83f5b8fca983","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:34:01.593732Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:01.375758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:55:02.618954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":"2412.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16500","snapshot_observed_at":"2026-08-07T14:55:02.618954Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","venue":"eess.AS","work_id":"a425db0d-5793-4db7-832b-e7a7470e6957","year":2024},"citing_paper":{"arxiv_id":"2505.17326","last_updated":"2025-05-22T22:42:40Z","snapshot_observed_at":"2026-08-17T02:12:38.243625Z","submitted_at":"2025-05-22T22:42:40Z","title":"VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:01.375758Z"},"links":{"cited_paper":"/paper/2412.16500","citing_paper":"/paper/2505.17326"},"observation_digest":"sha256:2b3f096b28c05e1201f2f70048dabf56de92e4f32138431f62b39bab5e41e88b","observation_id":"b97890f7-17c2-4981-acd4-fe1cc4b5d397","resolution":{"observed_at":"2026-08-07T14:55:02.723063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16500/citation-record","integrity":"/paper/2412.16500/integrity","json":"/paper/2412.16500/citation-record.json","paper":"/paper/2412.16500"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.174437Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":"bdf88cc7-41a5-41d6-ab9e-dfcfaeae31cf","year":2020},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.422535Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:4c2e86c957bf754afb6b0f8ab211491eb1d62fc34df5e937d537e28d8356bacc","observation_id":"80eb3137-2701-400b-962c-0f608cdad2d5","resolution":{"observed_at":"2026-08-11T10:34:02.180136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.156691Z","title":"MuRAG: Multimodal retrieval-augmented generator for open question answering over images and text,","venue":null,"work_id":"6c688190-db6a-4fac-b155-5fc9df05bcfe","year":2022},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.428686Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:fa298d1f2c0ba8abe534c9ec7776d7bf3de8c89f7eebf1d134bf801798b8f134","observation_id":"84b65983-1dc2-4833-9c0b-4da3151f8c4c","resolution":{"observed_at":"2026-08-11T10:34:02.162110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.138353Z","title":"Robust multi model rag pipeline for documents containing text, table & images,","venue":null,"work_id":"ef7d5d98-943c-48aa-9ac2-0634b7f5bc6d","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.434116Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:11de11f4e8a628125e4722f06afe133071881f9eff1ead2cc3c25bc5a78dcb48","observation_id":"39ca2426-c6be-42bc-922d-23e41597bfe7","resolution":{"observed_at":"2026-08-11T10:34:02.144348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.121457Z","title":"Spo- ken content retrieval—beyond cascading speech recognition with text retrieval,","venue":null,"work_id":"68853807-1c80-4537-84bb-4ebcd383d629","year":2015},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.439667Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:ca52e8e4e454a10689ed6d50498d6076df8af0759018942b6ac669c8b1fef4f7","observation_id":"60b72f7b-0e0d-43e5-b74e-15ce10ff1212","resolution":{"observed_at":"2026-08-11T10:34:02.126941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.104810Z","title":"Retrieval and browsing of spoken content,","venue":null,"work_id":"9f7244b9-4dc2-4cdf-b122-a2ea3a2443d5","year":2008},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.445300Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:009106909c600ddb670b7621dfbb71c6b8d24c2abcd4a76a6179634736441ab9","observation_id":"c4c1b470-422d-4b5a-80eb-72c500128016","resolution":{"observed_at":"2026-08-11T10:34:02.110068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.451168Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.451168Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:0651a1552773fbfff3adb04e7ae98c8ae221238be1958fdef50318821e483295","observation_id":"ba7ae7a4-2f8e-4c14-9420-1e49c7dd19aa","resolution":{"observed_at":"2026-08-11T10:34:01.451168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.077656Z","title":"MTEB: Massive text embedding benchmark,","venue":null,"work_id":"1a82199b-eab7-4427-aae1-e90bafe537ee","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.457101Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:0ae58ed6879b1651a362048a2ccd20d96ae2d11ac12b7ade85c286bf0c84bc8b","observation_id":"d03f8691-a22a-42f2-be8b-0e29458e1921","resolution":{"observed_at":"2026-08-11T10:34:02.082895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.059934Z","title":"OLISIA: a cascade system for spoken dialogue state tracking,","venue":null,"work_id":"a85f54f0-a871-4520-8215-ac4ae8990e57","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.462412Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:b355ec0ec286cb2110e93008440ca68d0c11b041873139af6486a66e7c8f74db","observation_id":"99dec45b-bbb6-4086-adbf-3055a5464571","resolution":{"observed_at":"2026-08-11T10:34:02.065497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.043263Z","title":"Towards end-to-end spoken language understanding,","venue":null,"work_id":"0513356e-f2c8-4e76-8e4e-edc8ce6afeef","year":2018},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.467782Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:7f84b1f19aaa8aa5771a5fefee82485c3d1d7146b24be27336e72170dc77f21b","observation_id":"edf4fadd-4547-48ed-af7d-26f78f191f11","resolution":{"observed_at":"2026-08-11T10:34:02.048320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:02.026052Z","title":"Why aren’t we NER yet? artifacts of ASR errors in named entity recognition in spontaneous speech transcripts,","venue":null,"work_id":"64ac48e5-0bba-427c-94cb-c28176082658","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.472945Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:aa07dbd52273714860fb0c18e4faf33ee1dc297e11de53360b3229e20b8ecd83","observation_id":"a9112a81-faf9-42f6-9787-23fc027e9026","resolution":{"observed_at":"2026-08-11T10:34:02.031321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.478392Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.478392Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:bf2ddcd366cf6dca290e406a5c71dd0a0bcaaf0c2926074338c6c9b222157ed8","observation_id":"8ae5eaac-430e-4c54-8f36-a34d044740a0","resolution":{"observed_at":"2026-08-11T10:34:01.478392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.998054Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to-caption augmen- tation,","venue":null,"work_id":"bbb78a0d-b4ea-4a93-b846-6195c54ddd0d","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.483448Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:16dd61ee9c61ee446e8924f9b795b7d938523b4664e724918858d085ef7f0ef9","observation_id":"2514954a-6bc6-46f5-87bb-86f39ee438c8","resolution":{"observed_at":"2026-08-11T10:34:02.003175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.983042Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":"48f090a6-7e48-47c2-8554-b5e859cc4073","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.488158Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:0418f49035937c13a39693901302b64db311a235ec753f08f28af3f271d60050","observation_id":"ed0286f4-3792-4a2c-aaa7-1bc7387d4cfd","resolution":{"observed_at":"2026-08-11T10:34:01.987577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.967339Z","title":"Contrastive learning with hard negative samples,","venue":null,"work_id":"6fbd9de1-ecb3-4451-ac37-b6921f3ef3ea","year":2021},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.492989Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:f03ea51bd9f5ed6eedb1cf375b989452def231c1b1afb94276ddf90cb7c5974b","observation_id":"26c5c16a-708f-4cb6-8f4d-84e0183889e4","resolution":{"observed_at":"2026-08-11T10:34:01.971950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.951784Z","title":"Why do we need large batchsizes in contrastive learning? a gradient-bias perspective,","venue":null,"work_id":"b0671c1b-9faa-4562-acce-afbba2b6901e","year":2022},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.497949Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:8c180def74530540ebd0dfa9c41a5e55db6b8f793727098d54b8fd73043f8a90","observation_id":"c7b95544-11e1-4f3c-a95d-1d8e3de65d64","resolution":{"observed_at":"2026-08-11T10:34:01.956476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.935607Z","title":"SONAR: sentence-level multimodal and language-agnostic represen- tations,","venue":null,"work_id":"2bee8c62-21e0-4e38-9ece-1f6b8f777b60","year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.502602Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:4b28882eea3a5183e0282525d8d9b2611bf2e2d07d4aef4e4bc6a48055d8261e","observation_id":"9a0790f5-60b6-42ed-a15b-b1d6987ce91d","resolution":{"observed_at":"2026-08-11T10:34:01.940828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.919447Z","title":"Audio retrieval with natural language queries,","venue":null,"work_id":"3ac26a5e-98ae-4524-86f5-70af40e206d9","year":2021},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.507919Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:385a14fcd10c2b5d2cb7816666319d146ee53546036c10936f7837830082b4cd","observation_id":"67e43f76-6cad-4edd-8452-8aac1dac2249","resolution":{"observed_at":"2026-08-11T10:34:01.924405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11559","last_updated":"2020-08-11T05:48:36Z","snapshot_observed_at":"2026-08-19T07:43:11.220172Z","submitted_at":"2019-10-25T07:46:39Z","title":"SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11559","snapshot_observed_at":"2026-08-11T10:34:01.513076Z","title":"Speechbert: Cross-modal pre-trained language model for end-to-end spoken question answering,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.513076Z"},"links":{"cited_paper":"/paper/1910.11559","citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:68bb2ea76d180242079877f83a08b402b9f24d5e12543874ded2f9943fad06d7","observation_id":"51a67ffe-e91a-40c1-aa01-4775cd0ba3ec","resolution":{"observed_at":"2026-08-11T10:34:01.513076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.902433Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":"69da71e5-455b-4ab8-aff1-e5f2d2b387e4","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.518207Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:16f0ee57d2e7366e01499cfe85a53bd2968fb806458fbfad4f3f6c137f1af856","observation_id":"a1f07396-8ef3-4204-81a1-bbfb223a65b0","resolution":{"observed_at":"2026-08-11T10:34:01.907394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01828","last_updated":"2024-02-02T18:23:09Z","snapshot_observed_at":"2026-08-16T14:22:02.539597Z","submitted_at":"2024-02-02T18:23:09Z","title":"Retrieval Augmented End-to-End Spoken Dialog Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01828","snapshot_observed_at":"2026-08-11T10:34:01.522941Z","title":"Retrieval augmented end-to-end spoken dialog models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.522941Z"},"links":{"cited_paper":"/paper/2402.01828","citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:b8e26c8df755c3f0c99c9de6877856ed4806b18da571d731c56087dc0bbc4a58","observation_id":"46ee1afd-8d3f-44e2-979d-f4bd80ab0a9f","resolution":{"observed_at":"2026-08-11T10:34:01.522941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.885833Z","title":"Speechdpr: End-to-end spoken passage retrieval for open-domain spoken question answering,","venue":null,"work_id":"8f1b9985-7efd-4801-8e8a-6e21c1d21e59","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.528930Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:318fdf8fe551d2e52bcbe9afd7c0512498a31974991e6ddfe1f36eb6bb2206d2","observation_id":"f30801ac-8bc5-4c37-8c01-246e62884db1","resolution":{"observed_at":"2026-08-11T10:34:01.891128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.868433Z","title":"Retrieval augmented end-to-end spoken dialog models,","venue":null,"work_id":"77c5d596-3230-4183-bfa8-5dd2e061f39a","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.533776Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:45228c3e49fd1017d5b60b2a2ac4206b6283d67f2fce75269e99b2599521e8b5","observation_id":"cc8d95bd-aaa4-4521-b796-b4ca13d099fb","resolution":{"observed_at":"2026-08-11T10:34:01.873780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.850898Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":"881a437f-c199-4f3e-9fde-5dec268acf2d","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.538960Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:5383484928276c819f55e3856d7b2e4bbc87dd826adc5303384922334be8b734","observation_id":"80b3516b-b725-4286-bbdd-2c265c5709ff","resolution":{"observed_at":"2026-08-11T10:34:01.856407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.832825Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"7bb0e679-02f8-42e3-b52e-139599b13472","year":2021},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.543232Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:db527c2cf45c2a52a755f61b1b98c14758cf7ddb36f38db67a32651c9b0f40d3","observation_id":"aec0e83a-8cee-4213-8c15-47daf8c489c3","resolution":{"observed_at":"2026-08-11T10:34:01.838272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.815250Z","title":"Prompting large language models with audio for general-purpose speech summarization,","venue":null,"work_id":"1956fc2f-1ff1-432c-a848-36370628f542","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.547778Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:ace029fd803497729e2768d29d4c782bef6822e1283d9f068954eef0f4e1ae32","observation_id":"52cd75fa-1e3a-4fb5-bb42-2cebc847cdde","resolution":{"observed_at":"2026-08-11T10:34:01.820592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.798075Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":"c918756d-ba4f-4449-a002-3a7038fe4a34","year":2019},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.552100Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:96695d1640fcdad21f5b9b51cccde12c67d1b95fce59967de99210d164762748","observation_id":"7ae6f0a0-52b8-47fd-a428-b97948288b39","resolution":{"observed_at":"2026-08-11T10:34:01.803413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.778054Z","title":"Improving text embeddings with large language models,","venue":null,"work_id":"7b9c8c6b-df64-4192-957c-35ae022130dd","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.557277Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:15e59e25280ec7bfa84aa907f98850db1fa9b5dc28f2cf79d9e72a9f09644b94","observation_id":"005b85e5-cd82-4d68-98c1-fa2b911e6bdb","resolution":{"observed_at":"2026-08-11T10:34:01.784231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-11T10:34:01.561642Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.561642Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:0b7d501eedd84127a8f68350d43cb8bf41bd92ff2a93051c34099ddf1bec2454","observation_id":"1fed0f5e-61b2-4c79-93c5-9b65e5f0c3f6","resolution":{"observed_at":"2026-08-11T10:34:01.561642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.759218Z","title":"Spoken squad: A study of mitigating the impact of speech recognition errors on listening comprehension,","venue":null,"work_id":"6d857bd9-4e01-45f4-97f5-22a4c822a117","year":2018},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.567131Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:fa223a75ca171f18795167563f7f616ff1b571f85b86635304b4371b25ef5a18","observation_id":"52ffbcbc-bb4c-47e2-9821-5f39c24c8c18","resolution":{"observed_at":"2026-08-11T10:34:01.764343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.741201Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"81414b1b-047f-4178-9bca-09ba56ee216f","year":2021},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.572675Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:0775cc16962f10019553a2613eca6b382f1b669bb77ed691129c27068fc1650e","observation_id":"d7e6ad55-28be-4e19-80e7-489c99aa0ab2","resolution":{"observed_at":"2026-08-11T10:34:01.746702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.724452Z","title":"SQuAD: 100,000+ questions for machine comprehension of text,","venue":null,"work_id":"e6883174-3ee1-4cc8-b8e2-156f72662aa1","year":2016},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.578224Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:08e1c723451c3b942e32bf0c6732eda35ecb22fe210813673371378e6f1ee23f","observation_id":"3b0cdaea-edae-486a-b9a4-8340b3ec3e03","resolution":{"observed_at":"2026-08-11T10:34:01.729565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.707361Z","title":"Introduction to the CoNLL-2003 shared task: Language-independent named entity recogni- tion,","venue":null,"work_id":"70e2cfe4-c25c-42bc-bc2b-8e1436900458","year":2003},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.583421Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:bba5de7a635df0b97ed728cb0e5b1908e6b532e777838aa0db9a76a2e2d5df90","observation_id":"86d84a70-c3a6-4037-a220-6e57cb779aa8","resolution":{"observed_at":"2026-08-11T10:34:01.712449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.687601Z","title":"Evaluation of rag metrics for question answering in the telecom domain,","venue":null,"work_id":"2e3eef68-9a64-48fa-ae84-dc244ca805d8","year":2024},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.588611Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:531079acf81ac87189553fee3c702141725b32b24b821e809868bde6e66c2979","observation_id":"3a5c6793-995a-4c02-9eee-4141dfd3d35a","resolution":{"observed_at":"2026-08-11T10:34:01.694861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:34:01.593732Z","title":"Librispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:34:01.593732Z"},"links":{"citing_paper":"/paper/2412.16500"},"observation_digest":"sha256:ebfdd7d5e3f4c39219036217924f1fb9f102322c98cfb4db7aa8deb13f2fd24a","observation_id":"b959645b-2a80-4083-bac5-148f25e17a30","resolution":{"observed_at":"2026-08-11T10:34:01.593732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16500","last_updated":"2025-01-03T07:18:30Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T12:34:40.128340Z","submitted_at":"2024-12-21T06:16:04Z","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2412.16500."}