{"as_of":"2026-08-23T18:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae6c8e24b2aa69257c0d92ed60837280e4e76bce5c9c57ecf54b9543bf3acdd2","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:27:27.353817Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:35:02.484377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T14:44:45.645532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"cited_work":{"arxiv_id":"2412.12009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12009","snapshot_observed_at":"2026-06-30T14:44:45.645532Z","title":"Speechprune: Context-aware token pruning for speech information retrieval,","venue":null,"work_id":"18c785ff-312a-4372-b0c1-57ceabaab162","year":2024},"citing_paper":{"arxiv_id":"2605.24144","last_updated":"2026-05-22T19:06:22Z","snapshot_observed_at":"2026-08-18T23:05:06.423504Z","submitted_at":"2026-05-22T19:06:22Z","title":"EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T14:35:02.484377Z"},"links":{"cited_paper":"/paper/2412.12009","citing_paper":"/paper/2605.24144"},"observation_digest":"sha256:f262b09b86bee98d8d4f36631f4bcbcf7cbcf7c48b49588ab020293e5ff581b9","observation_id":"27cbed04-321f-4d1b-b206-b87602c53b06","resolution":{"observed_at":"2026-06-30T14:44:45.647323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12009/citation-record","integrity":"/paper/2412.12009/integrity","json":"/paper/2412.12009/citation-record.json","paper":"/paper/2412.12009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.207916Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.207916Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:3b4f71cec0b3da4ced390407e0de9e336e15edfe43eb9c3352b2058e552a8c49","observation_id":"6cfb7fff-0c53-459d-ad20-d62b262953a2","resolution":{"observed_at":"2026-08-11T14:27:27.207916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-11T14:27:27.214993Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.214993Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:5dbab785981f3da2282bbed7b3551c1684d24305619a436e00400a6ea1e6be76","observation_id":"615b9647-943e-49d8-96ce-4193edc48367","resolution":{"observed_at":"2026-08-11T14:27:27.214993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-21T16:42:22.094560Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-11T14:27:27.223349Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.223349Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:823c794b4891766db9c1b8267bdd114bb8927103ac048f46616a9e0c037335b0","observation_id":"91cc5029-1500-4b98-b8c1-4dd268680a26","resolution":{"observed_at":"2026-08-11T14:27:27.223349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.943936Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"8b7c6734-466a-4c8a-b4b9-6acf2eaea907","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.229904Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:890b8fc6d8793e66d77d6eafe45e0fb0356bb730ac0a121bb4eae398dc260e6f","observation_id":"d991f7e9-421f-42e6-b482-c0a6254c6d7d","resolution":{"observed_at":"2026-08-11T14:27:27.949943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.927131Z","title":"AnyGPT: Unified multimodal LLM with discrete sequence modeling,","venue":null,"work_id":"1cf91170-e948-403b-8b54-45132cd8e947","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.237231Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:270038d3743918104527d7513962ea09514ce65bd3d82a427994b1c28b725e1e","observation_id":"8682b50a-fe3b-4c59-b3e9-6671b498d8e7","resolution":{"observed_at":"2026-08-11T14:27:27.932649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.909490Z","title":"Dynamic-SUPERB phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"7de311ba-d4f7-4716-8078-6b7b35aed93a","year":2025},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.242211Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:15b34385f77a4e4d638c5721eb6613bed887e201a1d18b38fa2dec66109c4aa1","observation_id":"37b91436-91f8-4d47-b7f1-c354d36ba71e","resolution":{"observed_at":"2026-08-11T14:27:27.914804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.892977Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"0910c9d6-4e56-43a8-a927-5645b2e194f4","year":2025},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.248819Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:ffb5ca84298f638fd2068837be71a19c19fe99d8bbc7934440248809d73237bd","observation_id":"6334cba9-d4d5-421f-ba93-fbbb90c882ac","resolution":{"observed_at":"2026-08-11T14:27:27.898104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-11T14:27:27.254326Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.254326Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:226fc9bbd3d9401554ec5dd2bd848026f8c7af4aa6dbdb1e83f0353287746850","observation_id":"6b5f935f-5e54-4c99-b575-ea8ef3f15a60","resolution":{"observed_at":"2026-08-11T14:27:27.254326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.874093Z","title":"On the com- putational complexity of self-attention,","venue":null,"work_id":"23bf58df-f1a1-4ad9-bc77-ef1b313e0a1f","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.259908Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:11e07afb0eb69d3069e1aeae4f14d9feb520c4b4e8ececba094127ab1cc25c37","observation_id":"16451f2e-2264-436d-ac06-90a331ddb238","resolution":{"observed_at":"2026-08-11T14:27:27.880027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.265395Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.265395Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:bc36ff48b433243e2bd24351a45f9f7a5aeb5c6effd9e9cfb4c495a09e38a70e","observation_id":"2c3b74b5-599f-4d8e-9ca8-18781f522004","resolution":{"observed_at":"2026-08-11T14:27:27.265395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.271000Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.271000Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:c64726e19b0dde6802be41e48fdf14c96939554912ea8c420647be691cf3c4dd","observation_id":"5c4387b6-9496-468d-a057-55d8aa83cdfa","resolution":{"observed_at":"2026-08-11T14:27:27.271000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.847365Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":"7304c6f1-a214-472d-803b-fbd8dc938d43","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.278405Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:9d2f57eeecfe35b4cb85e0cdb33b616299c9a6a9f578f483efb9d05a877459fa","observation_id":"6eaf1794-7992-4709-9582-56a9c0f65cae","resolution":{"observed_at":"2026-08-11T14:27:27.852739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.830247Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"45344a5c-fc57-4e84-9a84-0fa5952db3e4","year":2019},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.284337Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:f689850b085447eb9c1832bfd17bd16ae96e3676393a0f6fe07a260b1d3db591","observation_id":"eb8cfd2f-580e-4966-b0fb-99ea0702f51a","resolution":{"observed_at":"2026-08-11T14:27:27.835898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.813635Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"1c86f2f2-3bcc-48df-81f9-4bfacaaa0814","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.289656Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:1f41d9d63c5e0f0c991474781b4053628f43da76e0d5e71a93c9294d122a6dbc","observation_id":"88fff4b9-643f-40ef-a897-f37563c920ba","resolution":{"observed_at":"2026-08-11T14:27:27.819049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.797943Z","title":"Listen, think, and understand,","venue":null,"work_id":"07b16cf0-21b3-4a5a-95b4-9561d79ed7e7","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.295112Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:3c6209b3a29a18e86830960878526c89d305b24569d87feb3093232eb67b1aec","observation_id":"fec33ec5-9763-4267-9c15-a26c18fe8eab","resolution":{"observed_at":"2026-08-11T14:27:27.802854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.780592Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"6634acab-1657-49f5-bb0b-e9a007e5e2b3","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.301158Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:5af2416bbed025f9818dbc26c61a24b0c4d135869048eccb879eeb109257743a","observation_id":"b96a12fb-37fc-4f2e-b0ec-67f5581f292c","resolution":{"observed_at":"2026-08-11T14:27:27.786330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T14:27:27.306355Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.306355Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:78df83f3f0bdc1d62de7bb0b343b6944ef8f1a9edfe776ec153b4d3c654714b7","observation_id":"07045fb6-57ee-4793-9e2e-aee6c25e3365","resolution":{"observed_at":"2026-08-11T14:27:27.306355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.763450Z","title":"Attention is all you need,","venue":null,"work_id":"8bb84ae4-ab86-4774-90f4-15268678f21a","year":2017},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.317192Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:af9acced8facdc9f5e079d9b31eedaf19c098434a1aae99e5d5bb103a6489f16","observation_id":"29a50415-014b-4365-94d0-4dc07d53b2a1","resolution":{"observed_at":"2026-08-11T14:27:27.768934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.745144Z","title":"Transformer quality in linear time,","venue":null,"work_id":"101961fc-3f9e-4716-a6cf-7675e0aaf027","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.322853Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:e1d5a04344f40c1384a3af3ca99770a1fe214437fbec88f1ae52fdcf97c7b97d","observation_id":"cf0e7d12-b0ff-49eb-80a7-bc588827afe6","resolution":{"observed_at":"2026-08-11T14:27:27.750112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.727885Z","title":"Learned token pruning for transformers,","venue":null,"work_id":"8bed48b8-07f6-421f-aeaa-be686fcfe9db","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.327836Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:2b4249ee27a5bae6e4cf49154fd9bdaf3e62f60ea13be8b45018e33e12dfc007","observation_id":"0bdeeabc-0705-4dda-a662-d1d1e81ff128","resolution":{"observed_at":"2026-08-11T14:27:27.734347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.709468Z","title":"Cortical oscillations and speech processing: Emerging computational principles and operations,","venue":null,"work_id":"5741d0f2-0ec7-4b62-a2f8-564022df3cd6","year":2012},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.334489Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:c444c7475b4f0a0a9fe2d03b70bb25355eb26d0364d57ca7a933b51c62783e86","observation_id":"b1377ffc-43f5-44e1-8593-d1475917ee1c","resolution":{"observed_at":"2026-08-11T14:27:27.715513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-19T23:21:25.570254Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-11T14:27:27.340179Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.340179Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:17d39aec0c866b2ac85c2124d9117120ba1db985ce899888e455c78699a9498b","observation_id":"3eddaf34-10e1-4853-bcea-ca125b391400","resolution":{"observed_at":"2026-08-11T14:27:27.340179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.691056Z","title":"Dream: A challenge data set and models for dialogue- based reading comprehension,","venue":null,"work_id":"aae10925-b7be-4d24-94bf-66624701f960","year":2019},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.348476Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:45f7ef36417ab53eec7a9a3c2975c074c2975199eda581fae867c1cc66a85bd1","observation_id":"3c719319-0ede-44e5-ba2a-bb6eecdc3606","resolution":{"observed_at":"2026-08-11T14:27:27.697902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.669415Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":"2d3cfc36-8749-4dbf-9821-2326a84d1c35","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.353817Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:2373da78f2d9dedc62733feaeb5f6f940f580ac68dd55884d5de86b5bdb4d71f","observation_id":"c834cfa0-87fe-4051-add2-51de44ff5887","resolution":{"observed_at":"2026-08-11T14:27:27.677871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2412.12009."}