{"as_of":"2026-08-09T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd5d71832c87b99da146e3d224a7772a18651b5cf805f7c1b21926ebf253a209","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:53:26.333669Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:53:23.449877Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:53:27.421561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"cited_work":{"arxiv_id":"2509.04473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04473","snapshot_observed_at":"2026-08-05T13:53:27.421561Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","venue":"cs.CL","work_id":"d149855c-f133-4079-9b8f-8986e1830da6","year":2025},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.449877Z"},"links":{"cited_paper":"/paper/2509.04473","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:9ea55870700004c4c68d1bda0127db86ab4d35fa3535c1f0772447b83d2c515b","observation_id":"4410ef93-6f9e-4d03-9ab9-5cba25ec4f97","resolution":{"observed_at":"2026-08-05T13:53:27.462666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04473/citation-record","integrity":"/paper/2509.04473/integrity","json":"/paper/2509.04473/citation-record.json","paper":"/paper/2509.04473"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"cited_work":{"arxiv_id":"2509.04473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04473","snapshot_observed_at":"2026-08-05T13:53:27.421561Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","venue":"cs.CL","work_id":"d149855c-f133-4079-9b8f-8986e1830da6","year":2025},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.449877Z"},"links":{"cited_paper":"/paper/2509.04473","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:9ea55870700004c4c68d1bda0127db86ab4d35fa3535c1f0772447b83d2c515b","observation_id":"4410ef93-6f9e-4d03-9ab9-5cba25ec4f97","resolution":{"observed_at":"2026-08-05T13:53:27.462666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:30.565903Z","title":null,"venue":null,"work_id":"cb267c17-5658-4d42-8063-4a20e594e121","year":2048},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.496997Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:94bf349f1139ed4c4d1ef33f52ac0de0554ed511c97263b8b08153786dddbdca","observation_id":"a3952895-eef2-48ee-b920-228e158814c9","resolution":{"observed_at":"2026-08-05T13:53:30.674755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:30.341079Z","title":"The ASR baseline benchmarks on the Librispeech dataset are derived from the study in [5], which is similar to ours but focuses solely on ASR","venue":null,"work_id":"3d4c0179-3c4d-430c-b88f-1128d9462d7e","year":2000},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.556198Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:05c2b5ce32ef7da7552decd64560f38f087d6f3da48e8dd3bb8fe1bcf9511208","observation_id":"885256b4-b595-4d76-b1f4-82e21a0f4955","resolution":{"observed_at":"2026-08-05T13:53:30.449286Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:30.056328Z","title":"We conduct the SA training for 50 epochs with a learning rate 5 ∗ 10−4, batch size 6, and a linear decay scheduler with 3000 warm-up steps","venue":null,"work_id":"b68bce47-a823-4739-889d-39653d07fdc1","year":null},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.611938Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:d586b2ca036619e98f2af3eabe0610a712a3a6083a8eafec2e11ede488feb5d8","observation_id":"732f7e07-3f18-4a56-993b-d8257f0d5638","resolution":{"observed_at":"2026-08-05T13:53:30.190439Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:29.837778Z","title":"The proposed model exhibits the capability to capture semantic meanings by effectively mapping speech features to text tokens that are interpretable by LLMs","venue":null,"work_id":"04618ad8-8275-454a-a318-cf04452ffa29","year":null},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.666334Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:d4e25bae764ccfdeddcc0a9d9ea50d1f331167041c69782b91bb293cf1c4b4f7","observation_id":"8e497bb1-3157-479a-ae62-01fb49703981","resolution":{"observed_at":"2026-08-05T13:53:29.960854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T13:53:23.718934Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.718934Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:cd7e45a9f7f2de9c16f02e3e441bcae968d7352b77122d804e6414cc9a66e751","observation_id":"72776b61-651b-458d-8e17-569f95cb25ea","resolution":{"observed_at":"2026-08-05T13:53:23.718934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:23.783968Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.783968Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:ed8bc2fd40f2d7d72f18c5035702363b8bdcdf81e752fd6cca0b8ab78531db06","observation_id":"4d98b71f-fc12-4dc9-84ee-1643e5b8089a","resolution":{"observed_at":"2026-08-05T13:53:23.783968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:23.847695Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.847695Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:29d7ecfda4d7f0ad20ee9dd58d26ace408e55a8d911818e30139484435930cee","observation_id":"781a65e3-df2f-4100-925e-febc9653236d","resolution":{"observed_at":"2026-08-05T13:53:23.847695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-05T13:53:23.880279Z","title":"Tinyllama: An open- source small language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.880279Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:2289c370f5a91231352975340312f99abb604206306a156300c439944ee19a91","observation_id":"a61053b5-c086-41dd-ac0d-63fe788e99da","resolution":{"observed_at":"2026-08-05T13:53:23.880279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-05T13:53:23.962333Z","title":"An embarrassingly simple approach for llm with strong asr capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:23.962333Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:3ef2b58bd5828ad3524fea3be66468846a0a8c8fd1d73f7f78fcaefc881dc8ae","observation_id":"0a2508d2-110c-4be6-afcc-a424821966ce","resolution":{"observed_at":"2026-08-05T13:53:23.962333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T13:53:24.021157Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.021157Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:9ffddd753c5fb024b80861eb307f40d627c3959a4e4c09b7b881b4fd3edc1f7d","observation_id":"23427e32-03aa-4a5c-8c6e-7bfae1829283","resolution":{"observed_at":"2026-08-05T13:53:24.021157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T13:53:24.084203Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.084203Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:9e0f2e9697d26d41f2a589083dbaa874da6964553d7282e35785b7d9da692fa2","observation_id":"c422d072-d248-469c-8148-e8c47a873d02","resolution":{"observed_at":"2026-08-05T13:53:24.084203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T13:53:24.131210Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.131210Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:21bfdbb9a888b5f8cea1d5df5fcf86a7e109558a5a03e23a658e7d95181e533c","observation_id":"5bdd7516-15ca-4c7b-b5c4-84026c4896c1","resolution":{"observed_at":"2026-08-05T13:53:24.131210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-05T13:53:24.189799Z","title":"Anygpt: Unified multi- modal llm with discrete sequence modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.189799Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:8f390df001c53bb4463c3fb87792e7d5f15e389f4a5f11a1a9957be380b96235","observation_id":"e8c6534f-ef50-4d68-aef2-43dc18d60de8","resolution":{"observed_at":"2026-08-05T13:53:24.189799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:29.537299Z","title":"” i’ve heard of you!","venue":null,"work_id":"aa4c5e3d-51d5-4f73-8c24-8fce5176198a","year":2025},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.253256Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:4fa638d7a38496eaf6f55bbb71552d703d1556412583603f3ae106fc9749fe27","observation_id":"de92ddd5-55ca-4b6b-a812-dc0c72dacf23","resolution":{"observed_at":"2026-08-05T13:53:29.676823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:29.323133Z","title":"Whisper-slu: Ex- tending a pretrained speech-to-text transformer for low resource spoken language understanding,","venue":null,"work_id":"5ad3bc8b-9289-4855-82c7-206de1a500d7","year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.315150Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:530be46b0c0b35644cedd27f4bfc242c25c54d355e731d98133c382af419a0da","observation_id":"428a4dd6-40a7-4586-b460-2cf0ad19c3fb","resolution":{"observed_at":"2026-08-05T13:53:29.415213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10083","last_updated":"2024-06-14T14:37:52Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:37:52Z","title":"On the Evaluation of Speech Foundation Models for Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10083","snapshot_observed_at":"2026-08-05T13:53:24.385057Z","title":"On the eval- uation of speech foundation models for spoken language under- standing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.385057Z"},"links":{"cited_paper":"/paper/2406.10083","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:a270bdbdb0d626b5dab931fb00f14de54fae062a724fa95e7e1a7b7a30650f13","observation_id":"50b75b74-679c-4de3-8a9b-7c016f811fb1","resolution":{"observed_at":"2026-08-05T13:53:24.385057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:29.006346Z","title":"Universlu: Uni- versal spoken language understanding for diverse tasks with nat- ural language instructions,","venue":null,"work_id":"b8816c49-6bc4-45e2-ae89-df501c319234","year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.404892Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:691c840189585e05f562a95e8c0eec79204684355c2774190b38326ca8488f0a","observation_id":"7807b942-288e-4d33-8945-a4187e73c536","resolution":{"observed_at":"2026-08-05T13:53:29.176460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15209","last_updated":"2024-06-21T14:51:32Z","snapshot_observed_at":"2026-08-06T01:59:38.923657Z","submitted_at":"2024-06-21T14:51:32Z","title":"Prompting Whisper for QA-driven Zero-shot End-to-end Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":"2406.15209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15209","snapshot_observed_at":"2026-08-05T13:53:27.013823Z","title":"Prompting Whisper for QA-driven Zero-shot End-to-end Spoken Language Understanding","venue":"eess.AS","work_id":"1b86888a-52a9-410a-8c36-5864ee3d9ea0","year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.428503Z"},"links":{"cited_paper":"/paper/2406.15209","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:0896fdb80783828a3d39a382137f17a1290e2a00025fa101d61fc2c2d6d4b99a","observation_id":"cc3f337a-3a2d-429c-af5c-37935193ffbc","resolution":{"observed_at":"2026-08-05T13:53:27.083579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:28.662705Z","title":"Salm: Speech- augmented language model with in-context learning for speech recognition and translation,","venue":null,"work_id":"3433ca0d-4a65-4aa3-a271-171e1134081c","year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.464158Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:7f07d2763410db9bb323fd2ba8dec67841f7bca0ad7c58b072957ba7aade9325","observation_id":"9dbc050f-12ae-42f1-a78a-099bbe3d5e2b","resolution":{"observed_at":"2026-08-05T13:53:28.826670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08107","last_updated":"2025-08-07T10:51:59Z","snapshot_observed_at":"2026-08-09T15:23:47.389071Z","submitted_at":"2024-09-12T15:00:56Z","title":"WhisperNER: Unified Open Named Entity and Speech Recognition","version":2},"cited_work":{"arxiv_id":"2409.08107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08107","snapshot_observed_at":"2026-08-05T13:53:26.861708Z","title":"WhisperNER: Unified Open Named Entity and Speech Recognition","venue":"cs.CL","work_id":"32a76f5b-cf14-4134-9364-3123dcda088d","year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.497567Z"},"links":{"cited_paper":"/paper/2409.08107","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:c7f4d78dbbd9510de13866e1bef7988f98164bda8a34de8192a809f798a18208","observation_id":"9533b423-310a-49f5-a200-f934b58dbf2c","resolution":{"observed_at":"2026-08-05T13:53:26.920380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:28.402482Z","title":"Chinese asr and ner improvement based on whisper fine-tuning,","venue":null,"work_id":"d9f34bf4-15b1-4407-988e-4dcefc08319b","year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.554685Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:a912b3cdeb633c82a00104cdff4ca3b61a70714bbbbd5c211d7b6094898c2b82","observation_id":"3808f0ce-1201-4d6c-8054-6db1f7971421","resolution":{"observed_at":"2026-08-05T13:53:28.546140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15343","last_updated":"2024-02-23T14:23:51Z","snapshot_observed_at":"2026-08-07T20:52:44.678753Z","submitted_at":"2024-02-23T14:23:51Z","title":"NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15343","snapshot_observed_at":"2026-08-05T13:53:24.614481Z","title":"Nuner: Entity recognition encoder pre-training via llm-annotated data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.614481Z"},"links":{"cited_paper":"/paper/2402.15343","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:df5c954b4691637847e2348744cca514cc15e953d3565d9c2d77b8192fa60e49","observation_id":"388e7e80-4436-4167-a6df-e22a9740a22f","resolution":{"observed_at":"2026-08-05T13:53:24.614481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11382","last_updated":"2024-06-06T05:39:50Z","snapshot_observed_at":"2026-08-09T16:17:14.244432Z","submitted_at":"2024-01-21T03:15:05Z","title":"Using Large Language Model for End-to-End Chinese ASR and NER","version":2},"cited_work":{"arxiv_id":"2401.11382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11382","snapshot_observed_at":"2026-08-05T13:53:26.609337Z","title":"Using Large Language Model for End-to-End Chinese ASR and NER","venue":"cs.CL","work_id":"d8191eb3-3d65-4027-a820-57b4bc887bf4","year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.724041Z"},"links":{"cited_paper":"/paper/2401.11382","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:28779d26690c4920a7c18e87de2175e402fd3321302af4b8ffecb4a4041648cd","observation_id":"e9ac977e-bbb2-4630-b908-0fa832ec4f78","resolution":{"observed_at":"2026-08-05T13:53:26.745129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-05T13:53:24.835833Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.835833Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:feca6da59e053c16efe9f1af1501656c0d3367789a3bdbd18dea96eaf3538fd8","observation_id":"9bf4cc41-8be5-499a-ab66-a0aa23b369a8","resolution":{"observed_at":"2026-08-05T13:53:24.835833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11184","last_updated":"2020-05-22T13:39:14Z","snapshot_observed_at":"2026-08-06T08:50:55.637766Z","submitted_at":"2020-05-22T13:39:14Z","title":"End-to-end Named Entity Recognition from English Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11184","snapshot_observed_at":"2026-08-05T13:53:24.953794Z","title":"End-to-end named entity recognition from english speech,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.953794Z"},"links":{"cited_paper":"/paper/2005.11184","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:595b5dda129bedbc8a9cb8549b85b63e810ebb5c64a929a554de00fb85adfbfc","observation_id":"6aad7e48-dc54-4584-ae1d-e9607bda13ee","resolution":{"observed_at":"2026-08-05T13:53:24.953794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:28.099364Z","title":"End-to-end named entity and semantic concept extraction from speech,","venue":null,"work_id":"95a6e519-ffba-477c-ada3-d709b5dad320","year":2018},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.081211Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:ffe849a7247a9fa070d68d0ffe9f1e1de481f0b7469db79542f2d9b7e9b290a9","observation_id":"8f73a246-f793-410c-b515-54f69c5432dd","resolution":{"observed_at":"2026-08-05T13:53:28.260325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:27.850713Z","title":"Slue: New benchmark tasks for spoken language un- derstanding evaluation on natural speech,","venue":null,"work_id":"9ce42414-1d28-469a-b09a-4dee2adf23ee","year":2022},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.186661Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:4f2edb1a33e60b60a87d7dc600c8daecf89a980de446c16fbb0646dbbc666056","observation_id":"ab6ef9c1-2eb4-42b7-a572-417e22a4c48c","resolution":{"observed_at":"2026-08-05T13:53:27.940309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:27.695931Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"567d2065-e2f3-434f-b85b-6427934afde6","year":2015},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.322583Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:9666b821c23db9a515a22198cc14086f908391a999f8bc7d8e2d8fe4f12d29bf","observation_id":"0c5dcb25-d6a4-4dd0-a158-e93b099c9ebe","resolution":{"observed_at":"2026-08-05T13:53:27.780738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-05T13:53:25.480535Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.480535Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:0007f1050984303d6eb669ddb5be394c7ef3a4da6de385a836a46db7b3ee787c","observation_id":"1d292078-0891-4d23-92c2-4d347df25a3b","resolution":{"observed_at":"2026-08-05T13:53:25.480535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-05T13:53:25.645970Z","title":"V oxceleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.645970Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:ebe31f2ea59995422235096796dc837d6ce6aa084aa7f661345b8794267d71eb","observation_id":"85ece306-a343-488d-9b0b-d834a17db7bc","resolution":{"observed_at":"2026-08-05T13:53:25.645970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:27.567472Z","title":"Ontonotes: the 90% solution,","venue":null,"work_id":"65e27c94-7be4-484a-b829-3c48d0b691ac","year":2006},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.785734Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:67be7d839b1a13fe7cda5ba0bd0d0f7a67278f2caea421241d34e44cfd0db40d","observation_id":"b3972282-9234-49b3-8c18-48c3e205d0be","resolution":{"observed_at":"2026-08-05T13:53:27.633245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15444","last_updated":"2023-06-20T14:41:38Z","snapshot_observed_at":"2026-08-09T17:12:22.297438Z","submitted_at":"2023-05-24T07:38:24Z","title":"PromptNER: Prompting For Named Entity Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15444","snapshot_observed_at":"2026-08-05T13:53:25.913786Z","title":"Promptner: Prompting for named entity recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.913786Z"},"links":{"cited_paper":"/paper/2305.15444","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:5512c2b513a673aefd7cd41e8e8bbb159dd4f750ebee87332d91c4f842277daa","observation_id":"d8ada98e-7101-41aa-bc65-6b30936d052a","resolution":{"observed_at":"2026-08-05T13:53:25.913786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:26.053496Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:26.053496Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:2e6f371304d23513a64122cda483bfbab911c9130e180d98f41e3bfd581126f0","observation_id":"b98be2c8-d21e-49a4-9458-0ff433743321","resolution":{"observed_at":"2026-08-05T13:53:26.053496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:26.205888Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:26.205888Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:b207366cbc3ba47d864c64ffb42ec4bd89274f2624b13293c171d1b3d395fd3c","observation_id":"69c6d5fb-6e01-442b-b1ff-ec02188ae659","resolution":{"observed_at":"2026-08-05T13:53:26.205888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:53:26.333669Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:26.333669Z"},"links":{"citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:04c39e5c044983ba0098ac987c7308f71b057690a7d02d0a3c71ce871c2a7d67","observation_id":"a0a3bb6a-f4c9-4e8b-8947-8f08906babb4","resolution":{"observed_at":"2026-08-05T13:53:26.333669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":4,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2509.04473."}