{"as_of":"2026-08-13T01:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5459586ad4ef0a7ca05ad5ecf89607498383ba9138bb87aed53d145c12bcd40","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:49:32.643541Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:49:27.503557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T00:14:04.018407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-08-07T14:49:27.503557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.503557Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:315c1a3565ac8894431c79fccb8c6f816bd979c94c63061e0827f4c215a8394d","observation_id":"118b8495-b3c1-4f18-bd1f-c222269dc67c","resolution":{"observed_at":"2026-08-07T14:49:27.503557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-08-11T08:01:37.262348Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T09:26:00.413651Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2604.27393"},"observation_digest":"sha256:15329decd275397ddb2d075ce35cbdf9a2749892686f3cd7e104bbdc3e262844","observation_id":"d6210e1b-6a83-4c2d-9e58-ada4cd421369","resolution":{"observed_at":"2026-05-12T09:46:26.402755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:1da1781b85b59f1956d2d5758cecb2997a7fa9e707f23d78469728a5548290ef","observation_id":"aeef7706-ab4b-484f-9876-d8ad5fd3fa6f","resolution":{"observed_at":"2026-05-11T19:46:15.312622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:2371a9bde14bc2a0bb4c22874b64fe4d94541f9102bd14225e499dcf4f1b2f2e","observation_id":"7290fc7b-e18b-48a8-bfde-b4bc33641c02","resolution":{"observed_at":"2026-05-11T00:50:49.572777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.24863","last_updated":"2026-05-29T01:13:17Z","snapshot_observed_at":"2026-08-07T19:58:36.942630Z","submitted_at":"2026-05-24T04:46:30Z","title":"Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T00:13:50.278588Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.24863"},"observation_digest":"sha256:47930d2e6baa9a8ab67157f22bcda6d7fbb96cec0154b9600654ac7312762c8d","observation_id":"22bf6741-a9d7-4308-909d-fd4c133a05d0","resolution":{"observed_at":"2026-06-30T00:14:04.020962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17496/citation-record","integrity":"/paper/2505.17496/integrity","json":"/paper/2505.17496/citation-record.json","paper":"/paper/2505.17496"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-08-07T14:49:27.503557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.503557Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:315c1a3565ac8894431c79fccb8c6f816bd979c94c63061e0827f4c215a8394d","observation_id":"118b8495-b3c1-4f18-bd1f-c222269dc67c","resolution":{"observed_at":"2026-08-07T14:49:27.503557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.697475Z","title":null,"venue":null,"work_id":"aa7ee43d-7f0e-4c03-afa8-d18269f1242b","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.620949Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:4aa0b3228a080519d24218c14abced0a36d69027243512931e7e84fb6b14d53d","observation_id":"ae861de5-1056-44e4-b436-7cd7074e9a60","resolution":{"observed_at":"2026-08-07T14:49:37.739818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.539896Z","title":"model merging after experience replay","venue":null,"work_id":"9b154ecd-f387-4581-a1e3-e22b940f1428","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.701968Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:23bec7f830a0288947226362aea95401523c666a0ea2302de561aa18688073b3","observation_id":"3a4a6fe1-047a-490c-9b91-f6b26c8daab2","resolution":{"observed_at":"2026-08-07T14:49:37.616001Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.344743Z","title":"Catastrophic forgetting Fig.3 shows the evaluation results on instruction-following and question answering in each training stage on T2T setting","venue":null,"work_id":"5971db4d-49c3-4605-bba1-728849493dbd","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.785987Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:c45704e1581903b7e30c7cfb3a896fd2042808a221e3a0fb417fe85f0635695a","observation_id":"3dfc9cbe-9d1e-4b87-a101-f2505f0c55f7","resolution":{"observed_at":"2026-08-07T14:49:37.430359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.216453Z","title":"The results demonstrate that expe- rience replay is the most effective method, with further perfor- mance gains achievable by combining it with other techniques","venue":null,"work_id":"f2833ce9-3d39-48bf-9a01-bbfa371df610","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.891143Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:c83f2479c1f13db83540779aa0c5d05b1de419577012d9f99bdafb500e6c8d43","observation_id":"06ceb650-210d-490b-8cc9-dec78f6770b1","resolution":{"observed_at":"2026-08-07T14:49:37.269287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:49:27.974838Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.974838Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:fef427ed8f0b72ee9d544a364ec72fbbcc95f1dd5e99ec41d471013f9a40839a","observation_id":"3797e6e1-9d33-4a8e-9552-408c0b578a29","resolution":{"observed_at":"2026-08-07T14:49:27.974838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:49:28.073588Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.073588Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:902d09ba5a3e2b91dc7349c9916c022ac19621628c0a2c8ed1f5079176d593d3","observation_id":"0baea6ba-f3f0-4bd4-be3e-eae0565a93b6","resolution":{"observed_at":"2026-08-07T14:49:28.073588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:49:28.203129Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.203129Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:24e5d13cd410b3e89397100d9fd55dc814bab791b2a4aa20c37b145306226517","observation_id":"bc749462-ff52-481e-a87a-7a3623d4b8bb","resolution":{"observed_at":"2026-08-07T14:49:28.203129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:49:28.267095Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.267095Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:4b9d9c49028af652be04533fa5cc840ebdc3aa24ba9eebbb443f743f3492a878","observation_id":"a31ed582-f950-460f-9364-343267f7fd3c","resolution":{"observed_at":"2026-08-07T14:49:28.267095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.082995Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"18590f5f-d672-4f9d-a0ac-e1334ac27d97","year":2021},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.357983Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:8360b814f4c637db4f43c8e529a4b00974062811b3e5e0651983908f3e7f5fb3","observation_id":"419642c6-4c42-42d6-89a6-d65afa5ac256","resolution":{"observed_at":"2026-08-07T14:49:37.124544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.921707Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"e383ad22-d150-4628-b8b9-9279237ea019","year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.439186Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:441f22bcff1942f6b5e18e965698f5b4ee84fbc1447fe51024c6120d72e07247","observation_id":"0c42895f-bbe2-4f2f-b426-65a259956dfc","resolution":{"observed_at":"2026-08-07T14:49:36.990638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:49:28.537697Z","title":"Seamless: Multilingual expressive and stream- ing speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.537697Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:b4c10dcf57460e1b764f33689ea8e5d6f47b790fdd7efc768322bfc99819d255","observation_id":"f9c63014-3cb0-48d8-8af5-6f85d8fdbb59","resolution":{"observed_at":"2026-08-07T14:49:28.537697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05361","last_updated":"2025-06-09T16:36:12Z","snapshot_observed_at":"2026-08-12T22:05:02.808782Z","submitted_at":"2024-11-08T06:33:22Z","title":"Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05361","snapshot_observed_at":"2026-08-07T14:49:28.620577Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.620577Z"},"links":{"cited_paper":"/paper/2411.05361","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:0c5a2aa0046d3d8983fd11fd3a16bfd2579102012965b2192e60f107ef1cb526","observation_id":"6e3323cd-c372-4bd9-8862-80d0d81e1159","resolution":{"observed_at":"2026-08-07T14:49:28.620577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.723505Z","title":"Dynamic-superb: Towards a dynamic, col- laborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"232a36d7-2d34-4b66-96a8-6e9d470d8d3d","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.704201Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:13e15a3ff5033544e43d28c5ede8294dff5e93519554e02467ce8dc5d3718404","observation_id":"a0569789-654b-4876-974a-748e520e66aa","resolution":{"observed_at":"2026-08-07T14:49:36.817565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-07T14:49:28.778868Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.778868Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:cb1d5091adc19f9175abd35fc0ea5a38a575ec53040a702c0b46b33ea3e730c4","observation_id":"f138d9a8-3898-4499-998b-906c899ce561","resolution":{"observed_at":"2026-08-07T14:49:28.778868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.506762Z","title":"UniverSLU: Universal spoken language under- standing for diverse tasks with natural language instructions,","venue":null,"work_id":"e38af2bf-e08c-40d0-8e7e-8ad4eea7afb5","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.883748Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:fcb13e7d1cf7a678beb43a796fbc730cf31d58303f0e578da3a4ac62b1bb4a3b","observation_id":"7f4e7bcb-fd9c-4989-96f3-539928d79ccd","resolution":{"observed_at":"2026-08-07T14:49:36.618209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.340680Z","title":"ESPnet-SpeechLM: An open speech language model toolkit,","venue":null,"work_id":"07cefb6d-8745-4168-95cf-eae888a98043","year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.988718Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:215a82ce1fe11d183f56a2c423353b990dcd3464d66a5c12e0666680c1cee385","observation_id":"30d8664d-fa11-4dfb-9095-ce0d551ce349","resolution":{"observed_at":"2026-08-07T14:49:36.428957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.089223Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"fd98fcb1-df8c-45c1-915f-bb06bc7524fc","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.090373Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:f90950899083a8d3a7c3280e0d5036b6da9827ed31e96344e2f21f98f755d2eb","observation_id":"9848b011-631c-4159-a246-b1354fd81a78","resolution":{"observed_at":"2026-08-07T14:49:36.222228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.879156Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"7a79f123-249c-41a8-b12a-fcbe49a6ecf3","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.173184Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:dd29592fbfb93b86a6b15f99d85cc3c511016ef1cb4e5148bd3ecea8fa6d8b5e","observation_id":"620f5420-a1b9-4267-99c9-541345a9fe36","resolution":{"observed_at":"2026-08-07T14:49:36.005034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.765377Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"f34a87af-a7c1-4d82-8278-b8fe4a105ba7","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.257897Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:74bb51415990a43445275355fdd3c3bad53c08731689a34c09ebb3745ae097d2","observation_id":"dbbceda6-52d2-4195-9d57-3d7cc9659bc2","resolution":{"observed_at":"2026-08-07T14:49:35.806551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20007","last_updated":"2025-01-27T08:46:09Z","snapshot_observed_at":"2026-08-12T22:34:48.389909Z","submitted_at":"2024-09-30T07:01:21Z","title":"DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20007","snapshot_observed_at":"2026-08-07T14:49:29.352657Z","title":"Developing instruction- following speech language model without speech instruction- tuning data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.352657Z"},"links":{"cited_paper":"/paper/2409.20007","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:854106bd3ee16de29ca75fbafdc918c6c974dcb6ce5f9d2d748e6f1f042e1485","observation_id":"0279a263-cbd1-4f53-baf0-7984b7ea1c83","resolution":{"observed_at":"2026-08-07T14:49:29.352657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:49:29.431423Z","title":"Qwen-audio: Advancing universal audio under- standing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.431423Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:d5600a71cc52de0068d71c470b1e825a808095e98a56110238590ae594a27c55","observation_id":"c2f4d02f-e771-47cd-b34c-1624906e9d27","resolution":{"observed_at":"2026-08-07T14:49:29.431423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T14:49:29.530299Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.530299Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:4cab08d57937134cc0245fe84a84dd477de69626070a2435e3213574c4edc448","observation_id":"64118d62-9c24-4235-9d94-d07d1e2d7cf8","resolution":{"observed_at":"2026-08-07T14:49:29.530299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.653698Z","title":"SpeechGPT: Empowering large language mod- els with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"bce1696e-03ba-430c-98e3-c5730795e537","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.616584Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:c1fc9666a9b1917185f43f0f34bc96a6a52d94942a1e9bb4bb6499490b5f11cc","observation_id":"fb46d111-c5cb-4e3e-b5f2-c2dcd445e741","resolution":{"observed_at":"2026-08-07T14:49:35.693307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.547968Z","title":"Audiolm: A language modeling approach to au- dio generation,","venue":null,"work_id":"ab3ab371-2a4c-4df8-9348-731c76fd2a98","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.669080Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:0e7673ca3f661ed16dea0e289b69eb4b00163ad4efcdd8cc64528dcb92f0bc2c","observation_id":"57cc660e-5096-4383-a1bb-daec940cb195","resolution":{"observed_at":"2026-08-07T14:49:35.583710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:49:29.740906Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.740906Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:c61471103a8658d6391596aa2942a2b12ad9b2d2cd9f91144c6dbfcca1cb51fa","observation_id":"2472925a-b332-4cff-a7f4-cec303d410ee","resolution":{"observed_at":"2026-08-07T14:49:29.740906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-12T22:55:00.524050Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:49:29.836731Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.836731Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:5c445c2c33c274ccddd7f4e105738ff6569f22f6aadce054c1b817506db1940a","observation_id":"99f94a9b-b0ba-4851-9d93-67f50709eca7","resolution":{"observed_at":"2026-08-07T14:49:29.836731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T14:49:29.942638Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.942638Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:96a4b6b7d459d8e8f0add21570d0f016be75a4688a7aa781b91b87f4924ff7fe","observation_id":"a92c2aa1-99ea-4f6b-8ef0-909ed81a58a6","resolution":{"observed_at":"2026-08-07T14:49:29.942638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07111","last_updated":"2024-12-27T07:29:19Z","snapshot_observed_at":"2026-08-12T22:03:09.657336Z","submitted_at":"2024-11-11T16:37:40Z","title":"Building a Taiwanese Mandarin Spoken Language Model: A First Attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07111","snapshot_observed_at":"2026-08-07T14:49:30.027800Z","title":"Building a taiwanese mandarin spoken lan- guage model: A first attempt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.027800Z"},"links":{"cited_paper":"/paper/2411.07111","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:2c35f131d8c32c4f5a7c672c73f8dbbdb487c2e2b824054a9a1b138218b58fb7","observation_id":"1767e8f5-1977-445a-90b2-13ef00464690","resolution":{"observed_at":"2026-08-07T14:49:30.027800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6211","last_updated":"2015-03-04T01:43:31Z","snapshot_observed_at":"2026-08-12T14:32:45.094113Z","submitted_at":"2013-12-21T06:31:41Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6211","snapshot_observed_at":"2026-08-07T14:49:30.102903Z","title":"An empirical investigation of catastrophic forgetting in gradient-based neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.102903Z"},"links":{"cited_paper":"/paper/1312.6211","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:d94d72cbce80dcf334d58515bf40f777039a0e5aaf3323f2ecb627b8d99d5cc2","observation_id":"df2d0df4-04e0-46a9-90aa-89df1497546e","resolution":{"observed_at":"2026-08-07T14:49:30.102903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-07T14:49:30.202377Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.202377Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:1cebdaf130b197aa7ecb3b195eccfaa55499436fba07c945e09e7dfcef26e3de","observation_id":"069b8776-e893-4f6b-8e5e-ae8d0aa49acd","resolution":{"observed_at":"2026-08-07T14:49:30.202377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.399661Z","title":"Mitigating the alignment tax of rlhf,","venue":null,"work_id":"ef965461-c570-4b8b-b71f-58e91acd9a5b","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.359211Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:66d21e9bdb3d47e62e479513ae4daf64c8774ef205f6dd538d16f20817fb9486","observation_id":"c53032a3-6cc2-4fa3-99a0-a600906fa832","resolution":{"observed_at":"2026-08-07T14:49:35.464670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.273584Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"0f68ea7e-1520-4782-b266-e7aaac280be8","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.495662Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:d5886891932a1f12d37807b9918d8ee597f3397ca6caca0e8e0127ef6808179f","observation_id":"63455f88-dc64-46b2-ab69-adce8736061a","resolution":{"observed_at":"2026-08-07T14:49:35.332950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.111695Z","title":"Experience replay for continual learning,","venue":null,"work_id":"a1e87f0a-e227-464a-a291-0d9290400bf1","year":2019},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.624338Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:028fd0c9daf7ce19359cb13854b5f283e98a29f2a031b7644df55c520da1c0c7","observation_id":"dc8e5282-bcd7-48ca-a78c-36ad036da432","resolution":{"observed_at":"2026-08-07T14:49:35.198113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:30.738275Z","title":"Lifelong learning of large language model based agents: A roadmap,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.738275Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:b934cf815361f3fa9dde7bf42d274839bd67b5996dbfa19acd9a3ca3972e3969","observation_id":"e906b271-637d-4304-9b4a-dd0ad6989dd3","resolution":{"observed_at":"2026-08-07T14:49:30.738275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.961220Z","title":"Vqacl: A novel visual question answering con- tinual learning setting,","venue":null,"work_id":"b95c6b4b-2ee4-4e0d-92a4-907fe5ba332b","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.870400Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:9089352b04043e7370f641ee59e927b901db41aa475fa62d1ffaf5c5b7a8d73d","observation_id":"b11aedce-d358-4e37-9248-707740270df0","resolution":{"observed_at":"2026-08-07T14:49:35.046797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.776684Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"40f11eaf-4bb5-4732-9b33-4047584f626d","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.042508Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:d233e252f5ddb456042ffd4ccf9cff75337ce79a766456d4a79eed518d310117","observation_id":"35cf9cd9-bf56-4c92-9735-e02834a7f671","resolution":{"observed_at":"2026-08-07T14:49:34.854269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.627310Z","title":"Ties-merging: Resolving interference when merging models,","venue":null,"work_id":"402c91d0-666e-4487-b828-8e547e578cb7","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.148958Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:165ae6138ee56c91ba554d355ba05b5d01af63780e28f0a07545c881c85a5402","observation_id":"db61f869-be6e-4470-a759-9772d27d2f7c","resolution":{"observed_at":"2026-08-07T14:49:34.698843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.393956Z","title":"Language models are super mario: Absorbing abili- ties from homologous models as a free lunch,","venue":null,"work_id":"9d925770-458d-442b-b0f7-12970b662fd3","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.265866Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:3c601abc802e18983e27138a294366820f141e037d328340e1efc34b249f8cc7","observation_id":"fa21d37b-a771-4449-91a6-3435eabc61af","resolution":{"observed_at":"2026-08-07T14:49:34.530162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.117388Z","title":"Unsupervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"b1d4cb47-f284-4d11-83f3-b48c0addbbd2","year":2021},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.390073Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:81c4e823d35eecd2d49bda3160c9cef33c2a5ca86c69126acc66c94376a90ead","observation_id":"398b79e7-8644-427f-8e5f-373c2ca90aa7","resolution":{"observed_at":"2026-08-07T14:49:34.214728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.898983Z","title":"Genetic k-means algo- rithm,","venue":null,"work_id":"120bd0e8-73fd-4593-ba0d-b3922dac38d4","year":1999},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.576695Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:ecfe45329ba901baa2717a53bdd2d9083103f2faa8eae01388533f99c57c8921","observation_id":"ee97c285-be2d-4cfc-9488-fdd2a8c1f61e","resolution":{"observed_at":"2026-08-07T14:49:34.005818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.765966Z","title":"Hifi-gan: Generative adversarial networks for ef- ficient and high fidelity speech synthesis,","venue":null,"work_id":"dd40ed4b-48bb-4944-9f45-561d7ddb726f","year":2020},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.750383Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:2f336b9832c0275ce2cf2f644df4eda47f3e6fca38acae8b9e8ac001e6f5a158","observation_id":"e8b373b7-9440-499e-9f3f-ac2a5e5cc222","resolution":{"observed_at":"2026-08-07T14:49:33.827520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.541958Z","title":"Librispeech: An asr corpus based on pub- lic domain audio books,","venue":null,"work_id":"1449b7c5-3a6d-41f2-9784-668b0916024d","year":2015},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.953409Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:a8a684f8b7b35eeda576d4d5a5efbf980c209c861714055009034f19dc0643c4","observation_id":"b653935a-2441-401d-aa7f-9a6b82a1fdf8","resolution":{"observed_at":"2026-08-07T14:49:33.654700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-12T12:16:58.791696Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-07T14:49:32.064798Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.064798Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:9892353d84848242079c69728a3ea6b35467ea7e6cd775e33060d020bb14193e","observation_id":"6d9ed3fb-bc8b-41fc-a9b7-ad04edf37432","resolution":{"observed_at":"2026-08-07T14:49:32.064798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.360802Z","title":"SpeechT5: Unified-modal encoder- decoder pre-training for spoken language processing,","venue":null,"work_id":"0ff3d134-87cb-4b2c-8191-785420653766","year":2022},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.257260Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:11927e5d0fb64f792bf23b80d25bf4a8fb0da48e295b95d3998ced7f22c6e374","observation_id":"85e25b7a-f8e9-46c9-94ef-00a99ae95432","resolution":{"observed_at":"2026-08-07T14:49:33.424292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-08-10T18:18:43.965281Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T14:49:32.437237Z","title":"Spoken question answering and speech continuation using spectrogram-powered llm,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.437237Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:34e09373d18a265097841ad33079043a8adb43efd8c223989708864fad273f73","observation_id":"578e6321-953e-4e70-9458-bd1ed3843068","resolution":{"observed_at":"2026-08-07T14:49:32.437237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:49:32.643541Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.643541Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:a66c091b9599e02d0e124c8e6649819e2ca5c0ea9ccef005bcc30b95bcf10943","observation_id":"3951a82a-26f5-4487-8216-8f763123e084","resolution":{"observed_at":"2026-08-07T14:49:32.643541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T03:14:44.274153Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 5 inbound Pith citation observations for arXiv:2505.17496."}