{"as_of":"2026-08-09T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d57a3a8a5ab3333e0ca7188502615c3ff6f96c9bfb31af8a1a125abfa649d9f3","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:13:04.256626Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04586/citation-record","integrity":"/paper/2608.04586/integrity","json":"/paper/2608.04586/citation-record.json","paper":"/paper/2608.04586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.166862Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.166862Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:68b114b0ff2779037646b03ae9e6b5f689f3dcb64d3f4cf256210252bc6b90fc","observation_id":"aca777d5-1978-4caa-a246-0562188701a7","resolution":{"observed_at":"2026-08-08T18:13:04.166862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.170870Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.170870Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:d3ec21254e21fa7451166bf927370bc16df642558f0b071b6e3eb30fb689079b","observation_id":"a4436134-4173-49f1-ac11-45641dc9d698","resolution":{"observed_at":"2026-08-08T18:13:04.170870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.175825Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.175825Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:d4a040c0bcf5e9bd72902530d7c88758d6900ba6da523561b990410ad47f3851","observation_id":"98e142c7-0fa1-461e-9538-603fef5e8995","resolution":{"observed_at":"2026-08-08T18:13:04.175825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-08T18:13:04.179577Z","title":"arXiv preprint arXiv:2605.23463 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.179577Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:1ff28093647e3b310bb770b13c9dc58902624712c25ed0723c7f0aab14050dbc","observation_id":"090e4f5b-a5f6-48b6-8b13-4f2c233b7f3c","resolution":{"observed_at":"2026-08-08T18:13:04.179577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.183760Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.183760Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:4797bd24870c83e07fc1c4317cbdb773ee770f1e99c69feda3097037d97489ff","observation_id":"4ab619fd-5daf-46ef-8d3e-7b4b84b5f10c","resolution":{"observed_at":"2026-08-08T18:13:04.183760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.187565Z","title":"and Zettlemoyer, Luke","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.187565Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:00248e6041784231d5a71b031438b9d9a1197657625e010c9ef164160a64cd5b","observation_id":"44d23c1c-a91b-4697-8dd4-e8b8e76a9f58","resolution":{"observed_at":"2026-08-08T18:13:04.187565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.191921Z","title":"SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.191921Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:e9ffb9f3c2a16efed24da4bf0645dffcc997ada9657cbaa27d9cbd05e4de3493","observation_id":"e4dc8a72-4b62-4837-9199-9a3698ac4bc3","resolution":{"observed_at":"2026-08-08T18:13:04.191921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-08T18:13:04.195824Z","title":"arXiv preprint arXiv:2308.11596 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.195824Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:a2fe671bc8e8343cb007f27a86649181313c99715fb2342f41736ae09516d3be","observation_id":"aac095a1-cd66-4590-bdfb-72806bf3ca07","resolution":{"observed_at":"2026-08-08T18:13:04.195824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.199417Z","title":"2022 IEEE Spoken Language Technology Workshop , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.199417Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:dfeb0bc06828f876cd8b6443ad38f0ec9403791d50d197b2d061873d81150cd3","observation_id":"2a9eedb4-4e22-4bb5-a3a2-63a39a7baa95","resolution":{"observed_at":"2026-08-08T18:13:04.199417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.202643Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.202643Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:40dfbd34f81d408ba7b78df27fab143bc5c07ed798746d607a4f8fa3ef254a64","observation_id":"095511d2-67fa-4898-a4a0-fa1aa146d905","resolution":{"observed_at":"2026-08-08T18:13:04.202643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.206328Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.206328Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:070e026572667f7d53e55570fb5f1ec17414e37cb811286c7b4c28b272037449","observation_id":"cf09eed8-3f6d-4b68-95d4-9cd4782f4164","resolution":{"observed_at":"2026-08-08T18:13:04.206328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.209378Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.209378Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:037449458d1cceddf5b3f2b0cc616b15be31bdc7b1911a0a30a1d7efdc39b631","observation_id":"bf9eb413-04b2-4109-b15b-d2d83e8962e2","resolution":{"observed_at":"2026-08-08T18:13:04.209378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.212736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.212736Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:a13cad0805290771b70dcc616ab4cd89994754b4a507705cb1b52061f1ce2791","observation_id":"446110a8-b6ff-4681-a7c6-d5425b1659fd","resolution":{"observed_at":"2026-08-08T18:13:04.212736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.216568Z","title":"Proceedings of the Third Conference on Machine Translation , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.216568Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:2972c48352b9fbd1a771e6a4a5028a84e1e0c8d93ec95b5f62261a98d7837809","observation_id":"96711162-948a-4750-bf6b-b3480c1c15a7","resolution":{"observed_at":"2026-08-08T18:13:04.216568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.220300Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.220300Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:96fcd517317c722fdca85d703db824287f6dd73821656bec661ef5eca867f6e9","observation_id":"b9333835-df14-41ea-992d-9d695db1c626","resolution":{"observed_at":"2026-08-08T18:13:04.220300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.224335Z","title":"Proceedings of the Seventh Conference on Machine Translation , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.224335Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:e331275cef15571cecf7bb1b42c865d36452731a2062cd4d7da0b62ff206d5a3","observation_id":"23013f72-621d-4d29-a9a5-2b1c087941e0","resolution":{"observed_at":"2026-08-08T18:13:04.224335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.227984Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.227984Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:cddeb9d99eb318fddccad1f543e5ea2467b1a6d3bfbc8e558beec87c2a040516","observation_id":"b52bf9bd-833e-4c5d-ba50-251bdd140048","resolution":{"observed_at":"2026-08-08T18:13:04.227984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.231936Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs With Mixture of Experts , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.231936Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:58b6b947816abf09671f06a1d5efaa7abbdaee1b7c583e2b8f739ca3d0665d60","observation_id":"bb64f81b-daac-41fa-8bf5-1ab69eb141ca","resolution":{"observed_at":"2026-08-08T18:13:04.231936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.235866Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.235866Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:2bf6fce0f75c89d2a45f8fee3817dc9092d44e736528a29814f2a4e7a6aca7fe","observation_id":"a4034a0f-346e-4c03-87a7-e2a9530fd879","resolution":{"observed_at":"2026-08-08T18:13:04.235866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.239559Z","title":"Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.239559Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:3344062f53782c3cb4fcbb51b04c4b59ca17a3b2c778b17df1fc8b1942ded2bf","observation_id":"629adbcb-4e14-4409-9ead-f724a4590f72","resolution":{"observed_at":"2026-08-08T18:13:04.239559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T18:13:04.243310Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.243310Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:1ed749d83cec31e65a3f4a054658823c4ec29ba8a004989bceaad1e7a3b569f9","observation_id":"0a6942ac-1d07-40c1-907c-e68aa0f45d0b","resolution":{"observed_at":"2026-08-08T18:13:04.243310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.246933Z","title":"D ialect M o E : An End-to-End Multi-Dialect Speech Recognition Model with Mixture-of-Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.246933Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:ddd941572b714c51c204a5d15b98c78d163020374ffee85b01c5a003f10d8f26","observation_id":"a4c0e481-f60f-4a3f-aa8d-630e25e7d8c8","resolution":{"observed_at":"2026-08-08T18:13:04.246933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.250348Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.250348Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:3b8407aa506d5e0b0b4267b7755a97c91e70dcaa75288aa1c4a9db5cf61e231c","observation_id":"f086ac1e-bbe2-476e-9628-995755f9b57d","resolution":{"observed_at":"2026-08-08T18:13:04.250348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:13:04.253422Z","title":"Proceedings of Interspeech , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.253422Z"},"links":{"citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:ae8f98352d5ced3c6d9bc07b53eb9b49193c78092798a9ea772965b9aeabd20d","observation_id":"cee2d190-c35f-4003-8802-0c17698f148e","resolution":{"observed_at":"2026-08-08T18:13:04.253422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-08T18:13:04.256626Z","title":"arXiv preprint arXiv:2509.17765 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.256626Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:2c8728764a80901253ed51c4c8215a9eff02125af0fc9f1969af08b2dd9cf0ab","observation_id":"2123640f-5a7e-4fa7-8bcd-1ed270dcc59d","resolution":{"observed_at":"2026-08-08T18:13:04.256626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:10:10.846938Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.04586."}