{"as_of":"2026-08-18T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8fb6ad2013ce2214422ec9d5ea8956ba367b9f891b3389945b28263abad3a2e","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:03:07.926870Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:02:14.608210Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:02:14.902604Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"cited_work":{"arxiv_id":"2502.01547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01547","snapshot_observed_at":"2026-08-16T00:02:14.902604Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","venue":"eess.AS","work_id":"26b85104-1fc9-4c5b-94d9-c738cd2e6630","year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.608210Z"},"links":{"cited_paper":"/paper/2502.01547","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:f5f317a27d7518355f3220013201051a3b4502bcd6e054ed5dcec5146ac5e4ed","observation_id":"31658b4e-5454-4c42-a0c0-c56795cce0fb","resolution":{"observed_at":"2026-08-16T00:02:14.909462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01547/citation-record","integrity":"/paper/2502.01547/integrity","json":"/paper/2502.01547/citation-record.json","paper":"/paper/2502.01547"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:07.620446Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.620446Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:2411ef2f3f7981adc98957637766e2dc36e41e0766e030f1093cbdafff0a02b8","observation_id":"36e66a6d-34ba-4b8e-8440-2d59a16c0f13","resolution":{"observed_at":"2026-08-09T15:03:07.620446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:09.065316Z","title":"Less is more: Accurate speech recognition & translation without web-scale data,","venue":null,"work_id":"0ad6853c-ee63-449d-9cc3-7a5e88f836b9","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.629110Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:50cf36af2e9f2bf4c2f8ce0bf483c2373a7409ecde8656b9886b4d3e9cfd8504","observation_id":"d763d471-8483-4c04-af38-66ca2efec5ff","resolution":{"observed_at":"2026-08-09T15:03:09.074872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:09.040478Z","title":"Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre- Training for Adaptation to Unseen Languages,","venue":null,"work_id":"b0f77c29-5caa-41eb-92a7-7af694682694","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.636547Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:e209f52c75a6a9f97a5feb7c64f5a084079d1d355a6ca5dc0f6cc3d206842691","observation_id":"e46d493a-d02d-4e7e-8e52-584060f119c8","resolution":{"observed_at":"2026-08-09T15:03:09.047753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:09.016208Z","title":"Ml-superb: Multilingual speech universal performance benchmark,","venue":null,"work_id":"f52b671d-7d30-46ff-86df-051a848c218e","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.644961Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ce03e740291cf23cc987cf499a9975f7d3b2548cf5be8402ff10fc6c2539703d","observation_id":"8394274d-6913-418b-985b-3c572fdcc44a","resolution":{"observed_at":"2026-08-09T15:03:09.023398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.994845Z","title":"Whisper-AT: Noise- Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers,","venue":null,"work_id":"c7cc5ef5-8706-43b0-8b60-40bea8e0d333","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.657611Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:13837739d892006e5d1d58f3db95f99a7416455603fc4413395987ff1f62ecd5","observation_id":"a221308b-4bbd-4d46-a4e3-583e078458d9","resolution":{"observed_at":"2026-08-09T15:03:09.002119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.972588Z","title":"Large language models are efficient learners of noise-robust speech recognition,","venue":null,"work_id":"0eeeb76d-4bc0-432d-86d4-34db60a6900a","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.667794Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:2ca5482785cf665c4cefd8c0a9a93bc1416016492083aefab3eb500dd21fbd38","observation_id":"df002455-96f9-4915-bb9d-748b31932171","resolution":{"observed_at":"2026-08-09T15:03:08.979409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.949543Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":"5211ef3f-62e2-45d8-9faf-8476f45ead88","year":2018},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.676676Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:1148c010d716b92b5c0e3194f18cb7c7526111dc99cd990151303c293ee3185e","observation_id":"8e11d26f-00db-4d7e-b871-6cf861d0359c","resolution":{"observed_at":"2026-08-09T15:03:08.956927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.926440Z","title":"Audio-visual speech recognition with a hybrid ctc/attention architec- ture,","venue":null,"work_id":"fd8a9642-e915-482e-9ccc-800e2d598972","year":2018},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.682749Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:e72c2d49d6a7e2131d8d7d52ca619c9a7461613b38a999c35d15008676d9f0bb","observation_id":"3b4d0265-477c-4caa-b0d7-c12c2e6eb71c","resolution":{"observed_at":"2026-08-09T15:03:08.934075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.901581Z","title":"End-to-end audiovisual speech recognition,","venue":null,"work_id":"c723b365-9aa2-4278-8639-013606648a74","year":2018},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.689021Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:e3b41ee2b3047a49efb4eb63907a31852f19f5a51a68d0b791984c5cbea55b4b","observation_id":"44cac0ed-1028-4b4a-ba1a-f9a3878a805e","resolution":{"observed_at":"2026-08-09T15:03:08.910426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.871803Z","title":"Discriminative multi-modality speech recognition,","venue":null,"work_id":"47759982-41e1-4e1d-8214-8775b61bd8f2","year":2020},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.694641Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:1b53b822046a77e5bb140f91a017cdb2d0281793a552472a8de0b977dce46b60","observation_id":"02e3376b-7db0-4457-8a1c-c810671286a4","resolution":{"observed_at":"2026-08-09T15:03:08.880621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.851043Z","title":"End-to-end audio-visual speech recognition with conformers,","venue":null,"work_id":"4354067c-d83b-499d-bb4e-a4e8da8046ad","year":2021},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.699642Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:dcd62251d9921b0dee565e2f07e6b272face3a0eefea69a124f30b363a8970db","observation_id":"61138ab9-eb69-4a70-8cb4-7faa9da03991","resolution":{"observed_at":"2026-08-09T15:03:08.858722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.826695Z","title":"Transformer-Based Video Front- Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video,","venue":null,"work_id":"8131db5b-d603-4055-939a-6f9aca4039b4","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.705490Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:cde0d4b04e299d5149038b92049b537ef39059261783178edce3bd8817d938f9","observation_id":"4e509d71-fbdb-400e-82f7-49eae079021c","resolution":{"observed_at":"2026-08-09T15:03:08.835897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.802868Z","title":"Robust Self-Supervised Audio- Visual Speech Recognition,","venue":null,"work_id":"cc9d4244-74a9-46cf-b26d-7f5a986b73de","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.711584Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ab6555eae9c90669e4ff03095dc0ccc6faba67cd02a15529cfa72d1df1268168","observation_id":"e8e6dce5-ce6a-450e-b873-b615a666b54a","resolution":{"observed_at":"2026-08-09T15:03:08.811281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.777433Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"19f15b13-3a7f-4e2c-8bc0-a4353e073168","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.717159Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:4637fd2d87cf1eadc7119e0b8d368f383df284644c557604c9ad3fccab293246","observation_id":"e8a21a7c-fd7e-46df-ad2b-005c0ef57b1f","resolution":{"observed_at":"2026-08-09T15:03:08.785801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.754375Z","title":"Audio-visual efficient conformer for robust speech recognition,","venue":null,"work_id":"d1d4be58-297d-489d-a184-52aaf66f1ca4","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.722811Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:af44fef8c89eb4469139084f7623ec4ca0b0fab21b0c6ad868b9b9d4d82dea4f","observation_id":"12d95f06-cb2d-4367-813e-ef6a257bb358","resolution":{"observed_at":"2026-08-09T15:03:08.762189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12319","last_updated":"2025-03-07T09:30:16Z","snapshot_observed_at":"2026-08-16T13:51:25.990686Z","submitted_at":"2024-09-18T21:17:27Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12319","snapshot_observed_at":"2026-08-09T15:03:07.727809Z","title":"Large language models are strong audio- visual speech recognition learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.727809Z"},"links":{"cited_paper":"/paper/2409.12319","citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:c05d7f922817966cfd4ab4ca587e22ca7b9a543c615c6e810c8f54ea8fb8957e","observation_id":"2244be9d-215d-4123-8dd1-3bdf48305918","resolution":{"observed_at":"2026-08-09T15:03:07.727809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.732856Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,","venue":null,"work_id":"702b540a-b4fb-413a-a776-f73576b9a41c","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.733675Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:3fb87df145b4bcb04805eabf93200f3fba8f9fd22cc8847c16acd335d6864cc4","observation_id":"c2bc02ab-d9e4-47a3-b4ed-64447ba14f70","resolution":{"observed_at":"2026-08-09T15:03:08.739525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.709225Z","title":"Learning audio- visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"5083cc5e-c1ac-438e-a513-952f427900d8","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.738870Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:e0174ef8daadfa7916803195a80eb666c732c583e3db99c4f21e9c6f555ce0dc","observation_id":"7309830d-ebb4-4beb-821d-6dddeb9ad7f2","resolution":{"observed_at":"2026-08-09T15:03:08.716579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.676242Z","title":"Efficient training for multilingual visual speech recognition: Pre-training with discretized visual speech representation,","venue":null,"work_id":"bea8042a-c5eb-4194-9268-a232611b4fd1","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.744642Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:a1ed5c431d625c570d6ae79a803eecdaa7a514e9ace8c2e6edfa36b6b1a94adb","observation_id":"546fd007-8919-4b06-997f-967cde156f6e","resolution":{"observed_at":"2026-08-09T15:03:08.688221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.657681Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,","venue":null,"work_id":"f327212a-5556-4360-a4fd-ba81641fd982","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.750519Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:3d095eaa0eed5b14a98b73ef389bb9237a14fd64368f74572f0fb88b4980edb4","observation_id":"08b9fe21-b622-4a98-b96a-a5814f0f093f","resolution":{"observed_at":"2026-08-09T15:03:08.663357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.633337Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"a09353bb-c598-44f6-91f1-df55424fce58","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.756377Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:190b28c1bf65f9bf4f817c4d86717d8b7cee61b41573cbbd6bfa2edf74bb042e","observation_id":"8fb9f648-784a-4b41-b679-2c46496d415e","resolution":{"observed_at":"2026-08-09T15:03:08.642378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-08-15T00:54:35.320150Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-09T15:03:07.762763Z","title":"Improving neural networks by preventing co-adaptation of feature detectors,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.762763Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:0165ed93a013eeb92efbdf3df67758818ed3dc895d9c063579d7258ae1e1e2a1","observation_id":"bb6baf1d-9960-4900-a057-09b9762b7737","resolution":{"observed_at":"2026-08-09T15:03:07.762763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.610039Z","title":"Moddrop: adaptive multi-modal gesture recognition,","venue":null,"work_id":"4351d441-f9cd-4dfc-9bb1-9b2e4c050ae2","year":2015},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.770554Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:196ef29dbfa50b4a60487fe70555290fd5e782e8df03bdbc44c4b8783c2a9766","observation_id":"8380c3a9-2e3c-4e3d-963e-c2e1c6015377","resolution":{"observed_at":"2026-08-09T15:03:08.616275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.589500Z","title":"Recurrent neural network transducer for audio-visual speech recognition,","venue":null,"work_id":"faf7043b-f147-4e5f-ae0d-c317d4a71278","year":2019},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.779518Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:f4e5ea0b9201a3f23984894bd16d4600b65e3d3fcf949701f1bea6e4814116b2","observation_id":"e0bd4aa6-222b-45eb-becd-281d14617ff0","resolution":{"observed_at":"2026-08-09T15:03:08.595548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.569840Z","title":"u-hubert: Unified mixed-modal speech pretrain- ing and zero-shot transfer to unlabeled modality,","venue":null,"work_id":"f6570bec-b3ce-46d4-885b-968cd7acae3d","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.785015Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:211313bcf5a3fcbacfb7078cad4a372b0343ef757c2e5ae8eb7e1e7800a63e39","observation_id":"29593e31-0d24-4cd0-99a4-bf8e0787951f","resolution":{"observed_at":"2026-08-09T15:03:08.575596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.549666Z","title":"Av-data2vec: Self- supervised learning of audio-visual speech representations with contex- tualized target representations,","venue":null,"work_id":"933517be-d124-434a-8ae0-cdf8e86d65c2","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.791481Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ac59729562fc5e8261ded8cad576bd08e511ee7f2dc6e9db416d0706d3c00989","observation_id":"d465ae67-070a-484e-a53a-296fb165f05a","resolution":{"observed_at":"2026-08-09T15:03:08.556376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.529529Z","title":"Av-cpl: Continu- ous pseudo-labeling for audio-visual speech recognition,","venue":null,"work_id":"2012cfb5-2ccc-4c77-b857-cbd3d9a552c8","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.799529Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:426adf6c7e1bf2eafff2df6c8fec4b44d2db1e46076f728cb41691b88956b049","observation_id":"c74a130c-812f-4f37-85b5-88e9aaf7124f","resolution":{"observed_at":"2026-08-09T15:03:08.536349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:07.805145Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.805145Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:912f3b8c1f7c86d85f837d0e141b94becb0e94950d35f1dd242bde1b1372a04a","observation_id":"c6b910bf-beed-4376-92a6-424d0d8bf13a","resolution":{"observed_at":"2026-08-09T15:03:07.805145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.488871Z","title":"Reducing transformer depth on demand with structured dropout,","venue":null,"work_id":"d18f38e6-5e11-42ce-b5bf-38bf89b9bc50","year":2020},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.810903Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ff91de5a297f74e8fad9f68abaace7a51f97307eb24ca2380c90ad56dee4a50b","observation_id":"aea984b1-97d7-4c3e-ab50-fc385ea22aac","resolution":{"observed_at":"2026-08-09T15:03:08.497117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.466927Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":"6604e821-63df-46dc-94db-acd95bd12050","year":2018},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.816149Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:8807287b9948e2b0867e5132f483c8f574b9bdc5c7c402d569e5ce065b9b717b","observation_id":"8d036736-1800-4ead-a958-6487c6c89f7d","resolution":{"observed_at":"2026-08-09T15:03:08.474571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.443503Z","title":"The multilingual tedx corpus for speech recognition and translation,","venue":null,"work_id":"8169d34c-6b33-421d-9bfc-f0d6c6e8e53f","year":2021},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.821291Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:a00b20061b2a14fafb80878715b3b1efc8897611663de521855647c5e32db205","observation_id":"c2b1e04f-f708-4d92-aefe-d2c845d46035","resolution":{"observed_at":"2026-08-09T15:03:08.449981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.418551Z","title":"Jointly learning visual and auditory speech representations from raw data,","venue":null,"work_id":"539fd49b-fbca-4626-a8c1-ac26c8dda01d","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.826062Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ff2bba3516126ed878763c96e41c377186ade7ec953e57184202591ebfeeb45a","observation_id":"385b4df5-66e6-4df6-a230-e3185c1c5f51","resolution":{"observed_at":"2026-08-09T15:03:08.424558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.399021Z","title":"Braven: Improving self-supervised pre-training for visual and auditory speech recognition,","venue":null,"work_id":"5323c3e0-fbd0-4767-82e0-9f139e2f0778","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.830909Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:2acedde2559fe68f4f4fe6b771055763f077ba6ccd8a8a6583d47adba680a48a","observation_id":"8dbf6df7-8964-413f-b51a-8f046c7e1a1c","resolution":{"observed_at":"2026-08-09T15:03:08.404730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.379430Z","title":"Unified speech recognition: A single model for auditory, visual, and audiovisual inputs,","venue":null,"work_id":"49b309ee-6796-4055-90ad-c7bda1e8bb17","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.836000Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:5fd85c67103bec8474cd79d15c635ea7b503142015019683006baf9e8a162299","observation_id":"14b41418-4d9d-49d2-b8a6-04cb133fa1d6","resolution":{"observed_at":"2026-08-09T15:03:08.385428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.357757Z","title":"Visual speech recognition for multiple languages in the wild,","venue":null,"work_id":"38825d3c-f5e9-40e1-b11f-97d74ab30040","year":2022},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.841096Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:5191a1d6d9a9d44bd3a330ed1f216c750f253c032aa3bad39c0cfb3c7b25ca3f","observation_id":"b97927d3-ede5-4728-9966-51d92880e896","resolution":{"observed_at":"2026-08-09T15:03:08.364237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.337978Z","title":"Learning cross-lingual visual speech representations,","venue":null,"work_id":"65f15504-e0e4-4f46-9664-6824ba699257","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.845998Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:31cb09e8fb76ada9f8dd1f01479eef2a2860d698dc4941932e24db456529445a","observation_id":"e6bccbc4-25ff-42af-8208-12533f65f5e8","resolution":{"observed_at":"2026-08-09T15:03:08.343886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.316666Z","title":"Lip reading for low-resource languages by learning and combining general speech knowledge and language-specific knowledge,","venue":null,"work_id":"56ab721d-ff48-4f17-85fd-b234cb091c68","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.851287Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:6b34ed2c9de0b3603adffd99239252ef49bb1fd39b09952533c27435dd21f038","observation_id":"7110a677-aff4-4f0e-9b62-3da95a3a408e","resolution":{"observed_at":"2026-08-09T15:03:08.323356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.291980Z","title":"Visual speech recognition for languages with limited labeled data using automatic labels from whisper,","venue":null,"work_id":"58552daf-eb09-418d-9d21-aae06a350bc1","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.857549Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ae5aca84960ab0c648b13b7988db2002e3963447ef83bd4164afda1f0c41cf49","observation_id":"63b682dd-ec3e-4a89-aa90-7fd72ce28d3b","resolution":{"observed_at":"2026-08-09T15:03:08.297953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.271754Z","title":"Dlib-ml: A machine learning toolkit,","venue":null,"work_id":"ba37b292-3770-4c81-83bf-a4f437083684","year":2009},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.863346Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:9785bec787390ebeb087865a0d6a84351f3672648b263228c96cf5081b823c03","observation_id":"a7dce9ac-2401-4d27-8966-c86f8d680b07","resolution":{"observed_at":"2026-08-09T15:03:08.278214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.251395Z","title":"Lipreading using temporal convolutional networks,","venue":null,"work_id":"ccd9d8be-0edc-4061-b241-7989d0e4e4d7","year":2020},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.868585Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:aca9da8b3658629ac28096c6a7d1e7169c40cd325acc9395b047b14117a18255","observation_id":"48fe8379-40b4-4ab5-92de-393c514e34db","resolution":{"observed_at":"2026-08-09T15:03:08.257725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.232927Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":"cfb57a10-9d9d-4784-b10c-66cc14f1f336","year":2019},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.873809Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ac7b5f20e8cb2990f052bcb52d90efc4b79bb32a203261af13264966ad12121b","observation_id":"eea94984-04c7-42ce-a740-939e941c3201","resolution":{"observed_at":"2026-08-09T15:03:08.238738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.213807Z","title":"PyTorch Lightning,","venue":null,"work_id":"5fab8874-1c28-41de-8070-0fdbfdef4332","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.879462Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:573be6bc3d7746fa94b8e99cc255b225a292603da636c029e3a8c32f8d37ba2d","observation_id":"1b00122c-32b2-4b3e-9bae-659036c7d26b","resolution":{"observed_at":"2026-08-09T15:03:08.219576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:07.884994Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.884994Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:c8b2698a0706dc72e1c319a2259d282b43db44137114d848d01787ae64322ede","observation_id":"df6723af-8ffa-4c3d-9ca8-38dec7a295c3","resolution":{"observed_at":"2026-08-09T15:03:07.884994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.180861Z","title":"Musan: A music, speech, and noise corpus,","venue":null,"work_id":"20051efc-bed9-4c6f-8349-26d4cdcff304","year":2015},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.890473Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ebdbed658b77a258ca70d226a554acf4b916501897744679eff3c76daae54d8b","observation_id":"250fce94-1a33-4c98-9acf-8c22242b245f","resolution":{"observed_at":"2026-08-09T15:03:08.187582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.159521Z","title":"Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception,","venue":null,"work_id":"e36edfc9-205f-4ce9-9254-b9b0ad0c637c","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.895754Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:a6c8d5981343bc9087a156939ad009bc4f40bc17bbaae83c5781b3acd78c21f9","observation_id":"761cd799-449e-4c39-a88f-be137e13379a","resolution":{"observed_at":"2026-08-09T15:03:08.165845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.138170Z","title":"Intuitive multilingual audio-visual speech recognition with a single-trained model,","venue":null,"work_id":"228fb27b-3b96-4974-a50d-87f1d566d0df","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.900929Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:ff00e71ddae782ab899c253b09748d4b168066b62f600901824d4f434e52a476","observation_id":"093781f0-359e-49ae-be0a-06a28840dfe0","resolution":{"observed_at":"2026-08-09T15:03:08.144083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.115965Z","title":"Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer,","venue":null,"work_id":"24b765cf-b3b1-4325-bac8-12cfc57d6a69","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.906262Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:7809f56b40a7eab6ef4261874f70e012757cedb88de0e4be244c36e8743800bf","observation_id":"4b7ad998-8934-4a4d-9567-022f9efe3597","resolution":{"observed_at":"2026-08-09T15:03:08.123563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.091169Z","title":"Parameter-efficient cross-language transfer learning for a language- modular audiovisual speech recognition,","venue":null,"work_id":"6f768502-abc1-4fbc-970e-c6260be985a9","year":2023},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.911410Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:530e153f0373118e4da9d42c3b2ce1bdaf85940526953ebd8d0982cb16fe438f","observation_id":"bbc9f116-afe0-4ff3-bec7-3cade1e228ba","resolution":{"observed_at":"2026-08-09T15:03:08.099565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06606","last_updated":"2025-05-06T08:24:18Z","snapshot_observed_at":"2026-08-18T08:41:38.308587Z","submitted_at":"2024-07-09T07:15:56Z","title":"Tailored Design of Audio-Visual Speech Recognition Models using Branchformers","version":4},"cited_work":{"arxiv_id":"2407.06606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.06606","snapshot_observed_at":"2026-08-09T15:03:08.001423Z","title":"Tailored Design of Audio-Visual Speech Recognition Models using Branchformers","venue":"cs.CV","work_id":"9e023ef5-8d3e-4419-9609-25924dee17b2","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.916668Z"},"links":{"cited_paper":"/paper/2407.06606","citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:867456b152807861e60a01028fbc7509171245d60e8d01f89a9b1f41aaed1159","observation_id":"4404c09d-99be-479d-be85-4e0fa608f3ef","resolution":{"observed_at":"2026-08-09T15:03:08.009407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:03:08.071611Z","title":"Interleaved audio/audiovisual transfer learning for av- asr in low-resourced languages,","venue":null,"work_id":"268c8c2d-a74a-4147-820e-b680c8daddc3","year":2024},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.922193Z"},"links":{"citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:87d70787a083240a47555f74e68d425d35ed0be9fc470c34ba77d2e760812049","observation_id":"ee80a905-f169-4e1c-af44-3f8f51b53760","resolution":{"observed_at":"2026-08-09T15:03:08.077680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-16T17:41:05.963766Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-09T15:03:07.926870Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T15:03:07.926870Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2502.01547"},"observation_digest":"sha256:3cb06ea1c5356ce62295e6e05240773b83b5745ab7b7d48c081bb804543d7c15","observation_id":"ec092975-4e34-4db7-9888-f6f1929deaf8","resolution":{"observed_at":"2026-08-09T15:03:07.926870Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":44},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2502.01547."}