{"as_of":"2026-08-09T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d21d92dd05c6c1f9bd1bd9909a9238d4c90860f8bc8f2c04b4c0a498023b8c4f","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:46:12.269019Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:34.111978Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:39:34.251185Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"cited_work":{"arxiv_id":"2502.10447","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10447","snapshot_observed_at":"2026-08-07T15:39:34.251185Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","venue":"eess.AS","work_id":"ac49cdf8-dc2d-4103-aa07-c6e714ba7f87","year":2025},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-07T15:34:08.821122Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:34.111978Z"},"links":{"cited_paper":"/paper/2502.10447","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:50268014fe0c89b1385720f68f85276743cbb6bdfb2c5d6102c0525004255251","observation_id":"10189419-0fe1-4ad1-9f36-c209cea88af3","resolution":{"observed_at":"2026-08-07T15:39:34.345367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10447/citation-record","integrity":"/paper/2502.10447/integrity","json":"/paper/2502.10447/citation-record.json","paper":"/paper/2502.10447"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.941722Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.941722Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:50b5b5162a4b290201d7638ef74951ecf50d66c50d087f22bddff5d79f281a7f","observation_id":"cb00bbcc-96c2-42e8-b779-f4adb89613c5","resolution":{"observed_at":"2026-08-08T12:46:11.941722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:46:11.947979Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.947979Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8dc731710206e2e4c88f70699b152469a5c0f0c73732b6f31ec2a156d0e4c1fb","observation_id":"f8a90e81-c9e9-459c-87f8-006a926ba1dc","resolution":{"observed_at":"2026-08-08T12:46:11.947979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.952950Z","title":"S., Senior, A., Vinyals, O., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.952950Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:5b58f932a3a7befb76dccf0bfcbeafa9fd980c3867d3eec373646f24c0254624","observation_id":"78d4d530-6232-44cd-a438-e5cf4c89d29e","resolution":{"observed_at":"2026-08-08T12:46:11.952950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-08T12:46:11.957891Z","title":"S., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.957891Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:99b04d3db7f5d75b56c4cb76eb3b7af76d1ac75f5e828b156268addc3b3c0bad","observation_id":"09235db7-3652-4033-92ad-731095d6de81","resolution":{"observed_at":"2026-08-08T12:46:11.957891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.963258Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.963258Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:37c5bf31f22259b2fa58130174c7f38583cc1c8af4eef6961f7435788076c356","observation_id":"2e695b4c-6200-41a6-b137-6a12fb193dd7","resolution":{"observed_at":"2026-08-08T12:46:11.963258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.967831Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.967831Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:b6ba37b88dbbb9b5de62e0531c30cc5ceba833caf54f861708f2608b56ebcbec","observation_id":"6caeebfe-07b7-4133-9379-0b036559bba2","resolution":{"observed_at":"2026-08-08T12:46:11.967831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.101878Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":"6437ef85-fb91-40a7-b241-8ec84f6f3fc5","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.972414Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:e60c5c194a8edcfd2c6c80333cd72b6e82a2126c339cbd376ee4459b94765aa8","observation_id":"0d56858b-ac09-4ac0-ad31-d73f45facc6c","resolution":{"observed_at":"2026-08-08T12:46:13.105633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:11.977100Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.977100Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:7545245a2e3ac17ca0f345e233591837dce443a774740cb0d8cafb250eb81140","observation_id":"3dbff9a2-7450-40d3-b556-096fbdcda2bd","resolution":{"observed_at":"2026-08-08T12:46:11.977100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-08T12:46:11.981186Z","title":"C., Dale, D., Dong, N., Duquenne, P.-A., Elsahar, H., Gong, H., Heffernan, K., Hoffman, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.981186Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:42c89243ec8dcdec3e240762938d1b48f70bd06d6eee8fae1ccc4bb34b444d20","observation_id":"62f50549-e5f2-4082-84c2-aa4a81d73ecb","resolution":{"observed_at":"2026-08-08T12:46:11.981186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.086289Z","title":"and Timofte, R","venue":null,"work_id":"ebca1bb1-8d12-4976-a7e5-9ce3d2a57173","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.985691Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:1051d992b5f7046f4a47a27ff808872e229e4c59c180f61f32e00f78c8a299f8","observation_id":"a4b7e83e-c38c-4e3a-8a4a-ccc9451e40c4","resolution":{"observed_at":"2026-08-08T12:46:13.089504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12319","last_updated":"2025-03-07T09:30:16Z","snapshot_observed_at":"2026-08-07T00:42:32.268631Z","submitted_at":"2024-09-18T21:17:27Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12319","snapshot_observed_at":"2026-08-08T12:46:11.989857Z","title":"Large language models are strong audio-visual speech recognition learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.989857Z"},"links":{"cited_paper":"/paper/2409.12319","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f9a9fa40d3835e7a5ff8032ebdb191c1f232872f4162879c94275a21118e3f9e","observation_id":"9d21efac-daea-48f0-a0b4-23f51b2e50e2","resolution":{"observed_at":"2026-08-08T12:46:11.989857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.076721Z","title":null,"venue":null,"work_id":"0884f55e-620d-4aa8-aa70-a72976ebb041","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.994730Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c5ae59f628d59336de455bfda4f8e2e996265f0eb73c526ea4210ec6ffec1589","observation_id":"cd483a05-4471-44fb-91fb-0d045342d569","resolution":{"observed_at":"2026-08-08T12:46:13.080054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.066642Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"557ed543-99fe-4d41-b49d-550462184acf","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:11.998955Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:ec04ce60e48ecef5552f2336c6f13ef6a0722f045aaca435dfadfca5740a71bd","observation_id":"94c28bb5-c138-44f7-9c7c-6d1910553bdd","resolution":{"observed_at":"2026-08-08T12:46:13.070272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.056664Z","title":"Mixtures of experts for audio-visual learning","venue":null,"work_id":"e79d15b7-1a4e-47a3-9c32-21291c5ee0bb","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.003079Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:54fd44721bd4858d48335fb84a0f8b5ec7c25942929e3d903fa3d084ea5acdd8","observation_id":"0313e3cd-1a74-4706-b120-33ba3729349d","resolution":{"observed_at":"2026-08-08T12:46:13.060255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.046622Z","title":"Self-supervised learning with random-projection quantizer for speech recognition","venue":null,"work_id":"13c59efc-982b-42ad-83c5-227f2a5d079e","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.007423Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:38c1460d2890917e02b0b3c2c9c90af1f75856c243330cfe5639ed6a0db4bdaf","observation_id":"d3bee3c5-68f5-4dab-b490-218a46cd56b7","resolution":{"observed_at":"2026-08-08T12:46:13.050389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.037045Z","title":"J., Kim, M., and Ro, Y","venue":null,"work_id":"afb00f31-944e-43e3-b744-83800cd25d7a","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.011353Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:1fa33b42ae3feb1281671ff88c255076a100e324b3412388aa802015d0056629","observation_id":"8b5cf09a-2a9a-4c10-b50a-b937abbd56ee","resolution":{"observed_at":"2026-08-08T12:46:13.040422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.026701Z","title":"S., Nagrani, A., and Zisserman, A","venue":null,"work_id":"bd78cdf8-4789-4d2b-970a-4db0f3968a65","year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.015208Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:bf4a006ef2c3864ff3cc739693f26019fde86c3931379091577ff9cf6f58fdd6","observation_id":"10622f6a-273b-455e-9a13-874523981cac","resolution":{"observed_at":"2026-08-08T12:46:13.030425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.015717Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"e7dba224-2614-4fc4-9a87-60db94b52672","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.019021Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f0c158f5052a09e9c5984db9220729940b3d5cb8c958c608a668b48d0d837428","observation_id":"5e64d104-7cd0-4ae7-8d51-06a432a874d7","resolution":{"observed_at":"2026-08-08T12:46:13.019361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:13.005038Z","title":"Stablemoe: Stable routing strategy for mixture of experts","venue":null,"work_id":"ba7847ca-2912-431f-b4a5-492e85885c4b","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.022925Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:05a5ef20f651cbb8383c169308709abef71702288b8c5f9490e21838e751f552","observation_id":"5dd41cc2-e5c3-4328-aee0-e1070ad4bbc5","resolution":{"observed_at":"2026-08-08T12:46:13.008786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.994288Z","title":"A study of dropout-induced modality bias on robustness to missing video frames for audio-visual speech recognition","venue":null,"work_id":"4eca3ee2-f7e2-4f57-8fef-d24426900093","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.027308Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:cfaf12f8a429dc90630ab0b4580a5fd5c37eeb1194c76bf4bb1dc058403456b0","observation_id":"0405de2f-f8a3-485f-94b7-c584ad2fa1ec","resolution":{"observed_at":"2026-08-08T12:46:12.998388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.983954Z","title":"and Luettin, J","venue":null,"work_id":"44d77559-51c0-4a51-a63a-910954d1f182","year":2000},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.031328Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:1bdb73f44e32dd8bc9920f14b066e9189ab1fbd9a74758ae1cff78a9f559ab3c","observation_id":"5fa66c23-3834-481f-b695-ae71b99e2503","resolution":{"observed_at":"2026-08-08T12:46:12.987504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.973572Z","title":"W., and Matt, P","venue":null,"work_id":"d9b6c46a-1cfd-4a93-bd59-f29784b4a03a","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.035295Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:7b017927ab3a9a9d66712b8f31a1e547ce5272fd251d429f3862b4b8e2cb2943","observation_id":"54992c07-7d83-4e18-8e1b-8fd801d9fcd0","resolution":{"observed_at":"2026-08-08T12:46:12.977185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.039182Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.039182Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:10e78ad1a512a0bcc93e09685686c0f414155e558da85ea928e4bab82fe03a59","observation_id":"eb738fe9-acd8-45a5-8078-6693ed7466bd","resolution":{"observed_at":"2026-08-08T12:46:12.039182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.956144Z","title":"Boosting speech recognition robustness to modality-distortion with contrast-augmented prompts","venue":null,"work_id":"fe6e6e11-f5e1-419c-a1a3-0248e0655162","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.043299Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:6fc1897f42bc98cec216f6017ed3ea9538dd6f624ddaebad5e6a98f84852cb09","observation_id":"b727f062-e417-4fa9-9016-14e32e64f9ff","resolution":{"observed_at":"2026-08-08T12:46:12.959944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.945931Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":"27306669-9611-49f6-afd4-1f59f70d75da","year":2020},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.047254Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:04ea81622b630003f76c3b4f4e9bd54d88d7fa434604521b19dc6c76bcb2673a","observation_id":"96a8fece-b9ff-4f10-ac66-9350ea481c97","resolution":{"observed_at":"2026-08-08T12:46:12.949631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T12:46:12.051209Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.051209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3de3f2b55420ee24ee3056ecda75fff38e4782f0e23465047d30321525e7cddb","observation_id":"0386b6f4-63c0-4444-8e36-a72ec75d3e59","resolution":{"observed_at":"2026-08-08T12:46:12.051209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.934702Z","title":"Jointly learning visual and auditory speech representations from raw data","venue":null,"work_id":"121aa5e4-6639-4239-8663-a4fa38ef8ed7","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.055256Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:bff88560d8db79ff59f1c8e7830079770d98c02d335f86c3077b5cd43387cf57","observation_id":"6f54ce98-8b96-4709-a4c5-b81514cd5cea","resolution":{"observed_at":"2026-08-08T12:46:12.938761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.923772Z","title":"Braven: Improving self-supervised pre-training for visual and auditory speech recognition","venue":null,"work_id":"93fdfc9e-3c2b-498a-826b-be08cb890140","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.059701Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c1ac029f82ee7fbed63b9f2bd73d02110fc25fcce6bfabaa080fad959342206e","observation_id":"55a73f4d-4585-42da-9190-fea994ad50c4","resolution":{"observed_at":"2026-08-08T12:46:12.927405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.913560Z","title":"XLAVS - R : Cross-lingual audio-visual speech representation learning for noise-robust speech perception","venue":null,"work_id":"6933b799-0118-4429-82c9-b195c9886339","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.063242Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c62fbb4a3cc15fd1ee7754e9cd03b5574b8552613456114fb3f176daccc38ed9","observation_id":"d65721a7-5e49-4b3c-9e82-243a295f819e","resolution":{"observed_at":"2026-08-08T12:46:12.917268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.903301Z","title":null,"venue":null,"work_id":"5ca453fb-0be5-4ca7-b6ac-6d9b4540700c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.067010Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:41f55eb391b2e3abbd899d6a259eb7c4c80f5b679c1c8fcc289d72ff723e969f","observation_id":"9c4f2e9f-e739-4545-a79d-fa40926bb734","resolution":{"observed_at":"2026-08-08T12:46:12.906730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.893157Z","title":null,"venue":null,"work_id":"b9225993-61ef-4e82-97a6-29341071ff9d","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.071089Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:94f30ad8b39574436fe060a02ad9b8e442d9a462886b23045052cc0b876aa789","observation_id":"1dd6c8d1-c13f-468b-987a-f6e4568ca8da","resolution":{"observed_at":"2026-08-08T12:46:12.896616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.882680Z","title":"and Shi, B","venue":null,"work_id":"8a3f47a3-0d8e-4ecf-bfad-42dda7661744","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.074951Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d676ada99a9f95f174b548d0ec4ab21dd23c2fd407d717847a2c19f5b52d021e","observation_id":"3875f7e9-9ea6-48d8-bd22-2b184af8a91f","resolution":{"observed_at":"2026-08-08T12:46:12.886581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.078580Z","title":"H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.078580Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:47d10ef0f2ceb3fd7b86e2e9981ea125d93cea9d02420cef7b4174f5e7e2a3e2","observation_id":"ac8f7845-fe02-42d2-83cf-0fa56b0f684d","resolution":{"observed_at":"2026-08-08T12:46:12.078580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.866416Z","title":"N., Zhang, Y., and Beaufays, F","venue":null,"work_id":"3f29a441-ce40-4176-9673-8760d9e7fb5c","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.082306Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:e16aea6fe454eae22a34d144e708e165ef479f241b2f093702f90b23bac987ed","observation_id":"6f6de3fe-b46c-4d9f-9d0c-4bcc01d00591","resolution":{"observed_at":"2026-08-08T12:46:12.869924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.856215Z","title":null,"venue":null,"work_id":"78dc415d-7e06-4612-9ea5-cd001138ba5f","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.085973Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:b49bdb761cdcee00dafe2f3171aadb7e9c308a758fa0514441827e6f74ec710e","observation_id":"976eb8dc-4005-4619-8d18-2970d5df3951","resolution":{"observed_at":"2026-08-08T12:46:12.859640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.846148Z","title":null,"venue":null,"work_id":"645f824d-50ee-4c9d-9316-500da556fa18","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.089684Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:ad8bb4a588bcb13d1737a1c5cfaa18f68357db3afcee21c75edae9e800fad14a","observation_id":"8bddd93f-c46e-47c0-93bc-95c37467a604","resolution":{"observed_at":"2026-08-08T12:46:12.849510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.836205Z","title":null,"venue":null,"work_id":"5bc2a227-991a-42c8-9af8-c515fcf8ffc3","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.093433Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:83b757447bc2a7ea420dd0ca037fd27e14adbcaf5b02b6ff5c1ab9e578139e98","observation_id":"3cc7802d-eaff-464b-b122-a172b1f036fb","resolution":{"observed_at":"2026-08-08T12:46:12.839686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.097176Z","title":"A., Jordan, M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.097176Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:237c566382a6b8f35c1e840ff3a59675671f865dc226f9454b1274ab20ada3bb","observation_id":"83791601-00d5-48e6-b597-166a6fcf1351","resolution":{"observed_at":"2026-08-08T12:46:12.097176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T12:46:12.100811Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.100811Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:21517341edcdec8a247c0c529ea7dc39ee656101c97e0701ff35a701d65560be","observation_id":"9c769899-7176-4dfd-a205-9ec91ae2553b","resolution":{"observed_at":"2026-08-08T12:46:12.100811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.820824Z","title":null,"venue":null,"work_id":"08d323dd-d149-4701-a8a1-76a3734d8af2","year":1994},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.104768Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:cb19987c5aaccff89c15cbd9253df7985cf37860536657da45e59bf6096e151a","observation_id":"1b155f64-0f2f-48f0-9979-835e89202665","resolution":{"observed_at":"2026-08-08T12:46:12.824050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T12:46:12.108410Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.108410Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3e7d5807fab069edf14626c4205914d3ff679898d30dae65e5895a8dc2b22dbd","observation_id":"3c730175-c11c-4cf6-8f99-b4b2550e4145","resolution":{"observed_at":"2026-08-08T12:46:12.108410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.810597Z","title":"Learning video temporal dynamics with cross-modal attention for robust audio-visual speech recognition","venue":null,"work_id":"813caa11-fa7c-47e7-be52-b6e05b466978","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.112122Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f8b912dfb991bab0227dd68f53a1d76b81e1a40839a6c39edd6d3d12ded98f96","observation_id":"f9ba568c-e35b-46a9-a66d-5c63c2c32c62","resolution":{"observed_at":"2026-08-08T12:46:12.814744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.800681Z","title":"Multi-task corrupted prediction for learning robust audio-visual speech representation","venue":null,"work_id":"9ff1bb00-b662-4a15-96c9-4b6822b4ad59","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.115892Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:24891cab34ca2897618a7cf7bf7eb0c5fc716ff55c700783e14a041c712279b1","observation_id":"eb92f129-9c51-4e93-9443-b911ae612b24","resolution":{"observed_at":"2026-08-08T12:46:12.804393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:46:12.119735Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.119735Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0509d5e1ac159171ab629f523b115c1152e69d01ec6f2b21ee83cc2ae735a278","observation_id":"e50f65bf-d38b-4a7a-95f0-414b568881b1","resolution":{"observed_at":"2026-08-08T12:46:12.119735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.790602Z","title":"Moai: Mixture of all intelligence for large language and vision models","venue":null,"work_id":"0fb1ad58-e12a-4155-adb5-6fb87654d75b","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.123375Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:dfec2a175a67ed8d6faa2a5d1c93e2445a3a86ea73cc26b9bf6d31deeb3f4b42","observation_id":"9d557243-3fe3-4ea7-a398-006108a0781c","resolution":{"observed_at":"2026-08-08T12:46:12.794162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.779411Z","title":"\\ GS \\ hard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"ae0bdc10-c414-4fdc-aa71-76cfd3b091b0","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.127007Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:15a692ef37a35fd2fca523d3b9382fef5249b8f8d9b945d2a94a98618a9d0795","observation_id":"ba99a6f1-d267-4102-9903-c77f037e8c06","resolution":{"observed_at":"2026-08-08T12:46:12.783255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.769127Z","title":"Unified cross-modal attention: Robust audio-visual speech recognition and beyond","venue":null,"work_id":"abbb2e0f-5175-413f-8829-f61421fa1446","year":1941},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.130698Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:a1ffa3fef8bf6b8ba576ed85e0d090721d2df5413f3c365cbf81df03002b2e27","observation_id":"3ad298ad-4c4a-4eb7-b2e3-256862aa31fd","resolution":{"observed_at":"2026-08-08T12:46:12.772919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.758454Z","title":"Pace: Unified multi-modal dialogue pre-training with progressive and compositional experts","venue":null,"work_id":"ca9da1cc-1616-4972-a0c0-91e96e5195b8","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.134232Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0da4d174a5816e1c069d8004bbcd0c340d8195a6a895d842d5a1737947d83bf5","observation_id":"982ffbce-c590-48c5-981d-0ec2a7725ecf","resolution":{"observed_at":"2026-08-08T12:46:12.762175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11273","last_updated":"2024-05-18T12:16:01Z","snapshot_observed_at":"2026-08-03T11:46:26.153374Z","submitted_at":"2024-05-18T12:16:01Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11273","snapshot_observed_at":"2026-08-08T12:46:12.137924Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.137924Z"},"links":{"cited_paper":"/paper/2405.11273","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:f87d768dec7c2a742ce97e93cc01a2cb5c96e4f5ed43c9ce28ec11af50078a67","observation_id":"7ee4fd34-f493-45cf-93ec-be559e2e05e9","resolution":{"observed_at":"2026-08-08T12:46:12.137924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.747102Z","title":"Av-data2vec: Self-supervised learning of audio-visual speech representations with contextualized target representations","venue":null,"work_id":"4159aee6-7a34-4deb-b0c4-e8e4ab389009","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.141733Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:668c24746c6efc1e6ed7efc7e3a240c67696f689457452b05c8516c2036bb8cc","observation_id":"2e1e6b9f-0e75-4527-98d2-32b203226ecd","resolution":{"observed_at":"2026-08-08T12:46:12.750980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-08T12:46:12.145504Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.145504Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0ef90be324ea6b8979a7d6c8f9b49191a65886d6db582932e7c813035826b4af","observation_id":"4d5394ea-e862-476a-9d68-7db199733b31","resolution":{"observed_at":"2026-08-08T12:46:12.145504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.736879Z","title":"W., and Pantic, M","venue":null,"work_id":"d85a7e63-6142-4a38-a3dc-9ba8d1a233fd","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.149611Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:22d90e4a6d51778c007839232142ad5566b88a5b2670cf9cf176ecb4796a125c","observation_id":"76554e89-2cc7-415b-9f11-c51a54917429","resolution":{"observed_at":"2026-08-08T12:46:12.740438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.726150Z","title":"End-to-end audio-visual speech recognition with conformers","venue":null,"work_id":"53194c80-d777-45dd-acbd-f20828e21144","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.153350Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c6cc2fa9071bb6c3a05140fe2f6d0f752fb0464d2f9d04af3ef0de34cbe32b3a","observation_id":"decb22d6-5180-42cb-b35a-4c68ea23fd0b","resolution":{"observed_at":"2026-08-08T12:46:12.730261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.715060Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":"425af32e-3e00-4664-9aac-54b4ba8e1ca6","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.156880Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:cb63153bfe3a9a9b3845fe40ba71abe281299f762cebff5adc9f98631f870e07","observation_id":"b6e30b98-4524-45fd-ba64-55921ab1de61","resolution":{"observed_at":"2026-08-08T12:46:12.719069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.704126Z","title":"Recurrent neural network transducer for audio-visual speech recognition","venue":null,"work_id":"f461c1ff-9f53-4c2b-b1d1-26faaca1f5e0","year":2019},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.160528Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:fda478d40cb54f8363813b34037f274236f793d474c8dcf5619fef318620efde","observation_id":"7a4dd371-89e0-49d0-8b75-82ee9dfb957c","resolution":{"observed_at":"2026-08-08T12:46:12.707947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.693081Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":"175f7534-e7da-48ad-be26-f8e3a1788eec","year":2025},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.164169Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d69b8e8e4cbd270c03ca977e8d1a83c21d82a2e0b23378e5473c5e6b26b61021","observation_id":"40f518dc-ba49-4251-969c-5dbce41495e0","resolution":{"observed_at":"2026-08-08T12:46:12.696792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.682308Z","title":"Multimodal contrastive learning with limoe: the language-image mixture of experts","venue":null,"work_id":"45777144-c50b-48fd-a706-be0ca53a96c7","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.167622Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:ff96c83fd96245bed9ba397cd74e94bbca202285465f925a2c6d4d6a45280cb8","observation_id":"736a4236-703c-4be2-8c3b-53dfb9d93e9c","resolution":{"observed_at":"2026-08-08T12:46:12.686160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.672089Z","title":"G., and Ogata, T","venue":null,"work_id":"a7cc28c9-10eb-4616-b997-7ec82de8d138","year":2015},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.171272Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:08d03a31eb97e086755f1b805b267e8baeb9464170b024c230fb0e75396e0e2b","observation_id":"262ab514-50ef-47a2-abb3-201a5b8f83c8","resolution":{"observed_at":"2026-08-08T12:46:12.675558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.661378Z","title":"Leveraging unimodal self-supervised learning for multimodal audio-visual speech recognition","venue":null,"work_id":"70573e34-a2df-47b6-b22a-24acd21d076c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.174871Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:c8a64b74d0dcbcdf167814e9ac89081b71a689cd5b1cf7cefe2e3ecb678dcbab","observation_id":"a554eb4e-ae2a-4261-95fa-43ec6a0329ce","resolution":{"observed_at":"2026-08-08T12:46:12.665127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.179726Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.179726Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:282d01bd1d6cc4386ebe72bb929e50e7c237b686795adcdbdbbb800de4b28c95","observation_id":"3a623aaa-0e13-431f-8564-fb3387ff6617","resolution":{"observed_at":"2026-08-08T12:46:12.179726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.645017Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":"e7c40e3c-ba6e-4ed6-81d3-8c140d6a51be","year":2018},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.183249Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:156f57a461056e2d6e947153d8a5e982431d5a123c75c1c9aef41fa3432ecdfb","observation_id":"7c91ae05-3531-44c0-99b7-4a1e6ee84503","resolution":{"observed_at":"2026-08-08T12:46:12.648936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.634688Z","title":"Lipsound2: Self-supervised pre-training for lip-to-speech reconstruction and lip reading","venue":null,"work_id":"bf482a2d-7d9a-4b47-b720-ca5ad4e9848a","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.186969Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:3be95d8f3151135af9911cb36636746aed238a9a276e1a5eddbd57417ea44234","observation_id":"faf4f2ff-e926-49b8-9ebe-e85bfd014e25","resolution":{"observed_at":"2026-08-08T12:46:12.638468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.190741Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.190741Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:2299960a97c451038f51c60767d82fe38cecccc559fa0c007d1fc196a06cf73a","observation_id":"1b11b7af-4db4-4e2b-92e6-e9953ef6fad7","resolution":{"observed_at":"2026-08-08T12:46:12.190741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.618392Z","title":"Learning from the master: Distilling cross-modal advanced knowledge for lip reading","venue":null,"work_id":"cb7233c8-b9d8-4ad3-a7b6-1013d433501f","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.194385Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:50bfb85e39298255bb9784d82a47c124c62ff617ce1940ff4cccacb59cafc62f","observation_id":"9e558eeb-03d6-4dde-9b12-1e0885aa2506","resolution":{"observed_at":"2026-08-08T12:46:12.622031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.607839Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":"0c5e8f5f-17dd-46f1-be73-567124897a72","year":2019},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.197809Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:05b86f50eccea31457a17f0cdba465f5a89d453454456a572b71500581d940db","observation_id":"e5f9b8f4-3539-49df-ba88-92dbcfee486b","resolution":{"observed_at":"2026-08-08T12:46:12.611683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.596869Z","title":"H., Nagrani, A., and Schmid, C","venue":null,"work_id":"26ca37fa-47b3-498b-9da8-3ace837b860d","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.201418Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:9973b43a30a2321cd1ad5f23108a841ad0aa88d254012a713a92805f5d7503df","observation_id":"e6fe91de-707b-404d-b25d-68d2f3a1f931","resolution":{"observed_at":"2026-08-08T12:46:12.600769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.586067Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"0629b808-8efb-4e86-b4c4-db5b2afbd493","year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.204937Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:857794d3ae30e30a3d1aaa5aa5988dabc86ffdbfae69bca3a2c0e0d216060ddc","observation_id":"93c99fbf-3002-4c1e-bd85-c855be4c7cd0","resolution":{"observed_at":"2026-08-08T12:46:12.589682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.575572Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"b8fdb693-23f7-4dbb-8bca-43cf70944b22","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.208750Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d8e8d173d731ddaa293cc7cd2ea8acf2c1b7e37f5e79c38e89dde8edf8256352","observation_id":"698d2898-de93-452b-a09a-31664d927a91","resolution":{"observed_at":"2026-08-08T12:46:12.579332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.563085Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction","venue":null,"work_id":"8a2b637d-3e4c-421e-aaef-149e9f0d27cb","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.212277Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:5c831d0f2562dce4462a687fd78b2bcf6eaece142760d56a88cccf0d5a4b276f","observation_id":"761244b3-694b-40ea-b43e-498b303e25b9","resolution":{"observed_at":"2026-08-08T12:46:12.567388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.552649Z","title":"Robust self-supervised audio-visual speech recognition","venue":null,"work_id":"42850ad5-6f79-4686-8263-d96f0370d66e","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.215914Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:0cbbb8c8560bc8f2ee310d2f9440c3c85d2e612b6b65a1937451d58b7f300e5d","observation_id":"6455672e-f8dc-4faa-beec-aee8ca7f209d","resolution":{"observed_at":"2026-08-08T12:46:12.556400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-08T12:46:12.219928Z","title":"Musan: A music, speech, and noise corpus","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.219928Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:8fc71638f096d345708d5111126b7cefa4a74e41d69ae06b6b75d7156cfa75e5","observation_id":"e469726c-a996-4160-b4cf-4052afa9dfe9","resolution":{"observed_at":"2026-08-08T12:46:12.219928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.223984Z","title":"The diverse environments multi-channel acoustic noise database (demand): A database of multichannel environmental noise recordings","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.223984Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:dd6d25f075e8ec19227384b5bed62916cc86e894c4270718b011c334ab501cfb","observation_id":"ea26ca4a-a117-4a82-87d1-9e3eb8a279eb","resolution":{"observed_at":"2026-08-08T12:46:12.223984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.227915Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.227915Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d95f02bbe176eb6c56e783f522e6b017dcf26f23621edbc6f2509e0bb0eb6c8d","observation_id":"70e6dd0a-b44f-498d-b5c3-5266d235f667","resolution":{"observed_at":"2026-08-08T12:46:12.227915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.530637Z","title":"T., and Li, H","venue":null,"work_id":"179d2738-77c9-4e6a-b90a-b94c49c01127","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.231696Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:42ba9bf30809cec13e547b3c7616898a0d22a9ed630dba596c22722085b533e5","observation_id":"683256ca-aa77-47d4-9a5f-4f8c754714e0","resolution":{"observed_at":"2026-08-08T12:46:12.534091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.520395Z","title":"Language-routing mixture of experts for multilingual and code-switching speech recognition","venue":null,"work_id":"0bc287d8-ad31-4f41-bb91-5b161573fcb1","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.235459Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:add29ba91df4adbffbe33e773d62a8b8fff29aa42bf5850fbfabfcd0be3413c1","observation_id":"1e95febc-e8b0-4589-b53d-916f1e2398be","resolution":{"observed_at":"2026-08-08T12:46:12.524068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.510167Z","title":"R., and Hayashi, T","venue":null,"work_id":"b0f59742-c4c9-4daf-a924-3783450ba091","year":2017},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.239453Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:a92ba00b8eabb69dcbdb4ab28c37eab66c7a98cbd7f0359bd40145159b85adf2","observation_id":"555f1a1d-5da3-4299-9a20-b307e07dc4fe","resolution":{"observed_at":"2026-08-08T12:46:12.513677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.500112Z","title":"Robust audiovisual speech recognition models with mixture-of-experts","venue":null,"work_id":"45e05cd7-0ff8-4273-b703-560d6d70b9b7","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.243307Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:147459a6e2b65a01cc651454fd3d34759f464d1b420a6d061a7b5cd9de88deec","observation_id":"962a535d-9a14-443b-9c67-34f771193ca1","resolution":{"observed_at":"2026-08-08T12:46:12.503834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.486561Z","title":"Speechmoe: Scaling to large acoustic models with dynamic routing mixture of experts","venue":null,"work_id":"55029c6b-5162-45c9-81f1-de47c92c0b5e","year":2021},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.246899Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:beaba0aca5a3c386625fc70482f9ed51d95a8ffe13f36ece1f2e376ae5159802","observation_id":"3584682c-30ff-4622-9c96-728984916f11","resolution":{"observed_at":"2026-08-08T12:46:12.492396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.472877Z","title":"Speechmoe2: Mixture-of-experts model with improved routing","venue":null,"work_id":"56f037e2-a013-4664-ad08-8f9818561aff","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.250437Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:82e2c66ed442a093e4a46028fdae6e352bf120db5c70826abfd30c52c70bcadb","observation_id":"d8f1c0d4-9dd2-4fcb-81c8-501a463e55d6","resolution":{"observed_at":"2026-08-08T12:46:12.477707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.460686Z","title":"Visual hallucination elevates speech recognition","venue":null,"work_id":"b6e4adab-29d1-443a-96de-30cdfd0cb92e","year":2024},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.253960Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:948313ee88a2f78e75cdd83a17a0e4e253c946a3ee2acfc686bab5cfe1d8f724","observation_id":"08b33f54-e9a5-4b79-b0ed-562a83643f94","resolution":{"observed_at":"2026-08-08T12:46:12.464533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.448870Z","title":"Self-supervised audio-visual speech representations learning by multimodal self-distillation","venue":null,"work_id":"28c340d5-9c3d-4615-b32f-261309a40667","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.257656Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:2395e676c5098503d462c78bc595e3ae5a3285a8fb4aa09a5399d36a78b84e64","observation_id":"5b13026c-fa99-4c0d-970f-b9f68f4aff78","resolution":{"observed_at":"2026-08-08T12:46:12.453215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.435144Z","title":"Uni-perceiver-moe: Learning sparse generalist models with conditional moes","venue":null,"work_id":"50bcfac2-156b-4a78-8eb1-38a7372e295c","year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.261199Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:6542523385478b798666dcd148a75d6322002026b657618fcd02d5c93adda86b","observation_id":"3515f5d7-0b53-4273-bafd-96cd12610c8b","resolution":{"observed_at":"2026-08-08T12:46:12.440286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:46:12.417656Z","title":"Vatlm: Visual-audio-text pre-training with unified masked prediction for speech representation learning","venue":null,"work_id":"74907657-5bf6-4dc8-940b-6d79088635b5","year":2023},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.264765Z"},"links":{"citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:a1d9f86572c033ee0ef4215117eaf08bc5706c505fb3c3520e7fedbb8ff3bc18","observation_id":"0a2625e8-12f8-4dad-8059-86cde6accefa","resolution":{"observed_at":"2026-08-08T12:46:12.425112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-08T12:46:12.269019Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T12:46:12.269019Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.10447"},"observation_digest":"sha256:d6dc5c91be047e02fefa60e2e5f1d103511c257e2493d8832de1d4c3c157770f","observation_id":"b3cea8a1-ca54-4a16-b6fc-d1420e753587","resolution":{"observed_at":"2026-08-08T12:46:12.269019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10447","last_updated":"2025-05-21T04:07:33Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T12:38:43.832047Z","submitted_at":"2025-02-11T11:01:05Z","title":"MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 1 inbound Pith citation observation for arXiv:2502.10447."}