{"as_of":"2026-08-18T21:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee809ff2e249ded89d6ab5422092e35ab5f6920252153f43e84629d93365b394","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:02:14.805352Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03186/citation-record","integrity":"/paper/2505.03186/integrity","json":"/paper/2505.03186/citation-record.json","paper":"/paper/2505.03186"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.575052Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.575052Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:cb55411311915c18e8a9fdcd21f2fd6680af33c88bb5e842f76ba2d016d681f0","observation_id":"3ac9d1eb-96a8-49c5-b3b3-662a4e4126b6","resolution":{"observed_at":"2026-08-16T00:02:14.575052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-16T00:02:14.581161Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.581161Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:6e6744471f35285fab48d0f49eae7af8855cf41e9cf90318a8c676c8646e98cb","observation_id":"626beae2-331e-40c3-8d07-f7e07c6f1686","resolution":{"observed_at":"2026-08-16T00:02:14.581161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.586465Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.586465Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:d7d159e76dabce7feeae51d00a2c6e510ecae7893f12a6b75ca667a94a7b11d0","observation_id":"bbf19573-56c2-41df-8141-8454e2d90440","resolution":{"observed_at":"2026-08-16T00:02:14.586465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.592073Z","title":"Qwen2-audio technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.592073Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:fd5261b02c55f6f34f4492d9d3d9306988def9ddb14636e437dd16352973abb7","observation_id":"89ee59dd-884d-426b-9b54-0dce5284d186","resolution":{"observed_at":"2026-08-16T00:02:14.592073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.597519Z","title":"Assessment for automatic speech recognition: Ii","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.597519Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:a8b48688dd91723f64f936ba50253517fdef63088f74775088085312c73d7602","observation_id":"b8ae44e0-4685-4a19-88e0-25d0f1ebae40","resolution":{"observed_at":"2026-08-16T00:02:14.597519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.490417Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":"4d6acda2-927d-456d-88f9-08ccf8873408","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.602336Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:4035244847dbe0f904a751c366276636c9f1e88b1fe9c1f018d7c7d552dc0611","observation_id":"18e863d1-c7b0-4231-a73e-1fa10e3e797f","resolution":{"observed_at":"2026-08-16T00:02:15.495059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"cited_work":{"arxiv_id":"2502.01547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01547","snapshot_observed_at":"2026-08-16T00:02:14.902604Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","venue":"eess.AS","work_id":"26b85104-1fc9-4c5b-94d9-c738cd2e6630","year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.608210Z"},"links":{"cited_paper":"/paper/2502.01547","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:f5f317a27d7518355f3220013201051a3b4502bcd6e054ed5dcec5146ac5e4ed","observation_id":"31658b4e-5454-4c42-a0c0-c56795cce0fb","resolution":{"observed_at":"2026-08-16T00:02:14.909462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.474737Z","title":"Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception, 2024","venue":null,"work_id":"8cf29956-de67-4810-aaf4-bef130889d02","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.613614Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:85eff0f38e46ad662a7057e438059b7246eb362f0aa2fe17a90e94f17c7194c7","observation_id":"69e8cff1-ce87-47ee-8f48-4bf620f51cb2","resolution":{"observed_at":"2026-08-16T00:02:15.480421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-16T17:30:04.943064Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-16T00:02:14.618734Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.618734Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:d6c5d7b080ad29e99c94aae18b7a5bd9f72725a4a540c61b8da3f310575464cf","observation_id":"a5ea468d-4a1f-4257-a40e-c9b49796ebc2","resolution":{"observed_at":"2026-08-16T00:02:14.618734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.459662Z","title":"Unified speech recognition: A single model for auditory, visual, and audiovisual inputs, 2024","venue":null,"work_id":"8ea277ad-f46d-483d-8cca-fe267fcf686d","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.623425Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:b3fc84fee1f9498381bdb153ffa7eea4d4abdcc54efadbac25a90b6d3ca45c3f","observation_id":"99d9da77-5ffd-4467-b0f9-98f8463fde04","resolution":{"observed_at":"2026-08-16T00:02:15.464167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.444513Z","title":"Speech recognition models are strong lip- readers","venue":null,"work_id":"865edd0d-3aa8-434d-b88c-dcf1bd9b93ac","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.627623Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:8a1396f0d69d1cfefc439e6dadb176bbd545a740ad2e01b9e26ec97e8c89ed98","observation_id":"4ee4a0e4-4941-4724-95f9-13f75958055a","resolution":{"observed_at":"2026-08-16T00:02:15.449473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-18T20:12:22.627950Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-08-16T00:02:14.631987Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.631987Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:4decb15a1c51acb0179fd64d059ed3e532d10cdcb06212e4d253a0c63a0e5842","observation_id":"14646b13-963a-4262-9c08-d723ac268e36","resolution":{"observed_at":"2026-08-16T00:02:14.631987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.429739Z","title":"van de Ven, Nicholas Soures, and Dhireesha Kudithipudi","venue":null,"work_id":"7c6f399c-1441-4cdb-abfb-3d2e9fc0ef40","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.636993Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:dbb16c02fcfc66efcac9320fcf8c94e95bfdf27a43c0d35ad435b2b601a40ad9","observation_id":"5ea2047c-6fb3-401f-8059-8d4a7f85e7d0","resolution":{"observed_at":"2026-08-16T00:02:15.434451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.415343Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"6e7363fd-0fa8-4c26-8913-34189273250e","year":2017},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.641960Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:0419999532a2b665072aaa2f8f25c54e84ed4172eb545627bdf99265f98c35f6","observation_id":"6d79bc66-5e5f-44d1-b6b7-8df976f3894d","resolution":{"observed_at":"2026-08-16T00:02:15.420078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.401033Z","title":"Maas: Multi-modal assignation for active speaker detection","venue":null,"work_id":"581a1c64-563f-4c23-9c5d-7231c0b04c5c","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.646482Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:3dba46ee7bc9c4ef2ff6eda4b723b98bdcf5089e5aa0708316ba53c8ed6b60cb","observation_id":"9f2bd975-770e-4681-b5fb-98a978667072","resolution":{"observed_at":"2026-08-16T00:02:15.405666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.650794Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.650794Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:916c3206055fd5266aa0708b5606febdc7993ec2e9fbc004405d365e8fb9de28","observation_id":"4e685917-7581-4da2-b044-28ecc04cadc3","resolution":{"observed_at":"2026-08-16T00:02:14.650794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.655093Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.655093Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7e53e14e7fa1fc4c506ab7b4f456174ad8853d24a97076f3c594d2f877bf907f","observation_id":"40a0b99c-cd91-4b60-a5a3-64a0b827c765","resolution":{"observed_at":"2026-08-16T00:02:14.655093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-16T20:23:00.161927Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-16T00:02:14.659428Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.659428Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:bd4146cc97918dbafbcf8afeb07da5d1b4544668bad646d57875ff4da055a9ef","observation_id":"9faab5e2-a5a3-4722-84e2-dac9fc254347","resolution":{"observed_at":"2026-08-16T00:02:14.659428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.366409Z","title":"Asr is all you need: cross-modal distillation for lip reading, 2020","venue":null,"work_id":"88bca7cf-be53-4cc7-bd93-8773df9274e4","year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.663974Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7d4bca274fcb0a469c3b714e50fc6b1721f42354f9144de291482451fd78aae3","observation_id":"ae52f234-c1ae-4b5f-a74d-31bc48f3a648","resolution":{"observed_at":"2026-08-16T00:02:15.371184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.352480Z","title":"Schuller, and Maja Pantic","venue":null,"work_id":"37c7193c-bc4d-4b79-8154-30cdb32aa6be","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.668210Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:649f20c8561cacb7151d9dcd9a1e3afa7e5ada4a22f3ce7e3ffcf4299063a53b","observation_id":"1108b9bb-53f2-4992-a221-18a83f7e9e60","resolution":{"observed_at":"2026-08-16T00:02:15.356605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.338009Z","title":"u-hubert: Unified mixed-modal speech pretraining and zero-shot transfer to unlabeled modality, 2022","venue":null,"work_id":"c0cc2a2a-84b6-4126-9309-d0d13a245858","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.672686Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:d27e147f43eb4fcbf568bbeab14978647c8299270f6a98b87b19deadb818dea2","observation_id":"92fc2400-5d70-4ad9-91dc-86d271b22ca8","resolution":{"observed_at":"2026-08-16T00:02:15.342794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.323801Z","title":"Av-data2vec: Self-supervised learning of audio-visual speech representations with contextualized target representations, 2024","venue":null,"work_id":"76f53588-cdbe-4b11-acbf-fb6976e3df94","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.676961Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:97a226add85a54f19b83e052a080017c6fd91579f8e3f4861cffc3bba5a32687","observation_id":"56b24ef1-c4cc-49f2-b99a-859acfff1e0a","resolution":{"observed_at":"2026-08-16T00:02:15.328435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.308365Z","title":"Vatlm: Visual-audio-text pre-training with unified masked prediction for speech representation learning","venue":null,"work_id":"78296285-f995-4c4e-8beb-d1c46cbe9ba3","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.681001Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:050dc7828846c3cc94b556a05e0a28c5016dcaf2fe296452bacd8ebf0e561546","observation_id":"9ea9bd24-eaa7-4d29-802c-09159655c654","resolution":{"observed_at":"2026-08-16T00:02:15.314319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.685115Z","title":"Conformer: Convolution-augmented transformer for speech recognition, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.685115Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:359f79cf1b6861d49acbc91c63ca4b6e70bff89aff49d53ed614cb3e71e17ad5","observation_id":"38f8b3c4-a53a-4c7c-bd27-8c4eca718d53","resolution":{"observed_at":"2026-08-16T00:02:14.685115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.283943Z","title":"Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer","venue":null,"work_id":"b26d8ecb-4c2f-4105-a2f2-6b6e21935e1c","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.690215Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:8781657f9b8120a80d6ca76c073d67be6fd7feffcbeaa07a730c9226a66ba1c6","observation_id":"87103140-2d4c-47aa-a9fa-5dfd522edce5","resolution":{"observed_at":"2026-08-16T00:02:15.288628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.695123Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.695123Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c88a8f92374bacd49ae9e7e7b3c8ebff6163a99976eb75fd33e393d163fd47de","observation_id":"f2c10cca-c52b-4b20-8197-d95c478c2fa3","resolution":{"observed_at":"2026-08-16T00:02:14.695123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-16T00:02:14.699358Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.699358Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:62be3fffbac572dcdd0976832df9c698508ce7d270209626f8f642c2c0fc9e8f","observation_id":"c6b12aa4-1e3a-49f9-98c3-f0fe336b05b8","resolution":{"observed_at":"2026-08-16T00:02:14.699358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.259166Z","title":"Braven: Improving self-supervised pre-training for visual and auditory speech recognition, 2024","venue":null,"work_id":"e54e5eba-dbdb-491c-ad4a-f285468b6ee3","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.703772Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:ec86646a692ae3084d305da88cf10df2a39f9718610a98692c61f99de546a65c","observation_id":"9f401350-0f5e-4d95-9617-f9bb28436777","resolution":{"observed_at":"2026-08-16T00:02:15.263968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.708017Z","title":"Large language models are strong audio-visual speech recognition learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.708017Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7cf849e0932ddfa2d48ef1e840d4a98790bfcab55322986d48a7e9301fe63385","observation_id":"7e0f453d-368b-4502-bfa2-bcdfc91b8238","resolution":{"observed_at":"2026-08-16T00:02:14.708017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.234024Z","title":"Visualvoice: Audio-visual speech separation with cross-modal consistency, 2021","venue":null,"work_id":"123af017-3e26-498d-a21d-97ad6f39da6c","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.712253Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:71110ea5861a1d69d7d2b1e9c3777515de2405a0b2757ac8ee6ca4904e05f6d8","observation_id":"a4c61101-e1e3-4c65-bfe4-7ef2d5ad22b7","resolution":{"observed_at":"2026-08-16T00:02:15.238909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.219230Z","title":"Ctcnet: A cnn- transformer cooperation network for face image super-resolution","venue":null,"work_id":"af38eb37-4f52-4254-9979-7fff7af67965","year":1978},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.716572Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c9fb5584e67279f0122f2c9910c9fba0be61deeb262e6094ff7d3886d9521299","observation_id":"b9740d49-4e6c-4702-b84c-f0d4c86339d1","resolution":{"observed_at":"2026-08-16T00:02:15.224269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.204035Z","title":"Muse: Multi-modal target speaker extraction with visual cues, 2021","venue":null,"work_id":"eed9284f-d52f-448c-9b9b-4c1717696e8b","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.720990Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:61cbf8f83a4c4466e33dbaff5d3ea0a429dfbc198168f66f136be157aef5c66c","observation_id":"5127e6c6-1d23-4421-ad8e-df41f411260e","resolution":{"observed_at":"2026-08-16T00:02:15.209791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.189187Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction, 2023","venue":null,"work_id":"1a4bcb14-4bef-4743-8b30-415257c2c35e","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.725497Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:e664684da357ed2a9f47d0e2c081178131290419869b375b3121b2ec069e5890","observation_id":"4de8b763-bce7-4c53-9f63-e2b381b24b73","resolution":{"observed_at":"2026-08-16T00:02:15.193757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.174497Z","title":"Attention is all you need in speech separation, 2021","venue":null,"work_id":"fd084dbc-8de8-4ce9-96b1-6c377b13f9ea","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.729752Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:bcc75191e599e3fbdbae666201afde6f84795efb1318f6114b40f2ea09b244e9","observation_id":"86797946-3f20-476d-9058-dc0a29b65927","resolution":{"observed_at":"2026-08-16T00:02:15.179881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.158145Z","title":"Separate in the speech chain: Cross-modal conditional audio-visual target speech extraction, 2024","venue":null,"work_id":"01f296d2-689a-4e84-bfb3-a8690da82b94","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.734164Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:1f168004685c07150a283bbf78f511a6bdd3fdcb21e5244955bd3f216e6c39e5","observation_id":"2306f3dc-d4e5-4afd-b244-0d46e6daa9c1","resolution":{"observed_at":"2026-08-16T00:02:15.163493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.142604Z","title":"A light weight model for active speaker detection, 2023","venue":null,"work_id":"c56771b6-bbb5-4ae4-9ea2-113c152a8ef0","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.738490Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c7e040abb91ef6c67267ceb477b51bcc0e23fd33bc33b818415931ef251eb7ae","observation_id":"42cc8e8e-7598-4613-b881-5b0a41f0a44a","resolution":{"observed_at":"2026-08-16T00:02:15.147444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.128484Z","title":"End-to-end active speaker detection, 2022","venue":null,"work_id":"1c469adf-8ea1-492f-bf21-7cda6e6c46f6","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.743048Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:3f87280c42d2bec343710c3bde0d423ada4518318e58e4655774ae581d848aae","observation_id":"efdd07a1-4504-4b6e-9538-2dfe98b7b255","resolution":{"observed_at":"2026-08-16T00:02:15.132880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.113801Z","title":"Loconet: Long-short context network for active speaker detection, 2024","venue":null,"work_id":"653d41ff-ee9a-4fcf-911f-b18e83478c59","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.747136Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:abfbb6ed30e001a27a3d8d608f06d2e80f8fe8f2212740f3336f50128ad60b68","observation_id":"f4bdcfad-cf29-4f35-bd6d-5257cdf90f1f","resolution":{"observed_at":"2026-08-16T00:02:15.118510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.099467Z","title":"Lr-asd: Lightweight and robust network for active speaker detection","venue":null,"work_id":"ecd0dc01-4176-44b4-99ca-5c4894501ef2","year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.751398Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:0fee0fe257c03157d791c1d21556c8d03d9c649223d26d57421bf28a97bf0cef","observation_id":"961a5d6d-51b1-41b1-af05-564ebfbbf10b","resolution":{"observed_at":"2026-08-16T00:02:15.104097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.083846Z","title":"Tdn: Temporal difference networks for efficient action recognition, 2021","venue":null,"work_id":"2148bcf6-fabe-434a-be37-d4ab08798f6b","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.755649Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:44a78601be630636696f089c7c44c38e0a979867d16878559f3ba91cfc4bc603","observation_id":"ea3bdbd8-7c68-4200-a748-65a4d799d393","resolution":{"observed_at":"2026-08-16T00:02:15.089734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.759904Z","title":"Dauphin, Angela Fan, Michael Auli, and David Grangier","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.759904Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:565644d3090e7ce19d5ba778d062a9845b5a48c746f9138a3737b7831b84e85d","observation_id":"f3be7b5b-adc9-468b-9668-f40f52bc606d","resolution":{"observed_at":"2026-08-16T00:02:14.759904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.764101Z","title":"Musan: A music, speech, and noise corpus, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.764101Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:35de5ea5dc19ad5f15c1cc96272cb522b010b971971f4ca4305bc87e06e45f60","observation_id":"23630693-a3ce-4533-b4ae-8efd72aa2bd1","resolution":{"observed_at":"2026-08-16T00:02:14.764101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.768340Z","title":"Audio- visual speech recognition with a hybrid ctc/attention architecture, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.768340Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:2d61b815c710a51f56f4c48c7516d75f1ab2d003f87ae0a7578cca1f98a79574","observation_id":"04d071a2-fb16-4b7b-bb6d-b6a310bdfb8d","resolution":{"observed_at":"2026-08-16T00:02:14.768340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.041231Z","title":"Es3: Evolving self-supervised learning of robust audio-visual speech representations","venue":null,"work_id":"1c7788f1-40fc-42eb-a839-6653a2ca957d","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.772581Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:ff878dcd2f83d490f5acd886988492950cadb44ef587570fe6cd546ca288f7c2","observation_id":"c07be99f-6f8c-4ca5-b7a2-81137f33c9d7","resolution":{"observed_at":"2026-08-16T00:02:15.045641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.026882Z","title":"Syncvsr: Data-efficient visual speech recognition with end-to-end crossmodal audio token synchronization, 2024","venue":null,"work_id":"d2285411-8029-4670-b5fc-324e01a5c200","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.777319Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:abecdecc377c8730998a6bdd6e3b5b7c4c22f129765768db086f8226d9cacae4","observation_id":"73c5d417-7494-4daf-940f-cf1880addee0","resolution":{"observed_at":"2026-08-16T00:02:15.031534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.011498Z","title":"Sub-word level lip reading with visual attention, 2021","venue":null,"work_id":"0a18cdd0-57a3-46e8-b458-5d44e50e8e45","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.781608Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:99af0d418635038bfa0a59deb36446761b90ecb99241a1c8ed927fdea728190b","observation_id":"6d3df58b-f8ac-4d6b-a411-aca47a226325","resolution":{"observed_at":"2026-08-16T00:02:15.016589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.996194Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":"0bb0b36e-a76e-4ca3-b606-008c4648ca71","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.787191Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:a38b60c0c82987b2bb12e60eab14635236a79c6257f9526e059ba26238646a9e","observation_id":"d5b44847-8856-4c5c-98f2-8588f060171a","resolution":{"observed_at":"2026-08-16T00:02:15.000505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.982041Z","title":"Leveraging unimodal self-supervised learning for multimodal audio-visual speech recognition, 2022","venue":null,"work_id":"17300901-358a-4ac4-8e51-182766880e77","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.792140Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:e428656ffe1806756b151a9b9759854d7f57f2e9e82664cf91296804fe55cbfe","observation_id":"88998e02-a846-4a4b-80e2-f2dce41aa850","resolution":{"observed_at":"2026-08-16T00:02:14.986821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.967326Z","title":"Audio-visual efficient conformer for robust speech recognition, 2023","venue":null,"work_id":"d300da62-1b74-47d0-a63a-cb5fa8482b31","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.796585Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:ccc4797900f048ff20f5c03df04cb3902a1393e0fc95b29c57d4cdca39c2b836","observation_id":"d474d59e-b104-4927-8778-875557e3b091","resolution":{"observed_at":"2026-08-16T00:02:14.972183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.952926Z","title":"Audio-visual speech enhancement and separation by utilizing multi-modal self-supervised embeddings, 2023","venue":null,"work_id":"762bbd5c-0891-463b-a950-b075ffb73f3e","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.801054Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:a040bbb6f2e7a374fbef0765768927f10313dcc40bb88b411c0351a55145cb9a","observation_id":"d8750052-a914-4197-980a-68f7e040c139","resolution":{"observed_at":"2026-08-16T00:02:14.957484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.937794Z","title":"Time domain audio visual speech separation, 2019","venue":null,"work_id":"32959086-ef50-4188-8d52-a0b9177a7665","year":2019},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.805352Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:0fce74e0f09e2b4b42227524375af70ddca8146f89864c52c318c17461fb2231","observation_id":"1412804f-e3a4-46f8-be06-6b245d5192ae","resolution":{"observed_at":"2026-08-16T00:02:14.942609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T10:29:35.011085Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2505.03186."}