{"as_of":"2026-08-09T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da86084766439bc567756be41c9802c6aca76c1fa8566c36642fe57f7070f22b","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:27:40.454155Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:27:36.490653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:27:40.969156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"cited_work":{"arxiv_id":"2506.02010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02010","snapshot_observed_at":"2026-08-07T13:27:40.969156Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","venue":"cs.CV","work_id":"2b032588-a961-4729-b518-38baaf663deb","year":2025},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.490653Z"},"links":{"cited_paper":"/paper/2506.02010","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:05d742943a797e1581b95459491dff158f5ded4a6086c4c1bed1c86495282b50","observation_id":"a3b042f7-8900-48d6-83c4-5fc5ae016983","resolution":{"observed_at":"2026-08-07T13:27:41.073670Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02010/citation-record","integrity":"/paper/2506.02010/integrity","json":"/paper/2506.02010/citation-record.json","paper":"/paper/2506.02010"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:44.089495Z","title":"It has a wide range of applications, including public surveillance, assistive technologies for the elderly and disabled, and deepfake detection [1, 2, 3, 4]","venue":null,"work_id":"ae3bf31d-35a3-410e-a1d6-c4d655296d49","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.413924Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:96664825c8b3ebfd06dfc96b533158c9100da67f456ce0e482643edc6983781d","observation_id":"fda6371e-075d-4fb3-adb7-9d3ea01c725a","resolution":{"observed_at":"2026-08-07T13:27:44.147053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"cited_work":{"arxiv_id":"2506.02010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02010","snapshot_observed_at":"2026-08-07T13:27:40.969156Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","venue":"cs.CV","work_id":"2b032588-a961-4729-b518-38baaf663deb","year":2025},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.490653Z"},"links":{"cited_paper":"/paper/2506.02010","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:05d742943a797e1581b95459491dff158f5ded4a6086c4c1bed1c86495282b50","observation_id":"a3b042f7-8900-48d6-83c4-5fc5ae016983","resolution":{"observed_at":"2026-08-07T13:27:41.073670Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.994505Z","title":"Only the datasets provided by the organizer (except CN-CVS2-P1) were used, meaning these systems conform to the specifications of the fixed tracks","venue":null,"work_id":"c630e204-af1d-4f66-bee2-7b422a801d4e","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.632246Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:c4e031b5e67e11d117fa375e74b0644d61be68254b6bfe7db69039342e1c9113","observation_id":"f843ad0b-c733-4bc6-862c-60d3b9f46bb7","resolution":{"observed_at":"2026-08-07T13:27:44.024046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.859246Z","title":"Leaderboard CNVSRC 2024 received 10 valid submissions from 4 partic- ipating teams","venue":null,"work_id":"070929b7-e298-4b4a-9f67-edb466bc0360","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.773554Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:1c9c6a4047db080c020fe90f242adb8ce30a3f05b559e52b01a29c97cea377bb","observation_id":"30707a7b-0fd7-42d9-af6c-74858ab97264","resolution":{"observed_at":"2026-08-07T13:27:43.903289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.747022Z","title":"Compared to CNVSRC 2023, this year’s challenge introduced a stronger baseline system and more train- ing data, further pushing the boundary of the Chinese VSR re- search","venue":null,"work_id":"8ee44cd2-f005-4f87-a41c-c4aa93ad2d0c","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.944767Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:b387adc947340403d03b43ce2c73beec7111ea73a060844011c0ba68e78eacad","observation_id":"5fb3bf5f-ddad-4d51-9338-a0433d5cd07f","resolution":{"observed_at":"2026-08-07T13:27:43.792158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.664688Z","title":"Continuous automatic speech recognition by lipreading,","venue":null,"work_id":"0ab8528e-bc35-4d8d-a413-06ce4384efbe","year":1997},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.128609Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:2eb18c60ae8ca8eaec9bc895e776090d102be12b7552176d19d34e6c45846fde","observation_id":"c5017300-b00c-4e2c-99a6-dd278052e56c","resolution":{"observed_at":"2026-08-07T13:27:43.695099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.548425Z","title":"Audiovisual in- tegration and lipreading abilities of older adults with normal and impaired hearing,","venue":null,"work_id":"340d6295-afea-4684-bce1-d7f70f430b13","year":2007},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.223945Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:7e45de7988cb29c12e676f7490efd8c2e45262037700cc37bc7f682fe2a602dc","observation_id":"f9cf8b01-8b5d-4b2d-83f9-2c98d77e67a1","resolution":{"observed_at":"2026-08-07T13:27:43.595194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.412382Z","title":"Visual speech recognition,","venue":null,"work_id":"e58280a8-d322-4e43-955e-5a9238e99cc4","year":2011},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.357567Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:91cb739f70ff4ca1586d8d95bf6043165933ab9e9dd0d8be7cc52c7a171f9fe3","observation_id":"5a6aaf80-45cb-4f37-8e1c-42f4e45acbf3","resolution":{"observed_at":"2026-08-07T13:27:43.475169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.305436Z","title":"Lips don’t lie: A generalisable and robust approach to face forgery de- tection,","venue":null,"work_id":"28651f6f-0207-4412-b097-0f2642cd2129","year":2021},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.668986Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:d1b106d77b0399406b737a69f6752bbe1ad9075bf4b6fbaf19d2b1cdb002abab","observation_id":"66e2d2ab-a4cc-4201-808e-59ec2e8064c0","resolution":{"observed_at":"2026-08-07T13:27:43.343003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.193681Z","title":"Multi-temporal lip-audio mem- ory for visual speech recognition,","venue":null,"work_id":"d0231455-3ca8-4987-a9a5-332622e3aeae","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.779002Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:a1499aa4457cd073d69667c25df1f2b45aff13efee48875140921c141dcbf0e2","observation_id":"0771309a-cb55-46b1-b735-c0998c3b75da","resolution":{"observed_at":"2026-08-07T13:27:43.256867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.079849Z","title":"Training strategies for improved lip-reading,","venue":null,"work_id":"8f24a4e0-163d-4d7e-829f-f21f40234ce9","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.980122Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:c989296e80401ea6528ca234949c060b25ed9c00ded4f5fa3580f250d00d3f2a","observation_id":"eb247147-f0c0-40af-809b-7177c2c2a238","resolution":{"observed_at":"2026-08-07T13:27:43.132493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.966010Z","title":"Improved word-level lipreading with temporal shrinkage net- work and netvlad,","venue":null,"work_id":"44c4e92a-5f99-4e3c-9aa2-e239ad69b183","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.084984Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:4b75dbe9c30d5ed9f2616bedb3ab50ff973d05377e9c188f0173b10cf0326018","observation_id":"3a57cf48-7c06-4bc4-befc-6542638ad6eb","resolution":{"observed_at":"2026-08-07T13:27:42.998784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.819620Z","title":"Lip reading in the wild,","venue":null,"work_id":"819a2007-4a99-4e01-97fe-d2ebd234cc07","year":2016},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.154993Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:225c7c715fdf3292c98139f7051071f8f3e9e38db1fdf73a93dd46d5b097fb9a","observation_id":"4b513915-71d9-4851-a7f9-1fe39af6d2bc","resolution":{"observed_at":"2026-08-07T13:27:42.890849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.648193Z","title":"Distinguishing homophenes using multi-head visual-audio memory for lip reading,","venue":null,"work_id":"efaa5cd0-b078-4471-9119-df1777bdd546","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.279161Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:02dd1850fe619e1f48f61a91dc5c8226eeb80e6e935f6f41c2e5426499ce3b91","observation_id":"e229cbb6-0806-4b61-8cc1-2d1ab0bb774d","resolution":{"observed_at":"2026-08-07T13:27:42.722388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.565406Z","title":"Con- former is all you need for visual speech recognition,","venue":null,"work_id":"d7e74cad-c77a-4d76-9e35-c00cc58344b1","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.442327Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:38edc9344cf717e03cc707eed006c071a98d8c5db0b4446d55561e6ed2c843ee","observation_id":"985977bb-f6b5-4ce5-b964-7ebfee1af6e3","resolution":{"observed_at":"2026-08-07T13:27:42.589227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.429146Z","title":"Transformer-based video front-ends for audio-visual speech recognition for single and multi-person video,","venue":null,"work_id":"b9796218-2532-4e9a-aa74-603f445b0b64","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.568923Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:83a05ce12c5749e592be9b2e16d92e38831d78a14e11a3079f137e7a2101fd15","observation_id":"e420793d-60d1-4414-aae1-661a39e7a4bb","resolution":{"observed_at":"2026-08-07T13:27:42.498752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.296298Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"29613000-9464-4593-8323-a99989599406","year":null},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.652240Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:e2d6344c0687635a0ced94d52a4dfe990cfa429d3d33424e4ef7764ac2c2637d","observation_id":"94c24405-4f8b-42b2-817b-60d0e28d3fa6","resolution":{"observed_at":"2026-08-07T13:27:42.332358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.181521Z","title":"Large- scale visual speech recognition,","venue":null,"work_id":"e990421f-bb05-4928-8cce-2d5ef93b49bd","year":2019},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.746781Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:243327c946f205280029dfd18e1f892da05b144c4a1563fff62fc1e2bbabc613","observation_id":"6848ec7b-2331-461b-977e-dc6118a1b3ab","resolution":{"observed_at":"2026-08-07T13:27:42.232738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:38.926626Z","title":"CN-CVS: A Mandarin audio-visual dataset for large vocabulary continuous visual to speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.926626Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:77f7bb89f3c3eea10de98ab04d17e4b596058228a7992d0096fb5dcbe4f782e3","observation_id":"5b476e5a-bca0-4c11-a926-9c355cce20c5","resolution":{"observed_at":"2026-08-07T13:27:38.926626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.067394Z","title":"CNVSRC 2023: The first Chinese continuous visual speech recognition challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.067394Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:45f2b0004a191952c4c787e60b1fcc25718601feb26bc1db8019b3c0a7229688","observation_id":"c96b4a5f-65aa-4a04-a5a3-3b378c422c58","resolution":{"observed_at":"2026-08-07T13:27:39.067394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.196049Z","title":"Auto-A VSR: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.196049Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:60cbeb91e61e18740becc314e490f39ddc09a8f65c5ebf1ed390f70a0d2706ea","observation_id":"441450db-b638-4ff9-9ccf-aef6ab8b39b3","resolution":{"observed_at":"2026-08-07T13:27:39.196049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.974008Z","title":"Combining residual net- works with LSTMs for lipreading,","venue":null,"work_id":"3660066e-fd48-4440-9c01-d3052cb7cdea","year":2017},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.306895Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:de5319a875a821663c67ab7db6376cedf6a7077cc3116457dd5c698d9f42759b","observation_id":"9c7dae19-31c9-48ca-a07d-0498567da775","resolution":{"observed_at":"2026-08-07T13:27:42.007264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.866461Z","title":"Conformer: Convolution- augmented Transformer for speech recognition,","venue":null,"work_id":"79c78e3f-6a47-4518-ae62-47b6967bcbda","year":2020},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.459580Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:e35b66286a33c112a945e3b80a66bb1480ad832212d994c3966ce3a06f3f8086","observation_id":"0e823916-b9a7-484e-a6eb-b64bff230d3a","resolution":{"observed_at":"2026-08-07T13:27:41.933622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05642","last_updated":"2021-12-30T00:30:30Z","snapshot_observed_at":"2026-08-04T06:59:25.324887Z","submitted_at":"2021-06-10T10:25:15Z","title":"U2++: Unified Two-pass Bidirectional End-to-end Model for Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05642","snapshot_observed_at":"2026-08-07T13:27:39.557934Z","title":"U2++: Unified two-pass bidirectional end-to-end model for speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.557934Z"},"links":{"cited_paper":"/paper/2106.05642","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:40538d9e04a85f30fa8343b4b9c721e02c94f65c34a34b4823798171b89a8ee5","observation_id":"bca2496f-9d7d-4ddf-a2db-5482e500e49c","resolution":{"observed_at":"2026-08-07T13:27:39.557934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.696060Z","title":"Hybrid CTC/attention architecture for end-to-end speech recog- nition,","venue":null,"work_id":"23db29d5-49a0-415a-942d-b46d01e35966","year":2017},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.605038Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:96ae84322b024ac5542094e406e3371b48f4206d43ac000eb7066874098ab28a","observation_id":"ef902514-bf8b-4420-a6dd-a04e86ea551b","resolution":{"observed_at":"2026-08-07T13:27:41.756204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.713009Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.713009Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:64a2cae02e71bc7726bd4a73c603dd0ea3f6af1b4b8da86f65037e70d9e213d1","observation_id":"0f4f77f8-5a28-4924-87eb-2008d50784f4","resolution":{"observed_at":"2026-08-07T13:27:39.713009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06788","last_updated":"2024-02-29T18:09:40Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-07T14:20:52Z","title":"The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023","version":2},"cited_work":{"arxiv_id":"2401.06788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06788","snapshot_observed_at":"2026-08-07T13:27:40.803705Z","title":"The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023","venue":"eess.AS","work_id":"d47b4b75-e4dc-42a8-83a9-5ff50e84cf97","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.818617Z"},"links":{"cited_paper":"/paper/2401.06788","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:ec1440e3c2ffdc9517f6b1a4f33cf14b462df196310160ef12aa2d72f74eadd0","observation_id":"a5bf7075-b950-486b-80cf-522ce7a6d128","resolution":{"observed_at":"2026-08-07T13:27:40.861015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05466","last_updated":"2024-04-30T15:51:21Z","snapshot_observed_at":"2026-08-09T00:24:30.536682Z","submitted_at":"2024-04-08T12:44:24Z","title":"Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder","version":2},"cited_work":{"arxiv_id":"2404.05466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05466","snapshot_observed_at":"2026-08-07T13:27:40.588688Z","title":"Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder","venue":"cs.CV","work_id":"960ff852-e945-4655-ad64-154efc8e34bb","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.946392Z"},"links":{"cited_paper":"/paper/2404.05466","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:0e569eaa887c3197757c54354ab9fe9cfddc64e33d1d94bea581481832cd97e7","observation_id":"6cc3c219-c584-4851-8351-61266178b0ae","resolution":{"observed_at":"2026-08-07T13:27:40.664659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.587179Z","title":"MFA-Conformer: Multi-scale feature aggregation con- former for automatic speaker verification,","venue":null,"work_id":"cd4c4cd5-e00b-4c20-b9f2-4d01f557e830","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.033514Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:ec2927c634e9eb1f9ea61879fc5eab404d5b09b73bbfe4b5d1130d1550462b6e","observation_id":"d31570dc-6315-4b16-acd0-3d3ada9e8347","resolution":{"observed_at":"2026-08-07T13:27:41.634481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.463720Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"52a2a987-f47b-4541-b537-939cf756b5fc","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.116643Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:461f58d8271792f475e7670400ccdb416f67a3575d7c2b7b1d2830e80afede06","observation_id":"fa9fc0d0-9019-4c28-a595-97d2619e49b4","resolution":{"observed_at":"2026-08-07T13:27:41.517395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.295831Z","title":"On the parameteriza- tion and initialization of diagonal state space models,","venue":null,"work_id":"f8051830-95c7-4038-8db9-b95783f50167","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.195906Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:b0e849e6703984f6ebb158b966d19fb8f0fa62e49059deb92e57d334b537ebab","observation_id":"c46b5728-56da-48b4-8703-1a5bd6c84083","resolution":{"observed_at":"2026-08-07T13:27:41.369324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:40.303807Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.303807Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:1084f9263811747de7a3c81ac3b8ef41cfe0355bbeb8771848c126ccc162a685","observation_id":"36c4d22b-d6a3-493b-bc27-872796eede46","resolution":{"observed_at":"2026-08-07T13:27:40.303807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.161737Z","title":"Structured state space decoder for speech recognition and synthesis,","venue":null,"work_id":"f028a8a9-c758-4c48-a427-b948720dc9af","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.378661Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:a63979a30e6ec10f5eb100c4ad5e81a4c4ec5e54cbb5735989830367d516fa1b","observation_id":"d61e479e-4ab6-4efc-9321-ba1431695fe7","resolution":{"observed_at":"2026-08-07T13:27:41.219409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:40.454155Z","title":"A post-processing system to yield reduced word er- ror rates: Recognizer output voting error reduction (rover),","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.454155Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:28daa6b82975ac25ae7bac39e0ff581c232fded688091a5a910cb9e9adac23d1","observation_id":"7ab920f7-31a7-4d42-b745-6fa6e13e518a","resolution":{"observed_at":"2026-08-07T13:27:40.454155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2506.02010."}