{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6560266a142cf825a3d43cc5081e7920560267b03b2eda63ecf34d68012bc22e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:05.021485Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:00.946933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T08:09:51.394586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T15:43:00.946933Z","title":"These sce- narios present considerable challenges due to adverse acoustic conditions, including far-field audio, background noise, and re- verberation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:00.946933Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:2ee9f63cce7d8dccd5506a59786b83946da32fc270810f886350a357c431afd7","observation_id":"d516a4d6-1b5c-43fa-bd6f-344aae0d6d84","resolution":{"observed_at":"2026-08-07T15:43:00.946933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T13:23:26.572189Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22013","last_updated":"2025-05-28T06:22:37Z","snapshot_observed_at":"2026-08-08T10:18:11.060579Z","submitted_at":"2025-05-28T06:22:37Z","title":"Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:26.572189Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.22013"},"observation_digest":"sha256:15375c7a12016cc935a01fb47271234e0cdc708b3207194cbe3a386ad312b830","observation_id":"02c18a0e-adb3-4d68-9574-028150db69db","resolution":{"observed_at":"2026-08-07T13:23:26.572189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T00:21:56.777201Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.777201Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:1d2899272b405ee31ec59d9a0e76216454eb128357bf7c130327ccf2cafc6ff3","observation_id":"dca6c443-3407-4b0b-92fb-977eb884cbde","resolution":{"observed_at":"2026-08-07T00:21:56.777201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":"2505.13971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition","venue":null,"work_id":"744345ac-0d40-4730-b6ea-9aa162e52f81","year":2025},"citing_paper":{"arxiv_id":"2604.13073","last_updated":"2026-03-20T17:25:00Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T17:25:00Z","title":"OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T08:06:45.477344Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2604.13073"},"observation_digest":"sha256:0d96401fe7de7af55b9e8b217f99927534607dbdf254b3471a290501cc1621b2","observation_id":"06774b7d-55b1-42a7-abae-e6f845a405cf","resolution":{"observed_at":"2026-05-15T08:09:51.398870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":"2505.13971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition","venue":null,"work_id":"744345ac-0d40-4730-b6ea-9aa162e52f81","year":2025},"citing_paper":{"arxiv_id":"2604.22467","last_updated":"2026-04-24T11:43:25Z","snapshot_observed_at":"2026-07-31T06:13:14.722604Z","submitted_at":"2026-04-24T11:43:25Z","title":"DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:53.285951Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2604.22467"},"observation_digest":"sha256:183d09e5e156da01d6964b01c456e97f224f38ca460cddd89d4a3d7aed9454ca","observation_id":"038ca04a-f233-43de-a3f7-8b08fa5f8d8a","resolution":{"observed_at":"2026-05-11T20:21:12.615570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-01T13:06:07.806541Z","title":"The multimodal information based speech Tsinghua University | 14 processing (misp) 2025 challenge: Audio-visual diarization and recognition.arXiv preprint arXiv:2505.13971, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19235","last_updated":"2026-07-21T16:05:49Z","snapshot_observed_at":"2026-08-10T01:07:17.341811Z","submitted_at":"2026-07-21T16:05:49Z","title":"MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:06:07.806541Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2607.19235"},"observation_digest":"sha256:3d67b3d82d5f31ec5c1eb76d728b9a8bdb6d57aa688b6f69565591b34f902b9e","observation_id":"38be85af-3c4d-473d-960a-35da92a73616","resolution":{"observed_at":"2026-08-01T13:06:07.806541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13971/citation-record","integrity":"/paper/2505.13971/integrity","json":"/paper/2505.13971/citation-record.json","paper":"/paper/2505.13971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T15:43:00.946933Z","title":"These sce- narios present considerable challenges due to adverse acoustic conditions, including far-field audio, background noise, and re- verberation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:00.946933Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:2ee9f63cce7d8dccd5506a59786b83946da32fc270810f886350a357c431afd7","observation_id":"d516a4d6-1b5c-43fa-bd6f-344aae0d6d84","resolution":{"observed_at":"2026-08-07T15:43:00.946933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.308173Z","title":"Statics The MISP-Meeting dataset[10] comprises a total of 125 hours of synchronized audio and video data, meticulously curated to reflect real-world meeting scenarios","venue":null,"work_id":"08b0925f-912e-4ef0-8907-6098cb1546ea","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.015198Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f22c764af642d11aa1864b71de92d458636f0c2b23e2d28bbe359a7712367795","observation_id":"d182b9a8-a55d-4e53-a58c-b0807a475f2c","resolution":{"observed_at":"2026-08-07T15:43:10.405861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.081253Z","title":"who spoke when","venue":null,"work_id":"4c1fb640-923a-4bb7-afce-b1c262108e22","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.131980Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:7ae08c63968c3d60974c37d7914969151c893777a12758dbf06ffc8eb5f7b52b","observation_id":"4617894b-5ab6-4b5d-b4c4-abceef6f4b8f","resolution":{"observed_at":"2026-08-07T15:43:10.171540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.892807Z","title":null,"venue":null,"work_id":"508107ec-91c3-42dd-a5a5-dd3a49a9ae4d","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.253337Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:3438b91b49e3bb8af62e8df16be5434c32fd4af1396fbb1e8385649a37c93b6d","observation_id":"63d2ca25-9035-4f8f-9644-6e043c78bd31","resolution":{"observed_at":"2026-08-07T15:43:10.001010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.709535Z","title":"(2), whereNspk is the total number of speakers in the session","venue":null,"work_id":"50bc5b65-eb04-412c-b5ce-96dba78968a6","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.356018Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:e87d3ff1f74e322b23e3496e0241b6251ff6becc366fea5caceeb45f3e9f61db","observation_id":"af8c5e2b-7ce1-461d-9630-7081a33c5d9e","resolution":{"observed_at":"2026-08-07T15:43:09.796298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.412181Z","title":null,"venue":null,"work_id":"5bc903ee-46cc-4d6f-9a68-40339a413598","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.496388Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:944a3e705920cb5f2d66b5f49a51b5d2577a9e8d78997f069bf2c3fc644b69c2","observation_id":"fd03b07a-e841-49f1-965a-560307c032da","resolution":{"observed_at":"2026-08-07T15:43:09.545159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.212190Z","title":"A VSD Table 2 presents a summary of the methods and results for Track 1 (Audio-Visual Speaker Diarization) in the MISP 2025 Challenge","venue":null,"work_id":"1d12cc91-95be-4fb2-8e30-8ff0ab10cded","year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.616838Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:4ba699932895bf23de29ebd37649c847772d6a8f957c2ac88ef6631dcb4beb0c","observation_id":"fabb067c-e0b7-4de2-9160-4bc51668a496","resolution":{"observed_at":"2026-08-07T15:43:09.281598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.972503Z","title":null,"venue":null,"work_id":"79c4ad7b-920d-4a9f-858c-022adc0d3485","year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.738485Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:cad8c6cb9474a510cfeedb2bde6244942ae8540a01e6c60d384b004ada131791","observation_id":"095c7367-1392-4e02-a4bd-1df23564b5f2","resolution":{"observed_at":"2026-08-07T15:43:09.111934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.729275Z","title":"The chil audiovisual corpus for lecture and meeting analysis in- side smart rooms,","venue":null,"work_id":"32a78548-ba3a-49cb-a1d3-f64c0e6c46f2","year":2007},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.825645Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d1cfd944a404c1a6162a02531f3a5231a9e93ca7d06a7d68d858c04d51116e40","observation_id":"1ee43906-d77d-4382-a9c1-11056bb6132d","resolution":{"observed_at":"2026-08-07T15:43:08.828947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.538077Z","title":"M2met: The icassp 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":"4cd51c66-7873-4721-a3e4-4e3a242f6df5","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.970675Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:276d0276af3cd38c423d723c236f6830cc68254a5d7723dabc39ad902f8670c3","observation_id":"94b03a91-ce32-48d7-8791-45fde30cb4a5","resolution":{"observed_at":"2026-08-07T15:43:08.634867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-08-07T15:43:02.079339Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.079339Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:eb21bb6a1c94ca1a24bbdfec8a15988ff97465fae31a1e68f0653085e222b856","observation_id":"474dda51-9528-4bbb-86e4-476a84c651c5","resolution":{"observed_at":"2026-08-07T15:43:02.079339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.307695Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":"12ee6e3f-845a-472b-9393-5def4fde70ae","year":2020},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.211446Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f7f4503b4277fd4e1584b43a17777bef4c084e4758a1f8bb48898c99925a7bd7","observation_id":"24dda821-8acf-4170-af19-ffb35fec1c65","resolution":{"observed_at":"2026-08-07T15:43:08.436561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.305820Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.305820Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d8d94eac0bdeed563fed676c4b68f7e3309d513019f505b054d61bde5f1d0551","observation_id":"e9c3e128-15c4-4b6e-ac08-f377e39382e2","resolution":{"observed_at":"2026-08-07T15:43:02.305820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.068572Z","title":"CHiME-6 Chal- lenge: Tackling Multispeaker Speech Recognition for Unseg- mented Recordings,","venue":null,"work_id":"e73ee50f-e19a-4d34-a3e9-bc013b8859b3","year":2020},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.459989Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:18f1d89ef1a5b30b43aee2f34845db9f44a5963bc0325ce57e5eaa3013a8cdeb","observation_id":"ef7adc73-dd1c-4ab8-b3d1-cf8b99dd345f","resolution":{"observed_at":"2026-08-07T15:43:08.186566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.865595Z","title":"The first multimodal information based speech processing (misp) chal- lenge: Data, tasks, baselines and results,","venue":null,"work_id":"9fb2f5c2-8c66-4d08-9290-8a7b42bdf337","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.614902Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:c542634fa105c5bc7e60135756e6752684402361d535023720c6837c4de8f9f1","observation_id":"5b477c2d-8e4a-450f-bd4f-280b2da4535e","resolution":{"observed_at":"2026-08-07T15:43:07.989009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.797124Z","title":"The mul- timodal information based speech processing (misp) 2022 chal- lenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.797124Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:956ac790647fc735664e5c3cbbea1322d22916137f470c6a6c7a7e7b4d8513a5","observation_id":"bea85d7f-dd75-41a5-bfda-ee982ef8a884","resolution":{"observed_at":"2026-08-07T15:43:02.797124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.663246Z","title":"The multimodal information based speech processing (misp) 2023 challenge: Audio-visual target speaker extraction,","venue":null,"work_id":"148e2062-410c-4063-8b2b-e13631a8d2ae","year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.876803Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:6fce45091be68d0a6ce4155f9695beb8fe3c94b632c3d0e58d1f7bc7ff95db6a","observation_id":"9c480d17-e3da-41ee-96c7-d54cb0103dbc","resolution":{"observed_at":"2026-08-07T15:43:07.764255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.014747Z","title":"MISP-Meeting: A real-world dataset with multimodal cues for long-form meeting transcription and summarization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.014747Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:319ef311bf75148fd56d9d7c927dd89ea39ca9914813c28441acd2e795dc116c","observation_id":"c4e4131e-df16-4fd3-abab-13d0adc854ab","resolution":{"observed_at":"2026-08-07T15:43:03.014747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.399354Z","title":"End-to-end audio-visual neural speaker diarization,","venue":null,"work_id":"b5211a14-5c29-466f-b3b0-bc930feb5226","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.076635Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d392e9586d503e34c29aa8885e0d44622f37854914f33101115ceb4906f195ef","observation_id":"b75b325c-4bf8-4d38-a95a-702aac5698b2","resolution":{"observed_at":"2026-08-07T15:43:07.550360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T15:43:03.146074Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.146074Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d12d05a614ef1862ce7084482e2fb5c95ce516fc8b18e553274a4268afa1f81d","observation_id":"75b3023e-f670-4324-8b08-aae5b29f9a25","resolution":{"observed_at":"2026-08-07T15:43:03.146074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.211149Z","title":"Dover-lap: A method for com- bining overlap-aware diarization outputs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.211149Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:471a8aca3eb0f9f94c55787749700d835d2533e61c8354819f2a25a405f005c0","observation_id":"26e1751a-a452-4788-af8f-6fa7d246e9df","resolution":{"observed_at":"2026-08-07T15:43:03.211149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.052574Z","title":"The rich transcription 2006 spring meeting recognition evaluation,","venue":null,"work_id":"19d65133-90e2-4f50-bd32-a0badcb029ac","year":2006},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.345208Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:97238c9f187a144b262ea390af2137eb65e390695b12d977bb62bf76e9f8216d","observation_id":"5d52c1c3-c08a-496c-be86-9f1f01c3556f","resolution":{"observed_at":"2026-08-07T15:43:07.172677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.848100Z","title":"Improving audio-visual speech recognition by lip-subword correlation based visual pre-training and cross-modal fusion encoder,","venue":null,"work_id":"b2cc708d-c51a-4fcc-93d4-5b3ee47ab936","year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.405144Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:c9f5f19bde148c58e68796d558d297b5e9ab70936be434482aa9b67209d3e960","observation_id":"d7c11625-c882-412a-bdda-0e38ad429a5e","resolution":{"observed_at":"2026-08-07T15:43:06.921969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05271","last_updated":"2023-08-13T18:30:43Z","snapshot_observed_at":"2026-08-02T11:59:18.040781Z","submitted_at":"2022-12-10T11:20:17Z","title":"GPU-accelerated Guided Source Separation for Meeting Transcription","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05271","snapshot_observed_at":"2026-08-07T15:43:03.476909Z","title":"Gpu-accelerated guided source separation for meeting transcription,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.476909Z"},"links":{"cited_paper":"/paper/2212.05271","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:1637540752795348dc4598b74535e85bccbd76480c1a746012223f662405f777","observation_id":"0458f9e8-8c9c-4667-956e-6af705fe8edf","resolution":{"observed_at":"2026-08-07T15:43:03.476909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.421462Z","title":"The multimodal information based speech processing (misp) 2022 challenge: Audio-visual di- arization and recognition,","venue":null,"work_id":"7f1eb7ba-9886-4deb-a8aa-8debf7e8e3e0","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.600303Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:83b5b4e37e399227bb216d1f296153673cb3de1260b55c72a0d6358a0201ac14","observation_id":"92676c42-0012-47ee-9ef8-aa8e151969eb","resolution":{"observed_at":"2026-08-07T15:43:06.650135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11510","last_updated":"2024-07-16T08:49:30Z","snapshot_observed_at":"2026-08-10T05:15:02.578871Z","submitted_at":"2024-07-16T08:49:30Z","title":"VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11510","snapshot_observed_at":"2026-08-07T15:43:03.767045Z","title":"V oxblink2: A 100k+ speaker recognition corpus and the open-set speaker-identification benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.767045Z"},"links":{"cited_paper":"/paper/2407.11510","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:fbc6521a49d1ed80af8c9d68ba2c55f29f4bc11b482731f2424d0af1194fabea","observation_id":"90723b50-6955-4e15-aa8a-5229bc7d5a0b","resolution":{"observed_at":"2026-08-07T15:43:03.767045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T15:43:03.878807Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.878807Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:00010ee5e9b10ef9a9de1c38d9ed0a1114d4f4e99d1260fab257fab60f3b579f","observation_id":"dc3d2ccd-9969-41dc-ac57-55fd0e06b23b","resolution":{"observed_at":"2026-08-07T15:43:03.878807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.226433Z","title":"Kespeech: An open source speech dataset of mandarin and its eight subdialects,","venue":null,"work_id":"e0d7c885-f97a-4d1d-bc28-bfc920108a7d","year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.938904Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:99cd217d1ee8eafb82b40dd8898b83bba90189deeb36a0e584f11ddc140b5207","observation_id":"c7e3d097-71db-4f79-bc87-2ea03ec6a50e","resolution":{"observed_at":"2026-08-07T15:43:06.293656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:43:04.029122Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.029122Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:68fa1b172f69e9b80c3bdf4abf0af7d9fbd29882d679835992f2785ae05c5301","observation_id":"5ad194ca-b72e-4f4d-9468-e213687d7f26","resolution":{"observed_at":"2026-08-07T15:43:04.029122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T15:43:04.140000Z","title":"Ecapa- tdnn: Emphasized channel attention, propagation and ag- gregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.140000Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:43e9286f5f778484a5127ef90c6acb0bed1ac48e25467a52bf9c352e0e88d94a","observation_id":"2fbc7da8-9942-4d95-b08a-e464e0796a9c","resolution":{"observed_at":"2026-08-07T15:43:04.140000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.219246Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.219246Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:36488aa6f3596c9f7d6fba4042d6bb4eedf437605d7169b974403856a178203d","observation_id":"f9b28de0-ed4d-4341-9501-1ae12bebade2","resolution":{"observed_at":"2026-08-07T15:43:04.219246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.308158Z","title":"The ami meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.308158Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:db97988dd2bc76059ad55c5bd8f6df58468e68502ce1e2ea35763f3f0e6c2187","observation_id":"498eb297-5d96-4a18-9d4f-b1523a25db7b","resolution":{"observed_at":"2026-08-07T15:43:04.308158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.390574Z","title":"Lip-reading with densely connected temporal convolutional networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.390574Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:9a7a5bc129629db6fcdbdfb429d6583e71d17676e0d30396798790d2dc0dd575","observation_id":"49055ca4-5d30-4e6b-b90e-6adb66cce4ce","resolution":{"observed_at":"2026-08-07T15:43:04.390574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.485577Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.485577Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:08f425d36ad80adb3eeffedca6e10a30f74ad997cbbb4389d5f65cf58d0f3ee8","observation_id":"ca19d67a-28fd-4b16-9564-edaf8e684aaf","resolution":{"observed_at":"2026-08-07T15:43:04.485577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.617021Z","title":"Wenetspeech: A 10000+ hours multi- domain mandarin corpus for speech recognition,","venue":null,"work_id":"f4d17a4b-074a-49c1-8c93-251a29a70ff8","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.559893Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:9999b40e0766edb9387ddbdfbebfaca694251dacc20150a0eb072e232faa1b61","observation_id":"6dbbfdd8-4a91-4c43-be47-b2a52ce12a48","resolution":{"observed_at":"2026-08-07T15:43:05.746106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13849","last_updated":"2025-06-21T06:43:49Z","snapshot_observed_at":"2026-07-06T19:53:34.670694Z","submitted_at":"2024-11-21T05:15:46Z","title":"Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13849","snapshot_observed_at":"2026-08-07T15:43:04.678989Z","title":"Sequence-to-sequence neural di- arization with automatic speaker detection and representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.678989Z"},"links":{"cited_paper":"/paper/2411.13849","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:3c6a716621036d372b9360f02b441d68de1f0bdff1e8b612680b27cbbead25a1","observation_id":"a70e8cee-0bec-4546-b2c3-3b0c3e71d1fc","resolution":{"observed_at":"2026-08-07T15:43:04.678989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.846296Z","title":"Mossformer2: Com- bining transformer and rnn-free recurrent network for enhanced time-domain monaural speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.846296Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:b19b3f1ad96050ef14c138f17d27420403bc3db6c92d09697dd7271261d5fa79","observation_id":"909b7d81-34cb-44bd-b0dd-6df558509c42","resolution":{"observed_at":"2026-08-07T15:43:04.846296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T15:43:04.928529Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.928529Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f6da884a68c31a90e3e6e87c7bb17f64ed082a2434143cd3f7ccf5619aa7efbe","observation_id":"1494347b-02b1-43d7-9318-d5ff6fcb3771","resolution":{"observed_at":"2026-08-07T15:43:04.928529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.450556Z","title":"Generalization of multi-channel linear prediction methods for blind mimo impulse response short- ening,","venue":null,"work_id":"15be806a-36e3-4a3b-8429-ed73d8c2f4fb","year":2012},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.021485Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:07a0c1a1766095fdd5b8cda9d91f3ba56c7abaf4e9774fba93e9cc2bf2fbb479","observation_id":"fc4ac28f-13cd-4e27-8b80-0d5abb96a892","resolution":{"observed_at":"2026-08-07T15:43:05.514736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T17:17:58.199455Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 6 inbound Pith citation observations for arXiv:2505.13971."}