{"as_of":"2026-08-10T21:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c59d61bdd3fe645b2a036b777336539c0a5f34bf3a83239055f1b36b42e178e","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:30.416983Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12972/citation-record","integrity":"/paper/2507.12972/integrity","json":"/paper/2507.12972/citation-record.json","paper":"/paper/2507.12972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.679221Z","title":null,"venue":null,"work_id":"34b3b39c-fe1c-4ac8-8523-c692aa29e44f","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.292465Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:441424a2f69f55e4c93d9f1168249e6fe4d13e0ee70d1dcaac26af48b83bc403","observation_id":"13db9811-5019-4320-bacd-715bcdb928b9","resolution":{"observed_at":"2026-08-06T16:39:42.808432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.423884Z","title":null,"venue":null,"work_id":"a7b57e05-0b76-4dca-ab04-7d571aa835b4","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.422134Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:32ca650697a5a9a97543a3111497de7c403001e112ec6ef896feef48b1382f94","observation_id":"4c4bd378-f56a-4b3c-8d08-4b78d5210fe0","resolution":{"observed_at":"2026-08-06T16:39:42.486362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.236715Z","title":"Chandrakala, S","venue":null,"work_id":"78069662-8ab0-4344-b6b7-1b445e9268b5","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.565716Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e032465b3e94b565588dbed2555bfa1ff0102615bb70aaa72a2dbe19d3c97c04","observation_id":"b481f230-b287-4cec-adfa-bae3222df5de","resolution":{"observed_at":"2026-08-06T16:39:42.315057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.095672Z","title":null,"venue":null,"work_id":"d7867e86-ce1d-4403-b222-3a79a9ffe49c","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.694830Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:7922a2fb5de1085e5d6919fd04f126e95da9128bccba237c6404d2feb322d25e","observation_id":"c24eb212-5f7b-42c4-bb0f-117a35d7dc06","resolution":{"observed_at":"2026-08-06T16:39:42.161682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.922555Z","title":null,"venue":null,"work_id":"2f709bae-c01f-473e-b8b9-70ae129aa3a1","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.832403Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:1be673def6e961a01cf44f8c59387dcaa05e34d0bf580fd83963e38edcc1c21f","observation_id":"a812640c-9f7d-411a-9514-7edbffc8ce41","resolution":{"observed_at":"2026-08-06T16:39:41.992774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.660077Z","title":null,"venue":null,"work_id":"d8822b43-aac5-4396-97ce-b289f4dbdf8f","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.969878Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d8327d78e4cb854b1416bbf83bc8ae1e5ce2092a5fce7a60cb4751b5300f4147","observation_id":"523d4da3-75c3-4ff8-8fb2-24808cd255d2","resolution":{"observed_at":"2026-08-06T16:39:41.807829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.489747Z","title":"Subakan, M","venue":null,"work_id":"cf5c7370-6191-4671-acec-d9de8f8294cc","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.112678Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:cd4241dc180f873263130a7a76eede05adbc1d234412dc1d84ac76d0186d83b9","observation_id":"a193ad77-88ae-46dc-b8b2-11d92b3d4ce2","resolution":{"observed_at":"2026-08-06T16:39:41.584746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.324830Z","title":null,"venue":null,"work_id":"547b5ee1-c730-4577-8e1e-91e5973f0031","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.236125Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d93b93db4f68d41b1af46e206f859911658bbdf18c4bd5c315c2f0cb744ba39b","observation_id":"0295f807-8ad9-4646-83be-4ec091bde6f5","resolution":{"observed_at":"2026-08-06T16:39:41.396084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.170752Z","title":"Subakan, M","venue":null,"work_id":"cb33eec6-7c48-4344-965e-35c575a0cbf2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.362454Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:bb60151521d9e066b57675877c993e4b36e23dad4a77215267fb04b1ff86b5bf","observation_id":"627fb8ec-95e4-4623-bd39-17cfc74c8349","resolution":{"observed_at":"2026-08-06T16:39:41.244947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23212","last_updated":"2025-06-02T05:22:31Z","snapshot_observed_at":"2026-08-07T12:48:33.153516Z","submitted_at":"2025-05-29T07:54:07Z","title":"Interspeech 2025 URGENT Speech Enhancement Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23212","snapshot_observed_at":"2026-08-06T16:39:24.509900Z","title":"Saijo, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.509900Z"},"links":{"cited_paper":"/paper/2505.23212","citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:9825ce5dca3ed084e10114de594e5e4f74a00d4467e5a52aab5ba30ee24b447b","observation_id":"d356d095-3c46-4204-af21-f40e91bee614","resolution":{"observed_at":"2026-08-06T16:39:24.509900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.888103Z","title":null,"venue":null,"work_id":"5eb63411-e86f-45c2-8dce-302d2b73a295","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.642132Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:5f593bbb71aaec7d55cb6f2e52d73e46b906bb58d3e6413dcacf9170d6ac29ba","observation_id":"26df92ea-9931-41d0-a738-e0d957c2654e","resolution":{"observed_at":"2026-08-06T16:39:40.983053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.744316Z","title":null,"venue":null,"work_id":"5651c30c-e4ae-4973-b4f4-0bc068bf66aa","year":2016},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.807794Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:0e80348c42df0d8d888aa920b4458c96b92a2592f553bd8672240f276f3409a2","observation_id":"d183db5e-05c7-4ea0-883f-214d28055f5d","resolution":{"observed_at":"2026-08-06T16:39:40.815330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.605880Z","title":null,"venue":null,"work_id":"1b90343e-4721-44bc-9294-8ee295e935db","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.960813Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:c64422e1a7681d57643289aa6bf2cae45650da2e20fb51bd1314d3814d57c1c8","observation_id":"4ed9b517-61ab-4d1b-9fba-2c188e1a1667","resolution":{"observed_at":"2026-08-06T16:39:40.665168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.477745Z","title":"Martel, J","venue":null,"work_id":"7c95615d-0645-40fa-9a85-51bf7cff8c9c","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.128777Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:58f58883de59d2e1053dfa0d17586963d93ecdd622bd4d63db6bc3b439da9df2","observation_id":"2a4a0964-70c1-4c00-8fba-2efe31cec9d0","resolution":{"observed_at":"2026-08-06T16:39:40.528451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.333625Z","title":null,"venue":null,"work_id":"e0213fc6-573d-4f64-90e8-6275fb0560d5","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.280041Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:fe16f662e09ea869ff4fddf8e2d7c7d78f777f74f4f9c953c5a514db4082d6c5","observation_id":"b9e4faef-a416-4992-b5d0-c325ec7ffb00","resolution":{"observed_at":"2026-08-06T16:39:40.397577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.200986Z","title":"Vasantha, B","venue":null,"work_id":"e1dcedfb-acee-4906-ba98-5c3a50bca9b3","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.482813Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:42429282b4d01d148a59f66845d4a8e50acd89f7be409b16b47d543395b543f7","observation_id":"7512a799-4c86-4996-bbcf-f446b8199daf","resolution":{"observed_at":"2026-08-06T16:39:40.266496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.055940Z","title":null,"venue":null,"work_id":"9812d7f0-1b07-4401-aeeb-2e6addeecc81","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.682663Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:ef1df8e2b84aa5f88aa46c560436f5a2534a1e8341c84578b5945cd62322533d","observation_id":"f5ac9de3-4e55-48cf-9c5d-97f45693efcb","resolution":{"observed_at":"2026-08-06T16:39:40.113315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.872073Z","title":"Nachmani, Y","venue":null,"work_id":"864f77bc-917e-4480-ac8c-9d34dff7902b","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.844324Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:88d6a7fd2a221c8d1c7028f99c5ef68e983123845d4cf18fc5124cbfcc0a884e","observation_id":"f7ecc4df-ff7c-4f41-b52d-5db362db1d8f","resolution":{"observed_at":"2026-08-06T16:39:39.960410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.652502Z","title":"Kinoshita, L","venue":null,"work_id":"5d7610c0-592b-4338-bab4-f40ad37637cd","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.941030Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:22d27bbdd48879adc553a04d8ff3480676f44a28722b7b5e4b90fae7c2781006","observation_id":"85c60829-c943-4c1a-9b36-4eaccf9bacd7","resolution":{"observed_at":"2026-08-06T16:39:39.775851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.396021Z","title":null,"venue":null,"work_id":"3fe8f1e3-639e-4232-a4cd-55ad1e67ebc5","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.087979Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:a08556e96fe80861d179ced394c7aaaf3077e06d0eaf2b3e3f5e214251c9df05","observation_id":"312f4232-3c17-4011-a33c-87537f049147","resolution":{"observed_at":"2026-08-06T16:39:39.520180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.205131Z","title":null,"venue":null,"work_id":"29a39dec-7979-4034-b8b3-1f2fffdd74c2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.286640Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:be77a74ae3b460c0dfcad170b4511cb0e98d7326e965f7f98130c22f11774290","observation_id":"a3b376fb-1cc7-4318-a5ad-710567894d89","resolution":{"observed_at":"2026-08-06T16:39:39.325696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.963035Z","title":"Takahashi, S","venue":null,"work_id":"10524892-fa09-4e03-b75f-0e5896a939cc","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.414258Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:bd3e76d00939bbe1aa8eaed566f61fbaa441ceda065762a51e7f18b4014e5cab","observation_id":"d4f5deb6-e3c1-4c78-b4d5-e9dba5c2e3dc","resolution":{"observed_at":"2026-08-06T16:39:39.091124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.688397Z","title":null,"venue":null,"work_id":"3d272184-1054-4242-9886-9e7b4fe750ce","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.513462Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d1f790e741dd72dfd64646de6879309d327132c4465a5e2932b8a2575ef21037","observation_id":"2d40a766-91a0-4bcc-be80-c21facb48983","resolution":{"observed_at":"2026-08-06T16:39:38.789085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.395211Z","title":"Maiti, Y","venue":null,"work_id":"3f158169-ad9d-49a8-a40d-0fccfa7eebe9","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.591126Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f9734bbfe0e342633fd098b68825fa5168e36b6f02c3b0fa3842491d4e084d07","observation_id":"e6222d8a-e207-44c9-bfc4-ed363d15e8b2","resolution":{"observed_at":"2026-08-06T16:39:38.549581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.104554Z","title":null,"venue":null,"work_id":"795d2a95-7eaa-437a-9b95-9a52b459dcbf","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.764311Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:faf62a4141da2b622fd6945bf7e083bccaa56ebf29058943eb146689dbb25d2c","observation_id":"722fd7fb-1513-4dc7-808f-730906f87e31","resolution":{"observed_at":"2026-08-06T16:39:38.254977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.864767Z","title":null,"venue":null,"work_id":"a406c945-409e-4667-82f8-39a6f8860ca0","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.950587Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e66f83afa4bfead70f161b92ff8935657afccbbb2572b29b8ac33b0908b98a34","observation_id":"51fe5d4b-3ce3-4696-9a61-9ab4f1e71b9e","resolution":{"observed_at":"2026-08-06T16:39:37.957518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.561349Z","title":null,"venue":null,"work_id":"02e0d95f-002c-4f60-81e1-3ac8664ca496","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.085101Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:a2c535f58dba72050adf596fd644ca4b3bac1946bb008ebfc946a75f9a402c5f","observation_id":"a2128611-1b83-46e1-a3bb-1b13fffe3fd3","resolution":{"observed_at":"2026-08-06T16:39:37.705890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.289559Z","title":null,"venue":null,"work_id":"65d8366a-a0a6-43e2-b4a6-1b71379fcea7","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.204907Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d11f74157a2dd21aecbfb2902277872403c472a1957360067fc13686fae9b19a","observation_id":"829d4c2a-aa41-4678-9d7d-988f4b347af8","resolution":{"observed_at":"2026-08-06T16:39:37.413831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.049732Z","title":null,"venue":null,"work_id":"1f6f1225-0b27-4ef1-a359-881ea2d4f77f","year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.366696Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d8180305f5b1029a3d88469cefde6fdb7e73965c015cfcd54517db72944d13b9","observation_id":"476d379b-e17b-4416-bb48-2c74ff1036af","resolution":{"observed_at":"2026-08-06T16:39:37.161955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.738121Z","title":null,"venue":null,"work_id":"d203b3e7-e750-480a-9b64-9ba6c6a16366","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.526114Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:b4fa898532f8e0679d142ea8976972d76af1e22cba2ab9c7b47c3d162e5695ee","observation_id":"1875d8f8-2e6d-4f8b-af5a-6291b53e01f6","resolution":{"observed_at":"2026-08-06T16:39:36.859971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.468470Z","title":null,"venue":null,"work_id":"21451382-3073-4e9d-b0d1-dae4a34030ae","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.633720Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e2e5cbcd03aa3a3398f761c6afb99a2d41593b2ad399f0eeafad562a9bca5a78","observation_id":"307158e5-d9f7-4351-abea-b75f5f5d27cb","resolution":{"observed_at":"2026-08-06T16:39:36.595850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.149547Z","title":null,"venue":null,"work_id":"538506c8-36ae-4a70-bdb9-e151ffeb08fd","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.791840Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:0c59f818fbe00c9e546ea33a063a4669c574295e1d099aa7075b7777ff2a006b","observation_id":"e637f8c9-ce16-4a64-b13f-1a8849168926","resolution":{"observed_at":"2026-08-06T16:39:36.304600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.822767Z","title":null,"venue":null,"work_id":"b8b59866-1724-4c27-8ccf-1b59db7aa187","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.938320Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:7f4aeea72689eef816c698bc4a6463adac8605ee8ee3e5c125947dba2c397738","observation_id":"746430cd-cee3-4f55-bdd0-fd91da99de33","resolution":{"observed_at":"2026-08-06T16:39:35.979750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.550904Z","title":"Gulati, J","venue":null,"work_id":"41245f11-505a-42fb-bf66-743418f8c949","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.053643Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:dbf3ffda93c5f0b65620fd3f2c70ba1dae66abe15ca03bd7562239f03c483efc","observation_id":"6cae72b4-2796-4489-ad49-d831a3482932","resolution":{"observed_at":"2026-08-06T16:39:35.678840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.217694Z","title":null,"venue":null,"work_id":"09819b0b-52ca-489e-a016-c35b676b1f66","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.176004Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:a74603a95c2969412c319461a0b84fcd645bebe42beb87be95e139f29ce7663c","observation_id":"0b2cda85-bc35-4ac8-9f0b-e0e0ecadaf0c","resolution":{"observed_at":"2026-08-06T16:39:35.406720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.871302Z","title":null,"venue":null,"work_id":"65944e73-9116-4cfd-803f-d213dd90dca5","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.368762Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:efc80ced581098bb8a5f213cf238abca59cb957c3ee8f6ea1e6b787fea7f7011","observation_id":"f2241cca-996b-4dfa-8544-72bb7b4d8626","resolution":{"observed_at":"2026-08-06T16:39:35.031389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.609284Z","title":"Stenzel, J","venue":null,"work_id":"cd50251b-b2c5-46da-a35e-685d93f0f21f","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.517462Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f9b0d295876d008ce4560a189ade964476a0249236ad681e7a9ba9d65cc5d410","observation_id":"a465dc02-1c7f-40ef-8462-3d4ef894187d","resolution":{"observed_at":"2026-08-06T16:39:34.739409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.290858Z","title":"Lee, S.-W","venue":null,"work_id":"d3caa728-7941-47a1-af64-fc0420818e4d","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.633891Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:b17ba012534be1c28d4e87d1e4be1dfe33e2cb4fae1c4a530d544bd83930d403","observation_id":"939a3825-8c7c-4fab-af36-92f170559fd6","resolution":{"observed_at":"2026-08-06T16:39:34.477770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.001831Z","title":"Ephrat, I","venue":null,"work_id":"3c73b934-75a5-465b-a788-9a15b714bf42","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.857285Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:1c689e029c19d975586f740c5de49ef9b08d2c31d842ef55f83fc643e42f98d4","observation_id":"9771d9c4-2b40-48ef-9350-e6c39a0548cf","resolution":{"observed_at":"2026-08-06T16:39:34.152073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.714736Z","title":null,"venue":null,"work_id":"2fec3a01-2c3a-4b7e-8dc5-04c07d09bf78","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.976719Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:c45134574f2e160f77e14d5c0cb52ca48559d09db2fed2a2380c728f69618472","observation_id":"7e073eb0-fd0a-43dd-ac68-7564b09619a9","resolution":{"observed_at":"2026-08-06T16:39:33.845693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.449804Z","title":null,"venue":null,"work_id":"3a323f9f-96b7-461f-ac86-c93c0b037ed2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.147172Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:89b69d33bbd62f5bb0d0b884aa745e2adda6767cd449c5dac031b333fd4e4913","observation_id":"0648571d-485b-4b2c-a681-70a976098eaf","resolution":{"observed_at":"2026-08-06T16:39:33.572830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.126118Z","title":"St¨ oter, S","venue":null,"work_id":"c4d8a59c-2372-4f91-ac35-ea871489c3f5","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.283361Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f40457bb2a2702cb2f3e84c526bc3981ab32ec3e98eeb5fdb516a4dc331628a0","observation_id":"ea2f45e1-687e-49fe-aa0f-46d3b9f8d3bb","resolution":{"observed_at":"2026-08-06T16:39:33.291130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.798191Z","title":"Horiguchi, Y","venue":null,"work_id":"36c27050-18f1-47ef-ae3f-cc3b52364474","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.388936Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:89111cce8d538590e72578d30e941c4cec09b22c6e55d29ee515cbf34ad67ce1","observation_id":"2703c658-5631-437c-bb7b-634bee467cbe","resolution":{"observed_at":"2026-08-06T16:39:32.919221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.427174Z","title":null,"venue":null,"work_id":"de747449-6001-491e-9338-921448489d06","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.521619Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:92715cb0ebf9082fec119373c6ce595957ab9d77e4f0b1390cb73d7726ae7903","observation_id":"d87fc097-f85f-4ef5-898d-97f46cb94f0a","resolution":{"observed_at":"2026-08-06T16:39:32.608825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.144451Z","title":"Afouras, J","venue":null,"work_id":"98b74b44-ee08-4d6a-a355-d25468b8ef51","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.723251Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:c71f0c9cb21dc64387b6b3ab51e06aa24e1e42e6d19407a5d27505f60128d3f5","observation_id":"10360b23-f127-461a-b4d5-baf8994afe5b","resolution":{"observed_at":"2026-08-06T16:39:32.290734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.817760Z","title":"Le Roux, S","venue":null,"work_id":"d92af0cb-fc99-4425-9807-4d9de043c328","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.845904Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f54dfbb527c971ed5822df41375960baa2afe1f2f1a2ee8fa433f63d73bda5e8","observation_id":"43a4d791-8459-4f9b-8312-1a559045f7e0","resolution":{"observed_at":"2026-08-06T16:39:31.965617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.509862Z","title":"Kendall, Y","venue":null,"work_id":"5a8e3c56-8da4-482d-82ac-f01f856fda6c","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.993154Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:307eb0af4fe38c9c7d6d2ee6ad14da5cf4187167f0bbed1b8411551407bda441","observation_id":"19052ed6-d406-4423-8c57-17fc5e7effb7","resolution":{"observed_at":"2026-08-06T16:39:31.666932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.205907Z","title":null,"venue":null,"work_id":"4b3bc720-f429-49fa-bbb3-c266529407e8","year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.163178Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f682e8626ce8c44a9b2519a4dcb0cf588cf85108f777365e4f9386ad9df299b8","observation_id":"30a0f8c5-0bb0-4671-ac8f-52ab585d6564","resolution":{"observed_at":"2026-08-06T16:39:31.336812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:30.931973Z","title":null,"venue":null,"work_id":"48689571-b8b0-4b20-bb03-7c6a8e47ebb3","year":2001},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.294530Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:2e09dbf379883791e633fb825b9881f8aa0f584d75fac70c4f9fab6ffbb2680a","observation_id":"136a992f-3ea4-4074-a4b3-1f596c717272","resolution":{"observed_at":"2026-08-06T16:39:31.053292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:30.645289Z","title":null,"venue":null,"work_id":"68064e8e-a8e2-42f0-a5bc-eaa0a184b8e0","year":2010},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.416983Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f51398842d80ae82e31f5fc548600d1f5bc058c4577b22f702a417ecb4c105b8","observation_id":"4d2d9edf-7aa2-46fb-ba4c-32d0035fe30c","resolution":{"observed_at":"2026-08-06T16:39:30.752031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T18:01:07.292606Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2507.12972."}