{"as_of":"2026-08-13T22:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab3b28a2ab9d376117afd0a4ab02b14a668637c976e3ae7807cf566567bab8f0","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:28:04.024662Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18055/citation-record","integrity":"/paper/2506.18055/integrity","json":"/paper/2506.18055/citation-record.json","paper":"/paper/2506.18055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.701459Z","title":"Active Speakers in Context,","venue":null,"work_id":"0f25066e-411e-4fac-82a9-b047dbd4a979","year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.161274Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:55ff0c07dc96cd0be10a7399b6cf778f437da9a45a051f5ae2adc680f77c241a","observation_id":"3d519f9d-1d03-4f53-ae21-48a237127be6","resolution":{"observed_at":"2026-08-06T23:28:11.966029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.424799Z","title":"Ava Active Speaker: An Audio-Visual Dataset for Active Speaker De- tection,","venue":null,"work_id":"11d1e8e5-32d1-45ad-a3c0-0d125baecdfb","year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.211659Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:1445d38784f5e8d864e2febfe6c3df81be35dd50fbb6e02b3569c338c372098a","observation_id":"595f5d18-6525-4a29-b1ee-497625d96228","resolution":{"observed_at":"2026-08-06T23:28:11.526572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.136233Z","title":"ASD-Transformer: Efficient Active Speaker Detection Using Self And Multimodal Transformers,","venue":null,"work_id":"f6a8301d-f3e2-4296-a686-3ccd70c86e74","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.334739Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:845c99cc0e69bb178c7e01a5bf7dbc1619ec52026441a70317b8e93e52c613ec","observation_id":"675e0db4-f8b4-45d3-8e6a-fde1299fe0ce","resolution":{"observed_at":"2026-08-06T23:28:11.244934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.906092Z","title":"Hello! My name is... Buffy","venue":null,"work_id":"43c122f5-2fdd-431e-ab8c-bd4622558259","year":2006},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.395980Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:44910110c9ec9580e955135a49cedfce72623e7fc43c394aae6034914a6c2b52","observation_id":"01600124-09ba-4662-8c9c-f10ea044203a","resolution":{"observed_at":"2026-08-06T23:28:10.993651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.680390Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":"c5b0407c-8f3d-4086-b51f-81439d4ffb56","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.502763Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:9a7a84b3f164afe7cad60d4e24b284864233da15abc25e3f5e548842e6667f6c","observation_id":"1d152d5d-2af3-4d3b-b54c-3a4bd1ae02d4","resolution":{"observed_at":"2026-08-06T23:28:10.769025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.465611Z","title":"A Light Weight Model for Active Speaker Detection,","venue":null,"work_id":"dce7f2a9-ec81-4071-bc2f-530a85ceb097","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.578729Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:e7d0167545b2f4d4348d23acabc7335fbdaa62ca40b4b534ab38c3179a8f171a","observation_id":"c9c5a4f2-537b-4f30-82e8-5af3a23ccf49","resolution":{"observed_at":"2026-08-06T23:28:10.599063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.205599Z","title":"How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild,","venue":null,"work_id":"4579fea4-e889-4f13-b4c4-bb587e716cf3","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.661110Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:95b2ec7ba7fd64a5d052fce0f74ecdeb72a4fea1e3f865e631db494df1562c19","observation_id":"0a1d72ee-4f06-4b28-84fb-db88ad03bbe5","resolution":{"observed_at":"2026-08-06T23:28:10.352982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.896603Z","title":"Rethinking audio- visual synchronization for active speaker detection,","venue":null,"work_id":"7d006403-3b5d-42a1-bd91-d059491625e9","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.743867Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:122067a7fd24be70203ef1e31fdaa0d8ed4166c2983e32c496be1d8b5bce8093","observation_id":"560f2392-93ce-4dd9-8852-7e5e5e6e0f87","resolution":{"observed_at":"2026-08-06T23:28:10.001902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.688122Z","title":"Look who’s talking: speaker detection using video and audio correlation,","venue":null,"work_id":"27dea6b5-816b-4afa-9301-dbe9be142d37","year":2000},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.830166Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:190b3458e19c0b91da1c990b382759403d1fe0499223b474fd04be8478d4b4b7","observation_id":"a6840b8f-f578-4718-8d99-81eb95934fba","resolution":{"observed_at":"2026-08-06T23:28:09.792847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.456463Z","title":"End-to-End Active Speaker Detection,","venue":null,"work_id":"2064a700-2a96-4bdd-b07b-8a55b71e915f","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.907466Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:3f1c0d2d1b1a4a6c5ae0fcffd4141ddace038b72c190337e45b7a4ed860cc9f0","observation_id":"c24fe963-85d5-4720-890b-e6b43059b1c9","resolution":{"observed_at":"2026-08-06T23:28:09.581114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.258607Z","title":"Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection,","venue":null,"work_id":"fbae0c62-36b9-470f-9cd6-ed66e3cfaa9e","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.958946Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:e48e09921fda7aa8a20364869e867cfe40a0b8bafeb26aefa1f2307c67d59298","observation_id":"fdd7f602-0b28-4fbd-becd-a953dd51785a","resolution":{"observed_at":"2026-08-06T23:28:09.351206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.026761Z","title":"MAAS: Multi-modal Assignation for Active Speaker Detection,","venue":null,"work_id":"50ece476-2149-45ad-bae3-c595182a5b42","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.097316Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:559a11c56e4d09885e7d8debddc9f94ba33a5615e8e576c392b83e3de28bdc10","observation_id":"485f6188-833d-4be2-ac95-f5721ce9ff00","resolution":{"observed_at":"2026-08-06T23:28:09.128276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.794982Z","title":"Improving Audiovisual Active Speaker Detection in Egocentric Recordings with the Data-Efficient Image Transformer,","venue":null,"work_id":"0bfab214-4554-4622-9f6d-5a6adf8abf97","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.251608Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:8b9da911698d5e468b3e45385549677b5227f4516d4b058195b983fd74facf88","observation_id":"39561c4c-958e-44df-873b-cdad5357f4d1","resolution":{"observed_at":"2026-08-06T23:28:08.895941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.646041Z","title":"Target Active Speaker Detection with Audio-visual Cues,","venue":null,"work_id":"69dd74ac-b747-4217-a145-430997f4c4f8","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.401263Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:d5e4efeab6bf099b5aac142f7216347c74cfadb3c6790ed20aa6759055bee70a","observation_id":"7c1b49ea-fa35-443d-b6f4-ad6f9019017b","resolution":{"observed_at":"2026-08-06T23:28:08.743478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.406280Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings,","venue":null,"work_id":"0654abea-4acd-4562-bacd-3ca64b9efceb","year":2025},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.510834Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:20ee6c4e6cf6eb6592fc1d08ff23260c3d907c3bae6fc7e1d8c75225bfa7765e","observation_id":"6934f742-1c5e-4600-a4e2-622a37b09024","resolution":{"observed_at":"2026-08-06T23:28:08.516435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.201953Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video,","venue":null,"work_id":"d90bdad0-8114-46ac-b277-88982d7ebbb4","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.613046Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:8408e37a4a3d9d4e7da1d71ac8028db757c12a2495d4ef214a882d6a2ddc3db1","observation_id":"6b46b576-648a-42dc-9e1b-bc703fae9e9f","resolution":{"observed_at":"2026-08-06T23:28:08.272269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01467","last_updated":"2023-07-04T04:12:49Z","snapshot_observed_at":"2026-08-13T11:03:17.510238Z","submitted_at":"2023-07-04T04:12:49Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01467","snapshot_observed_at":"2026-08-06T23:28:01.668716Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.668716Z"},"links":{"cited_paper":"/paper/2307.01467","citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:9c14c6d46732708f1ec09db2c655733d94a9213ec30307618fcafa31fdcddb74","observation_id":"3ff72ce4-a91e-44ca-8841-3d3cca488ac6","resolution":{"observed_at":"2026-08-06T23:28:01.668716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.966875Z","title":"Seeking the shape of sound: An adaptive framework for learning voice-face association,","venue":null,"work_id":"2059f993-a598-4466-9bde-5ca21167429a","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.716049Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:b4248fc175934a8f3e802128fc46ddc4a2d40c0f423550acdee4b986adeaf160","observation_id":"3c85c3c6-8f4e-470d-8fcb-67259ac708cb","resolution":{"observed_at":"2026-08-06T23:28:08.058693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2527.35313","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:04.426390Z","title":"Self-lifting: A novel framework for unsupervised voice-face association learning,","venue":null,"work_id":"9da96315-88b6-4010-897e-3cc692572491","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.837550Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:d50c54aab6b2f2367b9807e681f9e133c9929d0bf2288fbb7cd1b6fa18ef672d","observation_id":"03f7becb-6ffe-425f-8532-08d88f4dccff","resolution":{"observed_at":"2026-08-06T23:28:04.554745Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.801093Z","title":"Learnable pins: Cross- modal embeddings for person identity,","venue":null,"work_id":"6fac8e24-3e8b-4b35-b7e0-1fddb97d9090","year":2018},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.082727Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:3a7403d82bdf89973430e0867161524c3bffc8af55605a842fce5016953c12c1","observation_id":"c818b741-5277-4e16-abd0-a8d1291c9357","resolution":{"observed_at":"2026-08-06T23:28:07.868774Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.573924Z","title":"Single-branch network for multimodal training,","venue":null,"work_id":"d847ee2c-bfbb-4c1c-aad1-ff7d28b8ae2e","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.239663Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:14cd9f6a89d0346f5cb2062973519d36c2540e0f032da6c645b6d50d8553e8a2","observation_id":"6877f71c-2b62-4c0b-ac45-67030f6e342c","resolution":{"observed_at":"2026-08-06T23:28:07.663855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.337447Z","title":"Disentangled representation learning for cross-modal biometric matching,","venue":null,"work_id":"e24f0f37-b1d4-4a9a-840a-d1c93b3e1370","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.377727Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:4ba66801abd646aa2a388b91f78c1d03b6fd547fdc06feee9359ac47e899b45e","observation_id":"45f549bc-58ed-4e08-901d-8064243fca8f","resolution":{"observed_at":"2026-08-06T23:28:07.467614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.174207Z","title":"An efficient momentum framework for face- voice association learning,","venue":null,"work_id":"ea0cbaa4-f38a-45cb-a58f-49fd28c66973","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.488724Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:0bdbd9d3b15c1ab4e9679daa45e3182037787332b7b23f64673017dc2b51a582","observation_id":"a7cf0fa6-e9bc-4d58-81ee-4a56267393e8","resolution":{"observed_at":"2026-08-06T23:28:07.247169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.988550Z","title":"Audio-visual activity guided cross-modal identity association for active speaker detection,","venue":null,"work_id":"e7cd43bf-04fd-451c-8701-b6f8ab168e75","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.572698Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:cc65190c31cb0a17db2bee685ad9e77207d0b25d489b128a6f954c0bcb6e6904","observation_id":"a5379e78-54f8-44f9-b109-a007618e45a8","resolution":{"observed_at":"2026-08-06T23:28:07.078961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.794737Z","title":"Favoa: Face-voice association favours ambiguous speaker detection,","venue":null,"work_id":"0a020357-4ebb-4bf5-9190-24f5de22c145","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.704753Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:cf8919d03221c1adbda33bf0f0e4d64a5e4c999d3924122947d38e64df279e67","observation_id":"4b0cb8aa-1595-430f-9381-c9c9d544d02c","resolution":{"observed_at":"2026-08-06T23:28:06.912665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.656868Z","title":"What in the world do we hear?: An ecological approach to auditory event perception,","venue":null,"work_id":"1a1399b9-0a30-42bb-a3c9-be4fc98facb2","year":1993},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.819345Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:7bb00c5d67aeaa9895108bab339a00421b41b87982a47ea2aece6e5558d1f7bb","observation_id":"94448a55-3457-4788-9073-46b186ac08be","resolution":{"observed_at":"2026-08-06T23:28:06.692666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.359424Z","title":"The development of infant learning about specific face–voice relations,","venue":null,"work_id":"80256797-3604-48cc-910a-f286406bed67","year":2005},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.931958Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:e37c8419d78dd9ff99140dec7b38a8cb9edff424a1a332f3bc02a4a02cde4b3a","observation_id":"678a8f40-55c7-4a93-949c-da8d2397e8fe","resolution":{"observed_at":"2026-08-06T23:28:06.518843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.064751Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.064751Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:9e6e35fc1bf993557933fb844165752b99d71e64afa1a24e6b2afb0b6e4c9a8c","observation_id":"bfe23d5c-abdf-4b35-9598-368caf1b438d","resolution":{"observed_at":"2026-08-06T23:28:03.064751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.143606Z","title":"Going deeper with convolutions,","venue":null,"work_id":"583de5b4-00b7-44c4-8c37-51a9f64326ab","year":2015},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.181816Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:25c7f83a9e821f4c9e2c3e25050f0427e5e9832bcb7fc12162d13e4459341d74","observation_id":"49998520-39b3-4c4d-980d-52b78574f43a","resolution":{"observed_at":"2026-08-06T23:28:06.213326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.287092Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.287092Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:d6a69c235b7739a88dd0acabbf11f4f04129130c1d47e7afe439e2b7952dbf7d","observation_id":"84a012c6-bd7f-4fe3-a822-1043f0ddb7c7","resolution":{"observed_at":"2026-08-06T23:28:03.287092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.413480Z","title":"V oxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.413480Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:c6d175d0581849a95d7e99b668cf1af5e1110e26d6bc1913efb86110ca1d8c15","observation_id":"372c41aa-29c2-48f0-ba07-06083b3c28ce","resolution":{"observed_at":"2026-08-06T23:28:03.413480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.921152Z","title":"Silero V AD: pre-trained enterprise-grade V oice Activity Detector (V AD), Number Detector and Language Classifier,","venue":null,"work_id":"80482dab-8b53-4c29-bfa8-d2b89301cf86","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.514567Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:374f9b93731944985bbbb5b0e023e29065489d15709f8522b2c5794bc8cd9502","observation_id":"bd9368f2-295d-43ba-94b1-9dc87ed33b03","resolution":{"observed_at":"2026-08-06T23:28:06.010040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.671864Z","title":"Speaker change detection using support vector machines,","venue":null,"work_id":"b3a92abe-20ed-44b8-aa7c-36f280b52d21","year":2005},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.617037Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:4dbcd4283335ca8511f013625d5ccd64648c4bf02df354e3c21ce6d8cd79230c","observation_id":"1c82e53b-dd44-43cb-8d11-e1060c2a9caf","resolution":{"observed_at":"2026-08-06T23:28:05.791533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.459731Z","title":"Robust Object Recogni- tion Through Symbiotic Deep Learning In Mobile Robots,","venue":null,"work_id":"de7ec6fa-61f5-4460-8846-d7d848f06c0f","year":2018},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.722890Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:f587baee302d6d6f7fda02efa087cf678c1a255d8ceddf5c6f9eedc55cbf0f33","observation_id":"01524bdb-3042-4b5f-98d8-9487ec8a63ab","resolution":{"observed_at":"2026-08-06T23:28:05.513645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.160877Z","title":"The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results,","venue":null,"work_id":"f3c8b48e-107a-47e3-ac34-d5c73345e980","year":2012},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.826961Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:7ce2009144ee94659ad052f89b05bfa53272666ece850ff9d0ba35768f652123","observation_id":"d9dcd20c-c5f4-481e-bd08-0a81574c4e69","resolution":{"observed_at":"2026-08-06T23:28:05.334738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:04.705799Z","title":"LoCoNet: Long-Short Context Network for Active Speaker Detection,","venue":null,"work_id":"8ffe3b7c-05a1-417b-b6bb-82ccc84c087e","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:04.024662Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:187d1c8d6bb9960e8c1e74a53aa466283d877b9c844cde65610176ecfd4362c7","observation_id":"dc7409f3-f4be-4f02-b059-3ca6b14fc596","resolution":{"observed_at":"2026-08-06T23:28:04.953889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.18055."}