{"as_of":"2026-08-22T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c71f59447c1f08b37243aa7564ec907b3ccde48c4916419615a40bf93a3f8fd","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:07:21.595291Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:07:21.595291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T18:28:48.556997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"cited_work":{"arxiv_id":"2606.16731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16731","snapshot_observed_at":"2026-07-03T18:28:48.556997Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","venue":"cs.SD","work_id":"cf91751e-ebb2-485b-9040-095ba18b48c3","year":2026},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2606.16731","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:8e15aeb0e2e95690dc66086ad34b1e9a69cb3fc34a51b983740f38e9f998fc0d","observation_id":"f36efb2e-6f6f-4bd5-92ce-69391bc00b89","resolution":{"observed_at":"2026-07-03T18:28:48.558828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.16731/citation-record","integrity":"/paper/2606.16731/integrity","json":"/paper/2606.16731/citation-record.json","paper":"/paper/2606.16731"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"cited_work":{"arxiv_id":"2606.16731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16731","snapshot_observed_at":"2026-07-03T18:28:48.556997Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","venue":"cs.SD","work_id":"cf91751e-ebb2-485b-9040-095ba18b48c3","year":2026},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2606.16731","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:8e15aeb0e2e95690dc66086ad34b1e9a69cb3fc34a51b983740f38e9f998fc0d","observation_id":"f36efb2e-6f6f-4bd5-92ce-69391bc00b89","resolution":{"observed_at":"2026-07-03T18:28:48.558828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Active Speaker Detection vs","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:de141a9606ff52104221135b4839d8ac7a6bf989c3a775951574e002b247f79c","observation_id":"c76e66d1-cb7e-4d53-99ca-9f1b701a0873","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Speakers use these visual sig- nals alongside prosodic contours to navigate turn-taking [25]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:fdc80ef61f687c98ed8be2e6b38f2bcf7055cd35291931a5ae53c954c0aacfe2","observation_id":"3139902c-37a5-47ac-b9f9-00f30bcda4ff","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"As illustrated in Figure 2, these sources contain editing artifacts like jump cuts that disrupt the temporal flow of conversation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:b0b48f22e88b9c9d6210688b468c9d27e96aa2167d37127d7baf0666054e2665","observation_id":"e0ee3743-5aaa-456e-8a35-ab48ed0eadc4","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"cur- rent floor holder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:6964bbc44c70a31a48269d66d8a38fde6299c57a777881c9e4b3f8c0d060ab60","observation_id":"bb8d106b-18b1-4eac-9513-9608b5378572","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The speaker with the highest activity is designated as the current/past floor holder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4f009eea3a49e2617c375caf59abfd92aa6c9325388672c6717768903abc861b","observation_id":"f66b50f1-5110-4f3b-bcbf-6c197d1de354","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"social conductor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:127ff0cf355d780a03f343a95109bc03b31dd27459daeafca353b1e085c4008c","observation_id":"7f8598bf-38c4-4d92-a7ff-974d3538f7ed","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Each dataset is mapped to specific mod- ules to facilitate multi-stage training as shown in Table 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:637cd752ad412511216151631521b04f206cb2989360f8521bddff854404e03c","observation_id":"8e47ae96-bca5-491c-a25a-0a9335b08040","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"To measure the usefulness of these learned embeddings, we de- fine a set of downstream tasks for evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d4dd166b2dcd0070b281b4e965bea8167dc1bc6e9d858d6286bf63c88cacec4f","observation_id":"92989b43-558d-415a-bf03-49d5950ed0b0","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Results are reported as mean ± 95% confidence intervals over ten runs using random seeds 42–51","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:a73e7f24733adc11117b69bc66efd5a3d8f5787fa5bc18716c2ba9c7eeb45a79","observation_id":"d9d06664-d428-496f-b7d6-66f34eea6575","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:bea3f24ccd918568400446d467f83a908324f35e87ea2b5cb45adc826ae60b9b","observation_id":"8c73ec7f-3f6e-4d12-bdad-38dc3f72a73a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"To address the scaling bottlenecks of joint modeling, we proposed a Role- Relative Projection that compresses complex group dynamics into a scalable pairwise state","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:9e770c4783572dbdf7deae14fdf62dfe016d102578a0f1575e2aae0ca70c882a","observation_id":"75617a5c-7956-4b5f-8242-c9c0d56c36f6","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The computations and data handling were enabled by the Berzelius resource provided by the Knut and Alice Wallenberg Foundation at the National Supercomputer Centre","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:a16f30e3a97576427d7eeeae22264ead5afbe6f53befaa7d4a466f14d0f8ece0","observation_id":"5b5744e8-eee0-434b-b2b1-0681fa988452","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"These tools were not used for writing any major parts of the paper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:de86b14a69933e86885279fe9a8d3301676584eeae974d217ea64a48173dfea2","observation_id":"285fca42-d911-45d1-bb47-51bf5668dc3e","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Some signals and rules for taking speaking turns in conversations,","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:01b9b82c84b0fe4a851aab56f6e773a4067cbfeafa8bf275fb895042c35b547d","observation_id":"4ce2c715-9606-4595-8329-3eb480042423","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A simplest system- atics for the organization of turn-taking for conversation,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:78b52e8bfd8ed0d09eff649ace226f97dd8a2c23381ceaec78b696ea180639c5","observation_id":"b4e5f3ff-1ae7-42eb-a55b-7b1ec722468f","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"On the structure of speaker–auditor interaction dur- ing speaking turns,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4772228f5082c8f3b81fcaf9e2c61d39546ed3e21ed3a63bc280695be73beefa","observation_id":"6cf5e31e-fdc8-4731-99f1-c01cc91240ff","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Interactional units in conver- sation: Syntactic, intonational, and pragmatic resources for the management of turns,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:348ebb319059ef2ed1c363822ed9355790a17453361fa1e976a316eb4242f107","observation_id":"e631b712-18cf-470f-9b4e-dbcedcb34f2d","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:48f3963d17ee521b7223ae9cd40b481f08147ba82cf3c13b1c20292214fd9a5e","observation_id":"139550a6-2339-4df4-a36a-5305bd8f8db9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Listeners’ responses to filled pauses in relation to floor apportionment,","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:8003cf8e1b9a6ac2b13956a47484892e3236bdc2a100d7d568ddd4f2a92b9138","observation_id":"b72276a9-e146-4ff6-939b-fcb63dba6252","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Duncan and D","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:ed0df007898c91739040da70c8764b09007872dc6be616a95f5e4d025f3be333","observation_id":"b6789a82-4ca9-43d6-80f0-87d792e0a33f","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Universals and cultural variation in turn-taking in conversation,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:952375911b2cc9349cbba3af003f2fe4f7562389c20aaba6bdfaef05ccfac04c","observation_id":"263b65d1-e839-4157-be7b-a8b5c34d0267","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Timing in turn-taking and its im- plications for processing models of language,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:60fd8d7f1d757b86b88b292da75c42cbfe538ca9cd1456528b8431ab8ca97567","observation_id":"d9564aa5-84a4-47fd-8cd2-501c8ab63b54","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Conversational interaction with social robots,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:ac646e23bac1975f777f2a1409b2632ca40a4e09ddad0cd3f44faf8a3c951f19","observation_id":"576ab0ff-5dec-4e55-a7d3-7bd74f544ffc","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"V oice Activity Projection: Self- supervised Learning of Turn-taking Events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:88a78ac3c304886d624f2957f39e8d13dc9f0aedcc986eb07dc88e7dacbde93c","observation_id":"b36c8ee4-702c-4379-b974-53d4b1373a07","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:7d423c7de20acd2ea4901526006925a74674b824a0f8ea60118fa24d69f97d32","observation_id":"8b5184db-4470-4ba6-a13f-ac56326670ba","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Applying general turn-taking models to conversational human-robot interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:ab04db20276bc9e09d9070701278a8535774fddb26a455ea7b1aabd56e8380b9","observation_id":"29182a9b-607a-47a4-af56-173a9ef98ff2","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal turn analysis and prediction for multi-party conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:94d82ac691c392f20f01770cbe30b221b1a569bb90db46d5e04ca54f0c8b8ca2","observation_id":"e4670881-626e-4cac-b08f-8c61af0a82d9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Triadic multi- party voice activity projection for turn-taking in spoken dialogue systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:18cb6222283351f0c4787f959296c4f4c4eb68e6b0762bd192a23852b7052b7f","observation_id":"230c954f-88e0-4382-b50b-abf875c123de","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"MSDWild: Multi- modal Speaker Diarization Dataset in the Wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f5a1141deac8a27ba063d32e07ab537e2ed5dc692a1b9fadadbee0ac4999e473","observation_id":"04ce0820-801e-43c7-a49e-b5d85dd01813","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Is someone speaking? exploring long-term temporal features for audio-visual active speaker detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:eb82fb445a0536e94a319529ca64d68b10da8159286b5443fd943001b21ce03b","observation_id":"39a7fd18-d883-4e6d-aa79-84f9d8f692d9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Loconet: Long-short con- text network for active speaker detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4ea35ec2f82724274c3ac58963b99009e96d40e3e859e82646d91dd6dae2a7c0","observation_id":"3bd0a8b7-d65f-4ad0-b3a7-a2b29f5c5263","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A V A Active Speaker: An audio-visual dataset for active speaker detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d5483918d4c07a6e473eb73d7697082d80a564660d8123ff1d64cf6368acb011","observation_id":"2f1d3e61-b0db-42df-9d2e-3163d443c0bd","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"How much does prosody help turn- taking? Investigations using voice activity projection models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4d583a6a9aa352b11684ee747b21bd9deee3dfec07c0268da9819d64e2597d48","observation_id":"67e01810-8c63-42cd-b057-5e4c1ccbacfb","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Pre- dicting next speaker and timing from gaze transition patterns in multi-party meetings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:913b55d005508078cf657dedb790da7094cfee4adfbe4472bdc61ff7b6d998cd","observation_id":"f75a2a91-6178-4897-8442-a3a11e608d87","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Gaze-enhanced multimodal turn-taking prediction in triadic conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:a1b9ccf52fdaf4ca8c1ead363dfa6617a86dcbe1372b8c6843df3456470aafa2","observation_id":"ffe121ca-e8a1-4829-b880-36247af409ad","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal voice activ- ity prediction: Turn-taking events detection in expert-novice con- versation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:259e59d15a3736df75c34361c832afb0f19d69a1479ea69765bd661cdfb25699","observation_id":"55edde12-ffb7-4a86-9a28-e4bfcdf57877","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Prediction of who will be next speaker and when using mouth- opening pattern in multi-party conversation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:18022731f452ac6d6e25959254fb9a15d1318f790a38ff483f57495d373116bc","observation_id":"94301a8b-ce4e-4929-8f27-5745af8442f3","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Who’s next? speaker-selection mech- anisms in multiparty dialogue,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:904fe291de3cbc7e5405617a2e6f37007f1b2b6809a053823369a03bd5cae3ab","observation_id":"282b4ec7-d778-4334-860e-f9e00fde0f7d","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A computational study on sentence-based next speaker prediction in multiparty conversa- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:a431f28223ad1728453c0fba7d9836f0100cbdec7535ae1b7d0cf47e6d4241be","observation_id":"c34b7288-4b49-47bb-b426-1276ea6e626b","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal continuous turn-taking prediction using multiscale rnns,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:5bd928fb529eecedb36f58b14d40a9d56fff75c15acd359b8ecb7ddfc7ef7d3a","observation_id":"6ca54da5-eb64-4402-9d55-d8603ab2a370","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Visual cues enhance predictive turn- taking for two-party human interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:34bb6203b7651835d2d35578023cd81d5402b78b5bedb3f8db29c65ec9504c49","observation_id":"698a3705-cf51-4d13-a52f-b043e9bb30cb","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multi-channel sequence-to-sequence neural diarization: Experimental results for the misp 2025 challenge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:ccc8a23a7f7d9958e9e701c9012410288da71fc1c62efcf3d46ed8ba78a3a802","observation_id":"9044764c-9e12-458b-94fc-9d75d12e0373","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Enhancing gaze prediction in multi- party conversations via speaker-aware multimodal adaptation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:833a6f74df3e1016140e1ec720eb2314d24bee1e6364a9b590629495ebb3d84d","observation_id":"7f9de156-b3f6-43e6-8e59-d6b56101ce79","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03932","last_updated":"2021-09-07T06:22:37Z","snapshot_observed_at":"2026-08-16T18:18:57.115070Z","submitted_at":"2021-06-07T19:44:56Z","title":"How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild","version":2},"cited_work":{"arxiv_id":"2106.03932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03932","snapshot_observed_at":"2026-07-03T18:28:48.550070Z","title":"How to design a three- stage architecture for audio-visual active speaker detection in the wild,","venue":null,"work_id":"d0fc66dc-d31d-431a-989b-c5415a6e065e","year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2106.03932","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:0cae44e51e6a4f1d475ae8ffbf7296f17c004d8a81d74619d0ec01fc619097e2","observation_id":"046df085-fe82-40d3-b739-b1ce3266c32c","resolution":{"observed_at":"2026-07-03T18:28:48.552321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:07db09de56ec056f2b06b0559e664325896384ae7a599bf106ddc661c05b5bb4","observation_id":"be42c76d-3a41-4a0d-9b13-226562d5a6aa","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The ami meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:b91215f6a7488909ec5af8a754f4491273cbf04dfe589718bb36b37dcbc70eaa","observation_id":"af1d6367-b199-4b46-b983-96fc7fe6c27a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Masked face recognition challenge: The insightface track report,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:417244430ad4f1e7859af9b307bcd20f2a8d58acf38a02702137ebffda9d9dd6","observation_id":"cf837a0f-01a3-47b8-b337-8909737f0e03","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Reti- naface: Single-shot multi-level face localisation in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f74c365e185140e32e3f8d242e03b615554c7c80075f135b712efd42c9002f92","observation_id":"c3e201db-ef58-40bb-ae0e-6a5e1906ff56","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04714","last_updated":"2021-05-10T23:51:14Z","snapshot_observed_at":"2026-08-16T18:25:41.991858Z","submitted_at":"2021-05-10T23:51:14Z","title":"Sample and Computation Redistribution for Efficient Face Detection","version":1},"cited_work":{"arxiv_id":"2105.04714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.04714","snapshot_observed_at":"2026-07-04T03:19:31.625145Z","title":"Sample and computation redistribution for effi- cient face detection","venue":null,"work_id":"77e21ba3-b09c-4e54-9517-c3e970070311","year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2105.04714","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:e54cb267bd3d1b824d3a9c2060356d21e5cd76259f3aec3123104372785e865c","observation_id":"3b7016e1-5ece-4d8b-aeb5-32a5810a852e","resolution":{"observed_at":"2026-07-03T18:28:48.555627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Arcface: Additive an- gular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:929db7838b8df5cf536b0e8bec24429c67d77106ad3607e3f7adb4ca34264f6a","observation_id":"0331cf43-59e2-4f3a-b9e3-6771ba64fba6","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The hungarian method for the assignment prob- lem,","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:418b9c4797d6fc3f5869e3d96588a5c2e66f41f31d22bb399a9ee2f6859eccb9","observation_id":"b9ac109e-7808-4016-904e-44926d34dd8b","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f662ebcd2e993a80deb76835c497c9ac918877f7ad874dee2aaafe81ea82ffe8","observation_id":"ed4ba27d-1daa-4f5b-a733-9875f0e4511a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Talknce: Improving active speaker detection with talk- aware contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:7c931adfcb185f045a004dfe0631ced07b2ca348a952e19b6c2ae7d34a5ed288","observation_id":"323e1dd9-cfbe-4132-8a7f-04bad1d0fc3a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Turn-taking in conversational systems and human- robot interaction: A review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4e5c520b03606f10e61e97983983bd4ca30d25950abbc5ad5c6f4995e16e1603","observation_id":"ad3284fd-6c37-445a-8d4f-5888be7ac71c","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T01:48:45.732446Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":52,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2606.16731."}