{"as_of":"2026-08-13T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8e32cf7a6f9923208ae935caddf5fd39e3f953b284cab666a221b493778332d","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:34.901221Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:30.784001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T15:16:18.173817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-08-07T10:53:30.784001Z","title":"Smooth turn-taking enables coherent dialogue, preventing everyone from speaking simultaneously","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.784001Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:a689de9f1ac1e0c4877ee7ff059ccad7b80343656e7306ba4232359130beb028","observation_id":"9de12901-6558-4484-b0f2-f1c58c483bb6","resolution":{"observed_at":"2026-08-07T10:53:30.784001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":"2506.03980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-07-09T15:16:18.173817Z","title":"Voice Activity Projection Model with Multimodal Encoders","venue":"cs.CL","work_id":"137ee5f4-6e4a-48ca-abf3-b3fa511446e7","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:075491866f0f540f4e1eaa2bd8192c23c72204a7d8da7025358c3cbda94c7f21","observation_id":"470d4985-fcdd-40ae-960d-58c68db749cc","resolution":{"observed_at":"2026-07-09T15:16:18.175063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03980/citation-record","integrity":"/paper/2506.03980/integrity","json":"/paper/2506.03980/citation-record.json","paper":"/paper/2506.03980"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-08-07T10:53:30.784001Z","title":"Smooth turn-taking enables coherent dialogue, preventing everyone from speaking simultaneously","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.784001Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:a689de9f1ac1e0c4877ee7ff059ccad7b80343656e7306ba4232359130beb028","observation_id":"9de12901-6558-4484-b0f2-f1c58c483bb6","resolution":{"observed_at":"2026-08-07T10:53:30.784001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.987368Z","title":null,"venue":null,"work_id":"d130a792-53a1-4015-a378-377b3d71399e","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.879347Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:b523353a0de269c5cfa5058e0fb99ac04ffbf02761af6830248bae7ee25e7aca","observation_id":"73b51346-a3ec-4558-a0b3-360959c5f71a","resolution":{"observed_at":"2026-08-07T10:53:43.054931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.855081Z","title":"Unlike Onishi’s multimodal model, we in- serted a pretrained encoder for facial images instead of action units","venue":null,"work_id":"41dd3348-8f38-45f3-b61c-b5462b0faece","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.968030Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:737ab4fdb2d87c78eaa0b725a59d37f009869ffed6b6c9945e758bb2d18998da","observation_id":"aa716f32-312b-415a-a2b2-ae805ea34828","resolution":{"observed_at":"2026-08-07T10:53:42.912586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.719538Z","title":null,"venue":null,"work_id":"8a3a2b75-e9fd-4a6a-b68b-f6d2b17480cc","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.049890Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:56a06e90e34d28c6667058b16f60991abd2dab9fa4dc38cadba01d17329b67f3","observation_id":"c6cd6bf3-e16e-41ee-9126-6c918ecce3f2","resolution":{"observed_at":"2026-08-07T10:53:42.792038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.544714Z","title":null,"venue":null,"work_id":"ec1df38d-7f54-4aef-85c5-d7a4f809cc0b","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.162124Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:919f0ccdb03663ec7d1392b949d4dac20f11d006aad56da7f4f4d03484abd95b","observation_id":"224039b8-c633-4b71-a07f-f0d11163178b","resolution":{"observed_at":"2026-08-07T10:53:42.629601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.395356Z","title":"Onishi’s approach involved merging user signals for each modality sepa- rately and then fusing across different modalities","venue":null,"work_id":"5e734ad2-3696-409d-8804-01b2686e2811","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.240357Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:2f550d8aa932363a5dd96b919fb1fc0e5ca6d2a9815b182d640a32ed544b497a","observation_id":"4cdeaaba-ed8d-459b-bdc4-8419da09eb7c","resolution":{"observed_at":"2026-08-07T10:53:42.446772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.252193Z","title":"Dataset: NoXi We used the NoXi multimodal dataset for our experiments [37]","venue":null,"work_id":"496f40e3-c3f6-4c7f-974f-fc6c44d4075f","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.302301Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:1c70aee8aa90da4352d36de119394d10e9d1353db601d002cdbf0ce9600d0904","observation_id":"3ed24270-7e68-43f5-96e1-a5766682c055","resolution":{"observed_at":"2026-08-07T10:53:42.334883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.098867Z","title":"For SP and BC, our models (Proposed1 and Proposed3) outperformed the baselines, where the differ- ence lies in the use of facial embeddings from the pre-trained encoder","venue":null,"work_id":"5d3da5a0-7ee5-4d7c-b0d2-e9be4fbf5190","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.386731Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:ed5a7ceb3bc7fee306cfb7995bc82c76e39afabbe99032ca4c8b8308779f04dd","observation_id":"780aeee2-700b-4651-a456-3398cd8e9303","resolution":{"observed_at":"2026-08-07T10:53:42.153637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.908407Z","title":"By incorporating a face image encoder, the proposed models demonstrated competitive or even superior performance compared to the multimodal state-of-the-art (SoTA) models","venue":null,"work_id":"cf0993d6-6d03-4622-b800-a24fe8dcf4d0","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.455482Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:60cd03c2034fb64ab378315e03aef6612873a2775c7c6b55f940ff2f3c784a19","observation_id":"60c487df-7565-4fb3-ade1-fefc984fdf05","resolution":{"observed_at":"2026-08-07T10:53:42.009648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.790911Z","title":null,"venue":null,"work_id":"a1ca91d3-178f-4c3a-81de-76a8e7b6d85c","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.536151Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:75a89611920211ef13a97560a3dd2fe8a9b4de366b57a2a31c5478dacd7899df","observation_id":"eb5de9e2-133c-41a7-8d17-4924acea615d","resolution":{"observed_at":"2026-08-07T10:53:41.838076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.618881Z","title":"A simplest systemat- ics for the organization of turn-taking for conversation,","venue":null,"work_id":"e35ed00c-1596-479a-b35c-d177d7bdc27f","year":1974},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.603372Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:501240e06290ef73e03e5ec274985c0b6bcab04850654baa1b63627c39d8c5e5","observation_id":"62bce116-9f4b-44ee-9713-047f6d3fcf15","resolution":{"observed_at":"2026-08-07T10:53:41.696757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.455354Z","title":"Turn-taking: A critical analysis of the research tradition,","venue":null,"work_id":"ea0afa2e-c64c-453b-ab58-b68d55beed8a","year":1990},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.672711Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:6f2009f3d926ae9f32ba8927e3f91effd59316cde94e095b6c0ba7c630e1e54d","observation_id":"5b02f3d6-2f7a-4823-a7dd-4c68fde28c3d","resolution":{"observed_at":"2026-08-07T10:53:41.521561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.339905Z","title":"Some signals and rules for taking speaking turns in conversations,","venue":null,"work_id":"31935414-63e9-4927-b0e4-d0c21c8ec106","year":1972},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.768806Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c661a1e6139e88a4e72b87301c698a92d90bc07e7ba4fa436d4247929ec2dd33","observation_id":"591fbe38-ee34-4ebf-9c78-a272121bf8a0","resolution":{"observed_at":"2026-08-07T10:53:41.371958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.196219Z","title":"Interactional units in conver- sation: Syntactic, intonational, and pragmatic resources for the management of turns,","venue":null,"work_id":"94251af7-8cf8-4555-a441-0a27363e4369","year":1996},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.848267Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:3724ba1d506e8a8cb6fffe11ebba94e69c3b9e00ce30d871d60e58c84b5d5c53","observation_id":"aec0d1ca-d0be-4ae3-ad90-f445f9f4a695","resolution":{"observed_at":"2026-08-07T10:53:41.256020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.055875Z","title":null,"venue":null,"work_id":"037e6c9c-5027-4989-8a21-0c14c2052e80","year":2019},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.931068Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:6bd5714a3117eaef309feea3999d0267c66f8a7dc8f41756da7edc3f1569b85f","observation_id":"e1f26d21-f463-40f4-91fc-2084d25146de","resolution":{"observed_at":"2026-08-07T10:53:41.114513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.939908Z","title":"Using uh and um in spontaneous speaking,","venue":null,"work_id":"f0225a68-7d3f-4997-b221-ed0826727da0","year":2002},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.990975Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:3e1412ee31221f896d00689133a744f5596e2f9928b4270b25f55c6bb74de869","observation_id":"cd7c379f-dd7d-47c8-a25b-bde9899b98af","resolution":{"observed_at":"2026-08-07T10:53:40.996352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.791953Z","title":"Using prosodic clues to decide when to produce back- channel utterances,","venue":null,"work_id":"5cadde55-f2f2-414a-b5d2-58fc8effb5c7","year":1996},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.071262Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:4427c72dc430ecf12e1ec64a692b394cb1e54ba662f31978172629f2ff26839c","observation_id":"09b69a46-189d-4ea2-83fb-766c2db89b85","resolution":{"observed_at":"2026-08-07T10:53:40.844132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.664084Z","title":"Nonverbal behaviours improving a simulation of small group discussion,","venue":null,"work_id":"59cce04c-e589-4916-91d4-3608fc2c06b2","year":2003},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.132742Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:5c0a97ae3eb17c0f0f8e4c599ce799ac4bc98a21b0fd2956d3790f833d25757d","observation_id":"ccd90798-8833-4eb4-be36-b1610fea83a1","resolution":{"observed_at":"2026-08-07T10:53:40.712473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.522085Z","title":"Sustaining interaction dynamics and engage- ment in dyadic child-robot interaction kinesics: lessons learnt from an exploratory study,","venue":null,"work_id":"88b6d64b-ae27-452e-987b-92b1211e7951","year":2005},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.220226Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:bfc8b0eb8be274cfddcd299c8c4e3cc2bd6557a4853f8b6ff6b8af81f915637c","observation_id":"13f5be9a-d41e-4f27-8a59-05e5a9ac65c3","resolution":{"observed_at":"2026-08-07T10:53:40.564372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.364222Z","title":"The effects of interrupting behavior on interpersonal attitude and engagement in dyadic in- teractions,","venue":null,"work_id":"3536d69a-85d5-4adf-a462-80496e57631a","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.302198Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:f11b19bc43870987c3abb740049ef18ef99276030d508444d52a65efb16b744a","observation_id":"63bf7315-b13f-4021-ac0c-781f5dc7fbcb","resolution":{"observed_at":"2026-08-07T10:53:40.417748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.254119Z","title":"Now or when? interrup- tion timing prediction in dyadic interaction,","venue":null,"work_id":"69d268df-023d-4e77-9891-fed8671c4b31","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.384924Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:aa6d2595dac32c0643f60e56a8edadd3390fa1cc7f0ee96de3edcf28ca705c1b","observation_id":"d6ffe9f2-4f0a-47e6-92d8-2091d2c9dec8","resolution":{"observed_at":"2026-08-07T10:53:40.299939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.078213Z","title":"How turn-taking strategies influence users’ impressions of an agent,","venue":null,"work_id":"837b069f-9f79-41f7-920b-9987b77daa8c","year":2010},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.475213Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:cc0dbee3c1f7d2dbc3205fc176b1af84dbf65a819cc135f3f4ab6bb8c87d8b20","observation_id":"f42f06c1-b3a3-4cfd-bf38-f36ac0dae25d","resolution":{"observed_at":"2026-08-07T10:53:40.132579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.956416Z","title":"Timing in turn-taking and its im- plications for processing models of language,","venue":null,"work_id":"96b8c0e4-46da-4f81-a7bb-766bca1238d5","year":2015},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.568382Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:3eafc736089b9a8bad656df7a0d3ff4616296215ba63c7f86d6589136d53c6e4","observation_id":"62270099-7a5e-4217-afb9-d21fc7f21aa8","resolution":{"observed_at":"2026-08-07T10:53:40.014896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.838065Z","title":"Timing in conversation,","venue":null,"work_id":"50cb6d6d-1bde-4822-8fd9-a162571ef308","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.636080Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:33a516fd44cc738ccc6c3dddebc81c0dc6db6c4bc0de84e3cc4c67a8a389d176","observation_id":"bb06fffc-88c0-48bf-8da3-211339adf5c2","resolution":{"observed_at":"2026-08-07T10:53:39.863966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.637394Z","title":"Can I finish?: learning when to respond to incremental interpretation results in interac- tive dialogue,","venue":null,"work_id":"63663e23-a15a-4ab6-9a12-a17be640ed52","year":2009},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.724770Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:bd78a07b6bc787e9b18e12d0e50a55f5708cfa010f0168644646f58888fb42ba","observation_id":"df526a09-03c7-476f-95ea-b7f86eab929f","resolution":{"observed_at":"2026-08-07T10:53:39.721820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.451844Z","title":"Investigating fluidity for human- robot interaction with real-time, real-world grounding strategies,","venue":null,"work_id":"2a1887ac-acc7-46a7-9406-ce04d2f17382","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.843858Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:2ad17e6fc8df5b5bb1a1605260616393c005eda4bb221154870ece5ad48141d2","observation_id":"4da0c1f6-3c35-4047-bdf6-26c2e15dce5f","resolution":{"observed_at":"2026-08-07T10:53:39.546358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.286663Z","title":"Attentive listening system with backchanneling, response generation and flexible turn-taking,","venue":null,"work_id":"670b0b4e-7a2f-4c82-8973-27412c431f97","year":2017},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.909303Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:09ff7bfeecd7a9eba9cb83f9a4c79295315888d9467c2c297ee85979a4d400fc","observation_id":"0c39117f-2ccc-46af-b5d0-f9a8e5f281eb","resolution":{"observed_at":"2026-08-07T10:53:39.388384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.091369Z","title":"V oice activity projection: Self- supervised learning of turn-taking events,","venue":null,"work_id":"5b0fc05f-31d9-4beb-b0e6-d2449df90d6c","year":2022},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.990781Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:16a96df2b8f90a3511c076b2a5d1e7439575f1065a7b2c7700a1c18371952537","observation_id":"4397cd86-ad7e-4d7a-98d4-0b499497769d","resolution":{"observed_at":"2026-08-07T10:53:39.187792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.955550Z","title":"Pre- dicting next speaker and timing from gaze transition patterns in multi-party meetings,","venue":null,"work_id":"8f174574-f430-4b2d-b4f8-d10e12f6ee43","year":2013},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.117340Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:6a2b5c8101acdf65d6982d470a4f276666d5407acf0527ee3538439f6bafd033","observation_id":"88e17781-a09a-4660-8764-15a4c9979cef","resolution":{"observed_at":"2026-08-07T10:53:39.016839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.808128Z","title":"Predicting turn-taking by compact gazing transition patterns in multiparty conversation,","venue":null,"work_id":"c71e967b-0ec2-463b-8a38-7eb2e31be87c","year":2018},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.186043Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:ba9c905464a6ad80fbf7c1856056b6c38127d4b4851f3ab084b9c17029dd2d7a","observation_id":"72879ccf-5500-4aeb-9098-a3004ce9138c","resolution":{"observed_at":"2026-08-07T10:53:38.872661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.634716Z","title":"Prediction of who will be next speaker and when using mouth- opening pattern in multi-party conversation,","venue":null,"work_id":"cab883bf-b628-4f60-8eaa-70411595c3f1","year":2019},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.270468Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d10eec8f6eff2984a90c5f8ad5edbf08c606d7657f833550ae4fa30e2853c8df","observation_id":"f9c1df9b-1a7d-4722-a582-d1657e5baa05","resolution":{"observed_at":"2026-08-07T10:53:38.700880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.501858Z","title":"Multimodal voice ac- tivity prediction: Turn-taking events detection in expert-novice conversation,","venue":null,"work_id":"0bd63208-b306-4536-b4a6-f014767e2805","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.345041Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:a73ab3c7f7e4c05ba74ee5b431c5833b311d9fcca2f65cbba991ea83680a59fe","observation_id":"cffd3c23-bf87-4e5b-a3c6-4e63e3116661","resolution":{"observed_at":"2026-08-07T10:53:38.574119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.332020Z","title":"Turn-taking and backchannel prediction with acoustic and large language model fusion,","venue":null,"work_id":"b2ff1c3c-d737-4c11-86d4-57c367b25b07","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.427059Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:8db1a4a291cdee95d6d22cedde93b9d1ce60c006bb15423131f8c8a312c74826","observation_id":"27f3612d-ddcc-497f-9b80-59a3d55a0de0","resolution":{"observed_at":"2026-08-07T10:53:38.412562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.200391Z","title":"Predictive turn-taking: Leveraging language models to anticipate turn transitions in human-robot di- alogue,","venue":null,"work_id":"fca6d5d0-3db9-4e29-a6d1-e13088794bfe","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.524622Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:0d8ab8f59951a045f969a35623830f654db62c92f8e13270ce735587464a6926","observation_id":"ee2159a5-e41e-429c-b0ab-71b5bfd41980","resolution":{"observed_at":"2026-08-07T10:53:38.272095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.058003Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":"227f5a41-2262-49b7-aeb3-777c51feba37","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.597594Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:0eab4b029c54da235ede0e359094f3d55e69869a26b5e9fcb679d7f574008f90","observation_id":"319c46e6-58d3-46f3-b227-99ef7960d4b4","resolution":{"observed_at":"2026-08-07T10:53:38.118055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.888283Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"ce1af014-3f72-424d-8ca8-9164e1ec45c4","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.663036Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:eb3a40dc456c25000ee607c774c67ef51230f56a905581746909c558b3d1d703","observation_id":"38d5a649-549b-4ec6-bb89-2e1661e190ac","resolution":{"observed_at":"2026-08-07T10:53:37.955757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"answer/1527489","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.368131Z","title":"[Online]","venue":null,"work_id":"88a79299-c7e3-40af-adc8-939d407eae9b","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.737389Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:6e80ec45c4f48afc15f405a75282ec42dd424f0c6968b430365022d2b6ad3661","observation_id":"ca140c6e-e660-48da-9588-d30903dab38a","resolution":{"observed_at":"2026-08-07T10:53:35.452694Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.729216Z","title":"[Online]","venue":null,"work_id":"8a293106-7828-4387-8a3f-d7ccf64667a4","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.808721Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:0c1a6d5f1e77c0fbfac052ff6a8f458a77a693fa333ad8c8723f657e587f8902","observation_id":"ec01cbc1-9b8f-4645-8879-73d67df253f6","resolution":{"observed_at":"2026-08-07T10:53:37.793002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.524736Z","title":"Real-time and continuous turn-taking prediction using voice ac- tivity projection,","venue":null,"work_id":"b7d72d76-c9a4-41a6-997d-d2eadde4c1d0","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.886558Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:637d6e6793dd91b9f18218969647430157b20d8dc6e3636c51f9565448b6aaab","observation_id":"881446a4-fe91-4cae-9141-96ada48bfbe2","resolution":{"observed_at":"2026-08-07T10:53:37.615970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.359785Z","title":"Multilingual turn-taking prediction using voice activity projection,","venue":null,"work_id":"72fa665e-8517-4cbc-80ea-aee3c78216fc","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.981132Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:a92c73da2d95a33cdef5ef7efcbd1b51c0eaf9da11d83323522466e44ae800b8","observation_id":"3fc479d7-856d-45ad-b697-8ddd0a9c8624","resolution":{"observed_at":"2026-08-07T10:53:37.419432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.216015Z","title":"How much does prosody help turn- taking? investigations using voice activity projection models,","venue":null,"work_id":"45acf2f8-1636-4048-9037-7d28967c9dc4","year":2022},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.064405Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:754d70ce79e1b9bd5860c8fbf9828066e9c7f6cf68c5db84fe393e4bc6134b31","observation_id":"e17c12c0-735c-4ac2-b140-e657a73e465a","resolution":{"observed_at":"2026-08-07T10:53:37.283172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.054926Z","title":"OpenFace: An open source facial behavior analysis toolkit,","venue":null,"work_id":"851cf791-4a17-425c-84da-cfd3851a9cda","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.136834Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:3e09ff6d1b264126660abcadf714d32754965f26acee456763cc5db459256e56","observation_id":"2e2e21d0-e993-4a8e-a422-81c281be1e99","resolution":{"observed_at":"2026-08-07T10:53:37.094480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.908853Z","title":"Open- pose: Realtime multi-person 2d pose estimation using part affinity fields,","venue":null,"work_id":"cdd3baf3-20c9-42ae-9614-bd6eec80d173","year":2021},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.203584Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:300a9f1b26fbd0c93e7d641f74c597a042eb7e4ea9b89d60f320723a00e580c3","observation_id":"0a9cae1f-8d18-410a-888c-8affc0869fb9","resolution":{"observed_at":"2026-08-07T10:53:36.970605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.739294Z","title":"Former-dfer: Dynamic facial expression recognition transformer,","venue":null,"work_id":"6b866412-e44a-48e4-8413-cfba74017713","year":2021},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.268089Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:08441576d3dfc2a327695ccf0686d0871881e6af3dc42df12ae107303ca5ce88","observation_id":"e6fd51c1-dc02-4a73-b9ac-86fccdf24ffa","resolution":{"observed_at":"2026-08-07T10:53:36.817813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.520850Z","title":"Unsu- pervised pretraining transfers well across languages,","venue":null,"work_id":"686b89ff-e47b-43f0-b4a1-aab8f3b9cd42","year":2020},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.338299Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:7b8ababbb45dcb7736ec6cd463f377ee3b6f2c8e8be04d7fc76662b7dcce06f2","observation_id":"4d281b4e-0199-4e08-b775-6c119c49253e","resolution":{"observed_at":"2026-08-07T10:53:36.605534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.386645Z","title":"Dlib-ml: A machine learning toolkit,","venue":null,"work_id":"1a9b7cb8-6727-408a-8b06-9f8656d95d73","year":2009},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.416269Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:e4c385408f64f30e89958a4c5eb0b3a6d6f8ab67c9288b8eb889e776fb7333e6","observation_id":"55d37418-757f-4d48-ba23-cd3102fd6f51","resolution":{"observed_at":"2026-08-07T10:53:36.456539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.217780Z","title":"The NoXi database: multimodal recordings of mediated novice-expert interactions,","venue":null,"work_id":"a1eed5d8-af76-4a16-9970-fb72387b7e60","year":2017},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.513926Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:cee82303a3dc2d6a913a735059790a6600db47faacaadafb9c9c36f32b6cd9c4","observation_id":"0f56658d-9e42-4ba9-923b-fac07bf14a51","resolution":{"observed_at":"2026-08-07T10:53:36.282903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.077382Z","title":"PyTorch Lightning,","venue":null,"work_id":"90077add-c826-4e40-a16e-60ebd8013872","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.593139Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d90b89961f3ce37b29e41589cfa5359dabbca10a2df71627065bf669796a0537","observation_id":"4cdced7e-395a-4d45-a249-982e7f1df638","resolution":{"observed_at":"2026-08-07T10:53:36.137530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15327973rlsi2803","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.091724Z","title":"Discourse as an interactional achievement iii: The omnirelevance of action,","venue":null,"work_id":"0fcf4e53-7eba-42f9-bc3d-3b599662166b","year":1995},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.751806Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:437d3986eade36689ac248967f3cf09b243c1d27968d551ae4b0888542f051c4","observation_id":"73512c0f-2b7e-4b8b-9385-91b48365d77a","resolution":{"observed_at":"2026-08-07T10:53:35.150121Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.752652Z","title":"Between and within: Alternative sequential treat- ments of continuers and assessments,","venue":null,"work_id":"d43a7f93-d204-4f26-a227-4d1e8b6b3559","year":1986},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.819433Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:11eaa8c31b97aa5e80425701f5e63c136a019361b637a141c328eb9ee6153c32","observation_id":"eda6959a-4dde-4ea0-ab68-e3e9ac2710a4","resolution":{"observed_at":"2026-08-07T10:53:35.828855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.596897Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":"63a17816-bc2d-44e7-8aa9-3fac2d3f6a7d","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.901221Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:4898cc0e2f8a8ccb1edc976cf71fbb2782dd3c1022218289139d7a5d4ae18810","observation_id":"5ab26f48-cf14-4575-a333-2892af7ef0f5","resolution":{"observed_at":"2026-08-07T10:53:35.653190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.933147Z","title":"Available: https://github.com/Lightning-AI/ pytorch-lightning","venue":null,"work_id":"774e168a-44e7-442c-882c-24c84ba71a12","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.665269Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:cd13edfa4c388554ae2712c77727f479cd4e3edb623ee72ec8c32b4269ad10d0","observation_id":"fba6514b-15e3-4dd3-90ba-c469c37b185a","resolution":{"observed_at":"2026-08-07T10:53:35.986850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T01:40:32.585253Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":44},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2506.03980."}