{"as_of":"2026-08-09T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ee537354a6e5ba2699ad7f24e3e20c9635fa535009d5a85779799d4b9090fd1","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T15:07:52.715880Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07294/citation-record","integrity":"/paper/2607.07294/integrity","json":"/paper/2607.07294/citation-record.json","paper":"/paper/2607.07294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.351551Z","title":"A Simplest Systematics for the Organization of Turn-Taking for Conversation,","venue":null,"work_id":"a2ea2e09-eb82-4f40-a6b4-5356354fb638","year":1974},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b7445f872e260ad3d1afbe301b226efaa479b68dcd307f5c5185934c8f593b95","observation_id":"0282f24d-3551-4817-bef1-7b320ee434d1","resolution":{"observed_at":"2026-07-09T15:16:18.352789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.357253Z","title":"Palinko, L","venue":null,"work_id":"02d16668-9d81-49ef-929b-05264ccaf614","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:8a763bf357197d577712e030bc4847462b2f9f2d2dcf9c96e2c26e0c98e6aabc","observation_id":"f9129915-712f-4024-8910-f406a887bc7c","resolution":{"observed_at":"2026-07-09T15:16:18.358292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.389544Z","title":"Towards improving turn-taking in social robots using Visual-Only V oice Activity Detection in multimodal dialogue systems,","venue":null,"work_id":"9c685621-e866-4e53-b0a8-e7cac1793e84","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:3cde5d34ca1ac45629a277ef51c1bef40f335dc2bca067ca489fe5b78e4c72f8","observation_id":"52b7dab9-f39a-45be-b973-b72343cca828","resolution":{"observed_at":"2026-07-09T15:16:18.394045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.366623Z","title":"Design of Social Features for Robot-mediated Cross-cultural Interaction,","venue":null,"work_id":"0c96326c-0e03-4ceb-b5d2-383b70d7f1f7","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:2a8e34ab464fc61d543de022314028ee634ca09f3cc34bb794b9eba7468290be","observation_id":"b62a8dfb-9685-4f45-81b0-e8c88c2bdb24","resolution":{"observed_at":"2026-07-09T15:16:18.367807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.374631Z","title":"Haru in the Care Network: Stakeholder Perspec- tives on Privacy with Social Robots in Pediatrics,","venue":null,"work_id":"d7e2c007-a26e-4e00-8998-644903e0d43f","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:d94d9275e4115832fb4fab04a8fc789e2f70c6971f43ab108c8e35b8945181b2","observation_id":"87a5e57a-9755-4805-aaad-905ec97166d4","resolution":{"observed_at":"2026-07-09T15:16:18.376031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.344289Z","title":"Building Friendships Across Borders: The Role of Social Robot Haru in Children Group Communication and Con- nection Development,","venue":null,"work_id":"7353cc21-0709-4d3e-a1fe-6e1b2401c371","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:18f0302ed5cb12482dba5cb40ef461c33b93dbc5063e1025609f124150ec1992","observation_id":"ea58cff9-99f7-4cdd-bba2-b13bef42da12","resolution":{"observed_at":"2026-07-09T15:16:18.345600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.361283Z","title":"Multimodal Transformer Models for Turn-Taking Prediction: Effects on Conversational Dynamics of Human-Agent Interaction During Cooperative Gameplay,","venue":null,"work_id":"8b15a164-bf30-462f-ba8a-16c43b8d2818","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:bcfe22158d70cfd13d0ae4277e4bd32b5d048296dec385d2e4b03df48d0f2fb6","observation_id":"db4b203d-461d-42bc-b452-13de60bc5d7d","resolution":{"observed_at":"2026-07-09T15:16:18.362684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.359037Z","title":"When and How to Express Empathy in Human-Robot Interaction Scenarios,","venue":null,"work_id":"60ded721-8965-4529-91ae-e7f176f6a0c3","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:59e713384e06cdfbf0a6f9832cf95a7233fbebd40b9c07af7dc5943ca6bda229","observation_id":"68bb76cc-eb5f-459f-88f5-3ad4ac8d6b12","resolution":{"observed_at":"2026-07-09T15:16:18.360215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.178920Z","title":"Visual Cues Enhance Predic- tive Turn-Taking for Two-Party Human Interaction,","venue":null,"work_id":"a3df7aef-43e0-477f-8a61-b2c78e2eb068","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:60acaccd5ca498b0383f164516e599ee9dbf82319ab980dc56c63f05fa2c3fb6","observation_id":"73e92f35-0e57-4eba-8dd0-72374184aaf6","resolution":{"observed_at":"2026-07-09T15:16:18.180515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.381719Z","title":"Turn-taking in Conversational Systems and Human- Robot Interaction: A Review,","venue":null,"work_id":"90f2f264-0268-4b9e-8fe5-7406e00e6bef","year":2021},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:6124a14cdf678624954dfd8dc39e443f91b7764bdfdecec676d1e1ee42422c6a","observation_id":"fa1a4aef-7966-4b6b-a468-8273d5052685","resolution":{"observed_at":"2026-07-09T15:16:18.382925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.355397Z","title":"Data-driven models for timing feedback responses in a Map Task dialogue system,","venue":null,"work_id":"642ed8f7-660c-43ff-9167-ccce08048a5e","year":2014},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:51925688ef4338c53ffe8725f427ee9726c4d10e967e14759f86155ca8e9ba3a","observation_id":"9466d6d4-c7cf-44d1-8baa-558880af1735","resolution":{"observed_at":"2026-07-09T15:16:18.356589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.401827Z","title":"On temporal aspects of turn taking in conversational dialogues,","venue":null,"work_id":"fa287ba3-d7de-4646-be90-a8d56d2f56b2","year":2005},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:70c2e920d91631241fa34f60910d83275680fa4d4508d1e9ec2c1879fb2172b0","observation_id":"147ab622-c0ef-4294-83e1-e929682a9059","resolution":{"observed_at":"2026-07-09T15:16:18.403311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.383628Z","title":"Turn-Taking Modelling in Conversational Systems: A Review of Recent Advances,","venue":null,"work_id":"60e24beb-5ee2-4267-ab4b-921dfaeb3e1e","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:84d169a162dac8f6b43d138b5c11c8e73b335e39527ae149158540e5b3ea471f","observation_id":"5a3cfe38-9e60-465c-8841-10c1474ca5f6","resolution":{"observed_at":"2026-07-09T15:16:18.386459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.387140Z","title":"Pauses, gaps and overlaps in conversa- tions,","venue":null,"work_id":"01eab645-e383-4004-8717-f32ffdac78aa","year":2010},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:08f25c9698d0624f73179d8e94123b0efe7979e246448c83f97302a9ffa6b018","observation_id":"ad296677-e421-4ec5-a49f-bad88b7a66d7","resolution":{"observed_at":"2026-07-09T15:16:18.388335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.399465Z","title":"Timing in turn-taking and its impli- cations for processing models of language,","venue":null,"work_id":"0ab245ba-2c30-4954-b776-e81b51b5b8ee","year":2015},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b90e21d473fdd92f9fa8b54f5296adb7f45e2f1345d6cee871109794fe3a85f8","observation_id":"1782f32b-0171-4208-a4ca-efc617d8e4a3","resolution":{"observed_at":"2026-07-09T15:16:18.400964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.379078Z","title":"Timed picture naming in seven languages,","venue":null,"work_id":"93fa5f86-cfef-442f-91d4-5fcba65a7c58","year":2003},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:a31927403051fb47ea6f0f40233845545b0c7347f16ce29a39c18ebb7b10f99c","observation_id":"52335817-0e8d-4365-930c-919e49bd33b4","resolution":{"observed_at":"2026-07-09T15:16:18.381221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.375882Z","title":"Multimodal Turn Analysis and Prediction for Multi-party Conversations,","venue":null,"work_id":"33551fa8-905e-4b69-b696-8d3ca2a6e25a","year":2023},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b9a97786a77eef2da0ab7e4fb5122ec24202f0e12dd37669b57ec9f6136a35b4","observation_id":"a5cecb58-38eb-49ad-a568-5d9f1e1f671d","resolution":{"observed_at":"2026-07-09T15:16:18.377072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09812","last_updated":"2022-05-19T19:16:45Z","snapshot_observed_at":"2026-08-04T00:11:32.581547Z","submitted_at":"2022-05-19T19:16:45Z","title":"Voice Activity Projection: Self-supervised Learning of Turn-taking Events","version":1},"cited_work":{"arxiv_id":"2205.09812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.09812","snapshot_observed_at":"2026-07-09T15:16:18.176205Z","title":"Voice Activity Projection: Self-supervised Learning of Turn-taking Events","venue":"eess.AS","work_id":"568c50a9-34e4-4fd8-b188-73c782c6b7f7","year":2022},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2205.09812","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:11a24efc9752e06a4a0a156591de1e9f8740432425faeecffea4f5e5167839fe","observation_id":"4bc0f3d5-efba-410c-8251-d83d4b2439f7","resolution":{"observed_at":"2026-07-09T15:16:18.178117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.373848Z","title":"Multimodal V oice Activity Projection for Turn-Taking and Effects on Speaker Adaptation,","venue":null,"work_id":"74400d35-f7bc-47ab-acb0-f1fb4aa93166","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:c60cd31e460c1f9c92b673dfb965cd3960ad1a4d2db3e6da043ab166b8f259d3","observation_id":"8ccd277d-0bec-4730-98fa-10db1f7dcc45","resolution":{"observed_at":"2026-07-09T15:16:18.375030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":"2506.03980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-07-09T15:16:18.173817Z","title":"Voice Activity Projection Model with Multimodal Encoders","venue":"cs.CL","work_id":"137ee5f4-6e4a-48ca-abf3-b3fa511446e7","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:f35eda28a5d463380969468d7b3bcd453583e702a538f00d66fcc06e914f8e7f","observation_id":"470d4985-fcdd-40ae-960d-58c68db749cc","resolution":{"observed_at":"2026-07-09T15:16:18.175063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12654","last_updated":"2025-05-20T06:59:31Z","snapshot_observed_at":"2026-08-07T15:43:31.293284Z","submitted_at":"2025-05-19T03:08:30Z","title":"Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual Signals","version":2},"cited_work":{"arxiv_id":"2505.12654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12654","snapshot_observed_at":"2026-07-09T15:16:18.185554Z","title":"Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual Signals","venue":"cs.CL","work_id":"938ecc02-c69d-469e-b869-f6d686888439","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2505.12654","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:804f0458ac6a9f403564eead0dbd7ccb0e5d31c0d54c99c9e759747b6519a7d6","observation_id":"4ad90fe7-4bca-4639-8d5a-dc3befd6f0f8","resolution":{"observed_at":"2026-07-09T15:16:18.187022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.08454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.188248Z","title":"Behind the scenes: Mechanistic interpretability of lora-adapted whis- per for speech emotion recognition","venue":null,"work_id":"e8df674d-80e0-4ffc-a176-07bb417f5d85","year":2026},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5121472648ae52279088dda3ae65c3565ea0160d4f675e0ae5b0121aa044b029","observation_id":"8e2c3d74-7b8b-46de-84b1-d06f7598c9ca","resolution":{"observed_at":"2026-07-09T15:16:18.189958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.379842Z","title":"GRPO- Guided Modality Selection Enhanced LoRA-Tuned LLMs for Multi- modal Emotion Recognition,","venue":null,"work_id":"a99d27bb-006c-49ab-acf0-ff92f88de7ba","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:4acc7fa39b0d2793c47ab818c35bd1fd1563ed7b37d9b73974a758f0bb5459ee","observation_id":"81a4e9cf-4fcc-43ee-8751-69b055435dd9","resolution":{"observed_at":"2026-07-09T15:16:18.381415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.395021Z","title":"LoRA- Whisper: Parameter-Efficient and Extensible Multilingual ASR,","venue":null,"work_id":"fec31fe2-de6a-4532-911f-2edd84c86afa","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:2614ab7fe48de85ea0f7ae3622d610baac1dcfa03eba30a9a689c633a762615c","observation_id":"5ffdd3e1-feae-44d4-8b2e-af516f9e1ffa","resolution":{"observed_at":"2026-07-09T15:16:18.396659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"cited_work":{"arxiv_id":"2506.14427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14427","snapshot_observed_at":"2026-07-09T15:16:18.188094Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","venue":"eess.AS","work_id":"db36c197-ca04-42f0-bb53-7e219303e575","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.14427","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:eebcaad16ad050a7dd219c600b913917bbeae872d6207c0e9352d082e47310ee","observation_id":"627f9364-7480-480c-a8e3-e381cc071047","resolution":{"observed_at":"2026-07-09T15:16:18.189364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.370237Z","title":"Multimodal Large Language Model with LoRA Fine-Tuning for Multimodal Sentiment Analysis,","venue":null,"work_id":"a263572a-ce66-4b87-8f22-cf69e15c6907","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:da4b68647f4e95f1879a7b011c9f3f298c25d99982e912c5697eeb03da6b533c","observation_id":"60165d4b-3bf1-426a-abff-8715198e1dab","resolution":{"observed_at":"2026-07-09T15:16:18.371418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09617","last_updated":"2024-06-13T22:52:07Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T22:52:07Z","title":"Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection","version":1},"cited_work":{"arxiv_id":"2406.09617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09617","snapshot_observed_at":"2026-07-09T15:16:18.190721Z","title":"Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection","venue":"cs.CL","work_id":"00266656-3e59-4ffc-a94e-1ffeddc486d8","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2406.09617","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:a7107ee2e40875a4576cee82baa38234f683f4c971c7d705e95ec1d9ac986088","observation_id":"e56bc495-1146-412f-a0d5-7d6b5ef30de5","resolution":{"observed_at":"2026-07-09T15:16:18.192224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.371998Z","title":"Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection,","venue":null,"work_id":"a5199271-2ffb-400d-912b-e09175d9b663","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b26a08bcd1adfffc9be86020477a565af7c9469ce9b39fcce23c3d480818e11d","observation_id":"4692176c-5662-45d6-b5ac-c5fa00ca9c1c","resolution":{"observed_at":"2026-07-09T15:16:18.373311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.338460Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":"045e8a03-8d04-4678-9314-6b8bff6f0f07","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:d398809dcf5f0e9a98b657f3b9fe13fd136c79936b7516ed0368571ca207e8fd","observation_id":"a6bd654a-fe3d-425b-9f65-b98a84a59c74","resolution":{"observed_at":"2026-07-09T15:16:18.339998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06592","last_updated":"2021-07-25T15:00:51Z","snapshot_observed_at":"2026-08-05T01:33:12.418999Z","submitted_at":"2021-07-14T10:30:34Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection","version":2},"cited_work":{"arxiv_id":"2107.06592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06592","snapshot_observed_at":"2026-07-09T15:16:18.182832Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection","venue":"eess.AS","work_id":"70d87ecf-ea91-43f5-a9a8-0fb9dc3cbd49","year":2021},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2107.06592","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:bc5892b33d16dcd1163fa81e1629a83735a64c736325fea171b966326ff4ac42","observation_id":"8823cca0-f77c-4553-b411-afb1410635fd","resolution":{"observed_at":"2026-07-09T15:16:18.184153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-06T10:43:10.885641Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":"2406.10082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-07-09T15:16:18.164748Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":"eess.AS","work_id":"ec617c61-bff7-4e12-9684-b5312ec20fd0","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:ed583e7099daa2df839f01cf6f9a13348e2df51ae7e92a8ea7f283747ddd6bff","observation_id":"f39153ad-0790-4acc-a295-d007ff5aaa2a","resolution":{"observed_at":"2026-07-09T15:16:18.166295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.193587Z","title":"Triadic Multi- party V oice Activity Projection for Turn-taking in Spoken Dia- logue Systems,","venue":null,"work_id":"cd1ef342-754f-4e89-b12f-24c23bfece5b","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5101164a33fa740030e1cf78ba80425bf87dba5dd15121868209c8d478ffe013","observation_id":"9eef50a1-4531-47c6-904d-92b43f8c6444","resolution":{"observed_at":"2026-07-09T15:16:18.195382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.362507Z","title":"Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of V oice Activity Projection,","venue":null,"work_id":"68918f5e-7138-4771-a4e1-a0d35b5092ea","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:db829345a38116dfb7dec84c719c9e19d1d2acafa238fcb739e39e789dde7dd2","observation_id":"6364f2d9-d724-4985-9d88-3fbf7c07ef6e","resolution":{"observed_at":"2026-07-09T15:16:18.363896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.364623Z","title":"Predicting End-of- turn and Backchannel Based on Multimodal V oice Activity Prediction Model,","venue":null,"work_id":"366e511b-1534-4e31-8f07-c2e77809142d","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:92088b95de0ce9d85e92f962ac805204689ea8c0e8bdba4351537ea049136701","observation_id":"798ee106-eef7-402b-ad6e-c44d0ada81c3","resolution":{"observed_at":"2026-07-09T15:16:18.365940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.365039Z","title":"Multi- lingual Turn-taking Prediction Using V oice Activity Projection,","venue":null,"work_id":"dabbea92-e02c-44b6-825f-7185b6140f58","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:777cdf820d925d58d84bb6f7f4963ec638d017336b7c211e144b46d428d98528","observation_id":"efab9e88-132a-48c6-bc93-38cca0e4d9a0","resolution":{"observed_at":"2026-07-09T15:16:18.366437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06487","last_updated":"2024-03-14T23:59:59Z","snapshot_observed_at":"2026-07-06T17:42:29.208344Z","submitted_at":"2024-03-11T07:50:29Z","title":"Multilingual Turn-taking Prediction Using Voice Activity Projection","version":3},"cited_work":{"arxiv_id":"2403.06487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06487","snapshot_observed_at":"2026-07-09T15:16:18.173615Z","title":"Multilingual Turn-taking Prediction Using Voice Activity Projection","venue":"cs.CL","work_id":"51646c36-1219-4455-85aa-41fdc296634a","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2403.06487","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:ebeba5e816944a16b2c635ebb79c77e25a77cd1941b13bfa839c82512b672455","observation_id":"deaf6d46-f308-4e15-b733-d528c8ebf0c3","resolution":{"observed_at":"2026-07-09T15:16:18.174784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.351989Z","title":"Investigating the Language Independence of V oice Activity Projection Models through Stan- dardization of Speech Segmentation Labels,","venue":null,"work_id":"7022245b-318b-4f1a-ba33-fe0b53e85089","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:f26ba590e974226acf5a91d05a53de8e6c68d7d0ab8582c3d1ac3eae2599b577","observation_id":"43e6bba6-d75f-40ce-b5e1-dae18d5ae313","resolution":{"observed_at":"2026-07-09T15:16:18.353223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04868","last_updated":"2024-01-10T01:09:55Z","snapshot_observed_at":"2026-07-06T17:13:29.467366Z","submitted_at":"2024-01-10T01:09:55Z","title":"Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection","version":1},"cited_work":{"arxiv_id":"2401.04868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04868","snapshot_observed_at":"2026-07-09T15:16:18.171040Z","title":"Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection","venue":"cs.CL","work_id":"9faf4f1c-b103-4078-9f66-f70c2031cdfe","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2401.04868","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5cd2a690a825e4025904617ec3b27d228a3db81e669bbdf91102dc105157965d","observation_id":"e2e4601e-d5ba-4c72-b71c-0438836b5697","resolution":{"observed_at":"2026-07-09T15:16:18.172565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.348282Z","title":"Applying General Turn-Taking Models to Conversational Human-Robot Interaction,","venue":null,"work_id":"f91d489c-5b2f-45b4-a265-f3130ceb3d76","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:83561406f107b1510fd8caf38c11f2a26719cccb47d93fbcf483e338c4f5c396","observation_id":"15f01bfe-0936-4d00-88a9-dc5b1ca7f709","resolution":{"observed_at":"2026-07-09T15:16:18.349501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.381911Z","title":"A Noise-Robust Turn-Taking System for Real-World Dialogue Robots: A Field Experiment,","venue":null,"work_id":"5e3c9e16-d7b9-4a1f-9821-0f1757f12310","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:796adee54eb4bf368963a74b86b36069dae9c33ba398364828edddd2f843b735","observation_id":"1a211102-c65a-442b-9e0e-168a5460d3fc","resolution":{"observed_at":"2026-07-09T15:16:18.383096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.390827Z","title":"Multimodal V oice Activity Prediction: Turn-taking Events Detection in Expert-Novice Conver- sation,","venue":null,"work_id":"efa802b3-6383-4a60-bb12-b8e7e5436ab5","year":2023},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:4fc24fe759c7e316aa16836242341083466475cbff2ff66732a5ca7a99f20d34","observation_id":"7534f11c-3d9f-4270-8692-5ce08e54edea","resolution":{"observed_at":"2026-07-09T15:16:18.392045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.360839Z","title":"The NoXi database: multimodal recordings of mediated novice-expert interactions,","venue":null,"work_id":"7e8e06ab-5954-48bd-a1da-743cc3d58f4d","year":2017},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:4405f7c0904644ded7b931b99c115139b15992d220b02d0fd5d336244ebc5108","observation_id":"fbb30dbd-9767-496d-9c1c-d43bcc6e0859","resolution":{"observed_at":"2026-07-09T15:16:18.361970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13726","last_updated":"2024-09-09T18:37:34Z","snapshot_observed_at":"2026-08-01T17:58:02.181107Z","submitted_at":"2024-09-09T18:37:34Z","title":"Multilingual Dyadic Interaction Corpus NoXi+J: Toward Understanding Asian-European Non-verbal Cultural Characteristics and their Influences on Engagement","version":1},"cited_work":{"arxiv_id":"2409.13726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13726","snapshot_observed_at":"2026-07-09T15:16:18.185410Z","title":"Multilingual Dyadic Interaction Corpus NoXi+J: Toward Understanding Asian-European Non-verbal Cultural Characteristics and their Influences on Engagement","venue":"cs.CL","work_id":"ecb26f67-6b55-4a2d-9db8-636f06c55a07","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2409.13726","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:a706618ef12119a1d58faab52fdd33b5666c176f3db1f10b9e75f545a047d84d","observation_id":"20d8a772-8675-41ad-9df8-c90507514cfb","resolution":{"observed_at":"2026-07-09T15:16:18.186867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":30},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.07294."}