{"as_of":"2026-08-11T01:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b52290ca8a824f459c15c9e14db178a98e4b1bb599e656e40048fad2da8d9a2","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:47:14.172217Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T05:37:17.684884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:39.127928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"cited_work":{"arxiv_id":"2506.07081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07081","snapshot_observed_at":"2026-07-03T16:28:39.127928Z","title":"Streaming endpointer for spoken dialogue using neural audio codecs and label-delayed training,","venue":null,"work_id":"b678b14b-c2f1-49b8-b748-379950175030","year":2025},"citing_paper":{"arxiv_id":"2606.13450","last_updated":"2026-06-11T15:09:45Z","snapshot_observed_at":"2026-08-07T20:54:58.764446Z","submitted_at":"2026-06-11T15:09:45Z","title":"Endpoint Anticipation for Low-Latency Spoken Dialogue","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T05:37:17.684884Z"},"links":{"cited_paper":"/paper/2506.07081","citing_paper":"/paper/2606.13450"},"observation_digest":"sha256:048f1bde51791b6f7a523d85fee08d87040d214aeb7f8753262a0286967e44a1","observation_id":"1f8ee3e4-80fe-4a9d-bb4c-5c66b4c1ee93","resolution":{"observed_at":"2026-07-03T16:28:39.129488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07081/citation-record","integrity":"/paper/2506.07081/integrity","json":"/paper/2506.07081/citation-record.json","paper":"/paper/2506.07081"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:47:11.320572Z","title":"WavChat: A Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.320572Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:89fcaca3048180a109035ada982c176f4bdd14acf278bd4f01598b0c36669217","observation_id":"44080555-c607-49e4-a760-a70df34c9de0","resolution":{"observed_at":"2026-08-07T05:47:11.320572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.901446Z","title":"A review of subjective scales measuring the user experience of voice assistants,","venue":null,"work_id":"00f9dc16-c0f0-4f79-8614-8918f2f2619f","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.409467Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:8d3a01825a7acd54d888e7f0fdadd5504d2cc22a7c10a59d8e0f39b7b766b15e","observation_id":"1ca75ee5-98f1-49b8-9bce-9eed04c1a35a","resolution":{"observed_at":"2026-08-07T05:47:19.964681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:47:11.481844Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.481844Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:3f14e35aa5becaf87f02049a9cb49bf7a9624c6c5848b6577513cc46a4cb761b","observation_id":"54c688bf-1a8f-4aa7-8334-91adfada3c3c","resolution":{"observed_at":"2026-08-07T05:47:11.481844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.748290Z","title":"OpenAI-gpt-4o,","venue":null,"work_id":"01759794-3f22-464d-9c38-693ffec4ce21","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.526889Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:65108975d86b165f1a9c22e5110578b4435200975f56388e4ad4130a351a3014","observation_id":"0f0da420-5713-49ff-9605-d978e32a8c85","resolution":{"observed_at":"2026-08-07T05:47:19.794138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.625100Z","title":"Improved End- of-Query Detection for Streaming Speech Recognition,","venue":null,"work_id":"bda23181-c699-486c-abed-4bb86ba321ad","year":2017},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.656767Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:e3f12cb876d86aa3ee70ae392cf1ed40148f8e94f6efc3b22e6cae18b9b5b0d3","observation_id":"261a5a25-60ab-49de-b987-497f08b38a76","resolution":{"observed_at":"2026-08-07T05:47:19.682409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.466778Z","title":"V oice activity projection: Self-supervised learning of turn-taking events,","venue":null,"work_id":"9f8f0f17-ac94-4a9e-8603-6b3605ff5a61","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.711258Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:0134d98e3dd7dd031b074c3969cce5ca4c0754d07243d7583a44576ad0ab8a2b","observation_id":"be2a5081-a9d9-4e68-9d62-720bfb6fda20","resolution":{"observed_at":"2026-08-07T05:47:19.539409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.328977Z","title":"Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics ,","venue":null,"work_id":"ef988107-5d59-449a-981f-a3d6b70647c0","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.779580Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7580c734fa448725c448e0f8695edc43039b0a1c913a11e86577afaeb0224b9f","observation_id":"651c22f7-0f2f-4f6f-842d-169ef6f7cf64","resolution":{"observed_at":"2026-08-07T05:47:19.396827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.186213Z","title":"Root causes of lost time and user stress in a simple dialog system,","venue":null,"work_id":"030f6af2-36da-4548-a3ad-0d8e68e29703","year":2005},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.855592Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:ed95ea435e95f11ccd1427c2fe668c5d231f888633535d8041883b30556ff1f4","observation_id":"bf9ee3b0-9255-4331-84b8-4392ca4b0ce8","resolution":{"observed_at":"2026-08-07T05:47:19.274468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.041070Z","title":"A statistical model-based voice activity detection,","venue":null,"work_id":"d62b8b59-c0cf-454b-94c2-2614c9eaee43","year":1999},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.946892Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:f0453b4560bef6c14ea1283a6300af10e3db34ad86682b8354809fcc9e909909","observation_id":"96915e7a-187b-4b5b-b6f9-52620342af30","resolution":{"observed_at":"2026-08-07T05:47:19.096855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.885244Z","title":"A Convolutional Neural Network Smartphone App for Real-Time V oice Activity Detection,","venue":null,"work_id":"84438af8-9e12-4425-90a7-3551e8a60181","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.001979Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:f06d1d829980114fa36a4ace9b43e8a18bd2663e10d49a756ab3e58a4d6b3bda","observation_id":"1f4f2787-25e3-4410-b0d1-4d46fba5cc3d","resolution":{"observed_at":"2026-08-07T05:47:18.965610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.699160Z","title":"Temporal modeling using dilated convolution and gating for voice-activity-detection,","venue":null,"work_id":"341caf2f-137b-44f9-b7ec-bf33761907a5","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.092752Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:bcd97afa25d2bc872bdd5ffbf714b4ff81f81dd963a0a8ce1fe8a73d27c90d3c","observation_id":"b96e219c-d423-4ddf-9bd5-d3b65f4c9073","resolution":{"observed_at":"2026-08-07T05:47:18.753204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.557842Z","title":"Robust end-of-utterance detection for real-time speech recognition applications,","venue":null,"work_id":"e38b7fa4-6d4e-41f1-a50f-202a8149556f","year":2001},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.157555Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:15ae943d5e802ccf5c44261ffc87a1709e9470088e3c946d3f6ec46a5a19b546","observation_id":"7ad4af9c-0153-444c-8f67-863e23fd20bd","resolution":{"observed_at":"2026-08-07T05:47:18.629364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.387355Z","title":"Combining acoustic embeddings and decoding features for end-of-utterance detection in real-time far-field speech recognition systems,","venue":null,"work_id":"5548b1cc-3a7d-4291-9e46-abc05976253a","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.248057Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:ad6b38b3e67db1e305e2bbe3505383def60f66e9b5af5f0ac3bc6012a040475b","observation_id":"f50f5b3e-03d1-4f6b-8d10-1ec217bbbdf2","resolution":{"observed_at":"2026-08-07T05:47:18.503583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.244971Z","title":"Dynamic speech endpoint detection with regression targets,","venue":null,"work_id":"b174cb09-2278-461f-8b33-377347713226","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.341985Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:1fb55f1ed5c787b8f2c731f014fec64e2486a88e9025983ab5f5505f38a51b41","observation_id":"5dc9aed4-5c79-4292-830b-050f5772222d","resolution":{"observed_at":"2026-08-07T05:47:18.308518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.049355Z","title":"SoundStream: An End-to-End Neural Audio Codec,","venue":null,"work_id":"1c470453-aaab-402e-8494-82ad8c8bff6d","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.410195Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:aa09292be6e0967f8e8947ebb11b4c9b63b78e5a108f9714e54f7ea6de7c03c2","observation_id":"b86fa938-e980-45c9-a34f-227472dbd7e5","resolution":{"observed_at":"2026-08-07T05:47:18.141871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.911058Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":"f87de819-73cb-4398-9c00-d7cc8c46a0d3","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.520620Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:f66847bcd8b310140f4f9c54ea4fec9daa6976c58f705217066cd3260d0c57f1","observation_id":"34bd2dc7-2de0-4b9d-a23b-3ffbca6bbfe4","resolution":{"observed_at":"2026-08-07T05:47:17.978334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.722841Z","title":"Audiodec: An Open-Source Streaming High-Fidelity Neural Audio Codec,","venue":null,"work_id":"4ac5efdc-d987-4e7f-8da0-72a216e0caf4","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.585964Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:99d90375a9bd4f9cc9d11ee51681c2510e88ea5c426e7fcda69137bd580a205a","observation_id":"17e1c7d0-bc0f-4cfc-81f8-2d25bb286c4e","resolution":{"observed_at":"2026-08-07T05:47:17.830311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T05:47:12.652698Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.652698Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7ed0344a77bc9733e1c1692585eea2cf8e5f74e62f1778ae4a62c1693ae53eb7","observation_id":"9d41f697-b6d7-4954-95f6-dc506c121022","resolution":{"observed_at":"2026-08-07T05:47:12.652698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.556038Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models,","venue":null,"work_id":"8d4ab7f2-1c1d-4b00-b5d9-0772ad2468a7","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.704887Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:b85603d3f31972f80dcbbeab190a355a52b7f545295865584427421255fcdffc","observation_id":"a363b232-9cb9-456b-9fd4-f460d74c6255","resolution":{"observed_at":"2026-08-07T05:47:17.616111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15897","last_updated":"2025-02-24T18:34:41Z","snapshot_observed_at":"2026-07-06T19:21:03.775247Z","submitted_at":"2024-09-24T09:16:11Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","version":2},"cited_work":{"arxiv_id":"2409.15897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15897","snapshot_observed_at":"2026-08-07T05:47:14.348285Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","venue":"eess.AS","work_id":"9a63511b-6dcb-4119-aabe-067e438be83d","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.794875Z"},"links":{"cited_paper":"/paper/2409.15897","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:6db37eff2cdbb6953df504e071ad15f512fa434d991c128d4be5b49f20f286e5","observation_id":"6595c748-2f80-4c2f-b947-401edb609c36","resolution":{"observed_at":"2026-08-07T05:47:14.407787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.374186Z","title":"Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations,","venue":null,"work_id":"0fa7dd06-d2e6-41f1-a7fb-a7d7d4313bc8","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.857921Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:0126664fb809fd61d48296c5175cc2b9f9e0bdc2c09603a13aa13e4f89cd2237","observation_id":"eae1316f-4479-4d94-9707-99e0bbf49b08","resolution":{"observed_at":"2026-08-07T05:47:17.453168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-09T04:52:56.160863Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-07T05:47:12.941618Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.941618Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7877d7484d6bf3d857449a7b931c0b6177daed75dc9245a30decdccaba7f16b8","observation_id":"9893ded1-943e-47cd-b054-faab046ad98c","resolution":{"observed_at":"2026-08-07T05:47:12.941618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:13.003105Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.003105Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:75ce98bad0fe558a051bb6f00520a203107dd44c9826c4ca77b7721a292d6c91","observation_id":"63e01f50-c2ee-408e-a658-eb4bf3d9617c","resolution":{"observed_at":"2026-08-07T05:47:13.003105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04752","last_updated":"2024-09-24T07:40:54Z","snapshot_observed_at":"2026-08-09T14:52:54.109637Z","submitted_at":"2024-05-08T01:40:13Z","title":"HILCodec: High-Fidelity and Lightweight Neural Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04752","snapshot_observed_at":"2026-08-07T05:47:13.130003Z","title":"Hilcodec: High fidelity and lightweight neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.130003Z"},"links":{"cited_paper":"/paper/2405.04752","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:509a3c28c6d1bb58076041b3ce16328ad694708982f44200a53841fa1dfec597","observation_id":"6a621974-0784-420e-8bea-cabd6897ef01","resolution":{"observed_at":"2026-08-07T05:47:13.130003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.226496Z","title":"End-to-end speech endpoint detection utilizing acoustic and language modeling knowledge for online low- latency speech recognition,","venue":null,"work_id":"5e81c237-18f2-4e67-a46e-43597ab05fa8","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.214580Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:38f69920c44070b2f0e738ef72bc181eca7f42af3287c4f75c83726384c1df12","observation_id":"abbbbc0c-103e-4429-a95f-dbb4fbdbbd95","resolution":{"observed_at":"2026-08-07T05:47:17.289254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.096028Z","title":"Joint endpointing and decoding with end-to-end models,","venue":null,"work_id":"61be9bd8-44e7-4ed0-8a2a-45f183ba6133","year":2019},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.254678Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:104a93a901cad40302b56f2186df8c9ae0b3515a02ddd2357e40d7d685fe1974","observation_id":"d98b2206-b1c5-4486-9f80-464af49ccf38","resolution":{"observed_at":"2026-08-07T05:47:17.150228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.931376Z","title":"Turn-Taking Prediction for Natural Conversational Speech,","venue":null,"work_id":"c045e9ec-aade-4d1b-8288-d09349e494a8","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.295077Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:5da02137d39394e31fa01d1412726cf69c17772829aadcbfd9f306a93e82bb79","observation_id":"4344bebb-23e6-4ca9-83c1-9f4ab23c83a8","resolution":{"observed_at":"2026-08-07T05:47:16.992507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.797880Z","title":"Towards fast and accurate streaming end-to-end ASR,","venue":null,"work_id":"d24b65c2-6caf-4458-9707-4a8571186d1e","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.378298Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:1ed7ba47e1bd98e5adc4fb1bc7ffc353c3730c576ec9817fe486b12b13c8243f","observation_id":"1aad363c-8c0b-479f-872f-b23e539ee1a3","resolution":{"observed_at":"2026-08-07T05:47:16.879748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.676735Z","title":"Streaming Automatic Speech Recognition with Re-blocking Processing Based on Integrated V oice Activity Detection","venue":null,"work_id":"c7d1ce55-8c2d-4412-9f31-aaea8116df36","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.441465Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:6b8027f9850739aa34ad5e8d162f37349a4ded65bdb09a426c1bef1d7709d7a8","observation_id":"30dea1f6-734e-4b63-899a-fcc8d19ed347","resolution":{"observed_at":"2026-08-07T05:47:16.705567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.566948Z","title":"Two-Pass Endpoint Detection for Speech Recognition,","venue":null,"work_id":"d830338c-77c4-4b31-8575-6a5ff46ead11","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.504091Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:92417a5f93b23ba42071dcce96034977d80e1f5bbd1ec42e03cb1f32a568075e","observation_id":"b5881084-3c11-4493-bfc4-749fdef1cbd7","resolution":{"observed_at":"2026-08-07T05:47:16.631628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.388362Z","title":"Towards Accurate and Real-Time End-of-Speech Estimation,","venue":null,"work_id":"434406b0-1b11-4105-a8a0-15ef19e43f2b","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.535657Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:1a243209c094a612b419cb5fce2f9d3bd2e25d5f0aeae65816de4b3503c3b35d","observation_id":"f50655af-451a-4b4e-9481-990a3529c45f","resolution":{"observed_at":"2026-08-07T05:47:16.506542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.200907Z","title":"Text Injec- tion for Capitalization and Turn-Taking Prediction in Speech Models,","venue":null,"work_id":"0250c80d-d24e-4028-aab7-ee8b22d39b04","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.576137Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:9a51a4e0db79663ccb450fda21476fce4965d11946392700a3cb8d817971dca3","observation_id":"473084b1-adfe-47ea-87a7-353b44ab619d","resolution":{"observed_at":"2026-08-07T05:47:16.264732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.009334Z","title":"Multilingual turn-taking prediction using voice activity projection,","venue":null,"work_id":"032dfcf8-e986-49ff-b8c8-648f4d780b41","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.643938Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:e26aab9e80ece2cd91280fc87d6ee62e1eaa40f117b52d043159f5ef96d20a67","observation_id":"7e73b4fd-9911-40ce-8881-1abafd2b4420","resolution":{"observed_at":"2026-08-07T05:47:16.112289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.854961Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":"8784019c-73cc-4c02-bf73-bb56045fcdbf","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.681171Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:1dca41f8993a48c3e820e24143b8fec7f86e6fa82512db50e225d81b4f014fa1","observation_id":"89e63db1-7533-4c20-be69-3ed56f734810","resolution":{"observed_at":"2026-08-07T05:47:15.914320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.610108Z","title":"Turn-Taking and Backchannel Prediction with Acoustic and Large Language Model Fusion,","venue":null,"work_id":"2f1f648c-090e-470c-8a6e-d56e30369818","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.728539Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:820266f8913717b9bc79e4c59b9d389f7d2af0dc5e78809e242f697d37a795f0","observation_id":"45cbefc9-f0af-4ab9-b512-200a9d8bfa12","resolution":{"observed_at":"2026-08-07T05:47:15.745811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.457185Z","title":"End-to-end automatic speech recognition integrated with CTC-based voice activity detection,","venue":null,"work_id":"a811db4b-a1ff-4510-b4fc-7144200caa74","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.756574Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:6e80ad4a123577574b966589c8fd75743727e9591e066dced7d9af0fd4d5de57","observation_id":"9c4f5350-1927-4723-af50-68fd90cd8876","resolution":{"observed_at":"2026-08-07T05:47:15.537482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.264442Z","title":"Text- free prosody-aware generative spoken language modeling,","venue":null,"work_id":"42d23663-33cc-487d-a9ab-9eca5e394509","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.809131Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:153be21e5a82e02e1d84f4b367f06a2d017e140854a6b799b0068b4818304317","observation_id":"4debdea7-6324-49e2-aece-de6ddf6788b2","resolution":{"observed_at":"2026-08-07T05:47:15.345486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.084652Z","title":"Simple and controllable music generation,","venue":null,"work_id":"599d1838-4ddf-40a0-8a0a-9ac4760881d3","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.835391Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:e62c7bc5ef6084ceae4b21b0f65ff626816e5bec339f637053de07d8e30383c1","observation_id":"dc82655a-cacc-48b4-b0f3-ee6fd9074f98","resolution":{"observed_at":"2026-08-07T05:47:15.129513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.975865Z","title":"SpokenWOZ: a large-scale speech-text benchmark for spoken task-oriented dialogue agents,","venue":null,"work_id":"d75d6e72-3774-419a-ac89-1b3cc2aac28c","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.880359Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:43d3a4206298902c99569b640f1939334d5c7a9030c9d53362a991b9b23a5503","observation_id":"43085501-452b-4b50-97a8-6d7ec417e90f","resolution":{"observed_at":"2026-08-07T05:47:15.062955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:13.921334Z","title":"Silero V AD: pre-trained enterprise-grade V oice Activity Detector (V AD), Number Detector and Language Classifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.921334Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:d016f32bb4f680908db1225bd7c3a9c9ef8d84642a51183c813b061139aba0c3","observation_id":"60401cb3-9b9e-4899-8663-ca7f1a9d073f","resolution":{"observed_at":"2026-08-07T05:47:13.921334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.775705Z","title":"PyTorch: an imperative style, high- performance deep learning library,","venue":null,"work_id":"f33c0814-c753-46c2-afbd-a16b9c3d7344","year":2019},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.960499Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:cbec3c9101cb0a84cdf97c02d1e57f994a4940e94ff3ceedb0afcfbd74373ded","observation_id":"c425acdf-4ba8-4ec4-9a02-d5a7cb25ca4e","resolution":{"observed_at":"2026-08-07T05:47:14.816798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.617999Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"d69e2a7f-6c9a-42a1-8276-abbccecd9e23","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.010240Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:ac3ee2c27403a56568c2e5ee53f0733f6368eb9523e739b63d3f74d0ad8dabfc","observation_id":"fc38f094-28c5-4cad-b465-4167ba175604","resolution":{"observed_at":"2026-08-07T05:47:14.679549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.519760Z","title":"Modeling turn-taking in human-to-human spoken dialogue datasets us- ing self-supervised features,","venue":null,"work_id":"0881b008-6eb3-4930-b543-4de529b0fea3","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.075639Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:4ec20f3dd403f14396c566c7c2a3aed7fc4ee2e4f3a3b97a78a34a4f4bfc9d0d","observation_id":"c25e00e3-6b18-4177-a50b-80c08dcf091c","resolution":{"observed_at":"2026-08-07T05:47:14.564865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14145","last_updated":"2026-06-03T23:58:01Z","snapshot_observed_at":"2026-08-10T06:51:11.473578Z","submitted_at":"2025-02-19T23:15:13Z","title":"LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14145","snapshot_observed_at":"2026-08-07T05:47:14.122383Z","title":"Llm- enhanced dialogue management for full-duplex spoken dialogue sys- tems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.122383Z"},"links":{"cited_paper":"/paper/2502.14145","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:599099b92370f36d72dbd7feb4faad4c1a3b9ccd5e0af24056b1e319d0b566c3","observation_id":"2768c705-0e2b-4bd9-9b30-d63fb9d189e3","resolution":{"observed_at":"2026-08-07T05:47:14.122383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-10T21:03:43.485377Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T05:47:14.172217Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.172217Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:d1097af0cac0d0267318ec1e7ce155da0952cce249ef52f0895ec12792908a64","observation_id":"0c79f311-4e44-4233-a9bf-7396fc98ea25","resolution":{"observed_at":"2026-08-07T05:47:14.172217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T05:27:25.582339Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2506.07081."}