{"as_of":"2026-08-10T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04e1196b209d557461cb08475630c714f1ed91f824b5428c4f52d4379171d25c","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:05.762334Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T15:22:02.107863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:27:34.992590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"cited_work":{"arxiv_id":"2506.01268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01268","snapshot_observed_at":"2026-07-03T03:27:34.992590Z","title":"Ziyang Ma, Yakun Song, Chenpeng Du, Jian Cong, Zhuo Chen, Yuping Wang, Yuxuan Wang, and Xie Chen","venue":null,"work_id":"a44294b6-6149-45bf-a7cb-e22bee426343","year":null},"citing_paper":{"arxiv_id":"2606.09186","last_updated":"2026-06-08T08:23:02Z","snapshot_observed_at":"2026-08-09T19:45:21.918527Z","submitted_at":"2026-06-08T08:23:02Z","title":"DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:02.107863Z"},"links":{"cited_paper":"/paper/2506.01268","citing_paper":"/paper/2606.09186"},"observation_digest":"sha256:e1f54919a523b13bee6c0daf1cd8d1760729f53d1b07db33a5c3e4c9ece0046c","observation_id":"da5bd0c2-fcbc-43ca-b841-79eaff1e1b73","resolution":{"observed_at":"2026-07-03T03:27:34.994077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01268/citation-record","integrity":"/paper/2506.01268/integrity","json":"/paper/2506.01268/citation-record.json","paper":"/paper/2506.01268"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:51:04.534755Z","title":"Dolgikh, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.534755Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:f9817bbbe340637587b0abbeb0d7b4473fed1469894f9563f866bc6168336685","observation_id":"32a3cbaa-6e3c-4ccd-8d56-d375eb2cd755","resolution":{"observed_at":"2026-08-07T11:51:04.534755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:06.459106Z","title":"Accessed: 2025-05-","venue":null,"work_id":"8093cafd-6922-4d1f-bfa7-cd96f45d6971","year":2025},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.645078Z"},"links":{"citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:62daa9f666c34ad6ee3f17c9f6ed80480ea5a56fdbc7ac9c422a20c33f5c69a4","observation_id":"e870a575-637c-4cb0-89dd-7b34b9f23cde","resolution":{"observed_at":"2026-08-07T11:51:06.546358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T11:51:04.785368Z","title":"org/abs/2412.10117","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.785368Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:b9b42499e65ae8f33627da43e9017cf825d5335c22773271b61f507497a430ba","observation_id":"f51b11e8-a651-4abc-bf39-f27f8dfcfc3c","resolution":{"observed_at":"2026-08-07T11:51:04.785368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:51:04.969756Z","title":"Huang, A., Wu, B., and et al., B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.969756Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:142d0b6d52d5d051c08ca8569443e3f46ca42a83de59ecd17e0f4dd040759e8d","observation_id":"55e7fb72-ac5e-4394-8270-e0ccf9cba444","resolution":{"observed_at":"2026-08-07T11:51:04.969756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-07T11:51:05.063654Z","title":"Huang, M., Zhu, X., and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.063654Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:87eafe4440b851d0d4a7e54ad974bdec59fe20d5eada23d25da43bcdb0dd8c0d","observation_id":"6ddbaed0-c539-4b68-a36e-570db1d8fdfa","resolution":{"observed_at":"2026-08-07T11:51:05.063654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05709","last_updated":"2020-02-28T09:16:35Z","snapshot_observed_at":"2026-07-06T07:52:57.535245Z","submitted_at":"2019-05-13T02:46:28Z","title":"Challenges in Building Intelligent Open-domain Dialog Systems","version":3},"cited_work":{"arxiv_id":"1905.05709","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.05709","snapshot_observed_at":"2026-08-07T11:51:05.951943Z","title":"Challenges in Building Intelligent Open-domain Dialog Systems","venue":"cs.CL","work_id":"c50dd0d9-9ce9-4fb8-a508-ec03ed1088d8","year":2019},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.193145Z"},"links":{"cited_paper":"/paper/1905.05709","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:508fd240e5112e9032d534826a45092dee5a379945f334974531a44ebc71f0ee","observation_id":"1dbb0b01-1b44-4700-92fd-0b66f14ca50f","resolution":{"observed_at":"2026-08-07T11:51:06.043515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:51:05.429002Z","title":"Packer, C., Wooders, S., Lin, K., Fang, V ., Patil, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.429002Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:27e88f91e7a4a1c3f343d50f1d1f8fab7f6f19dc51c11e6c98f5001a345aaeac","observation_id":"01c5194b-dbfc-4ae5-9af7-defd59c3d951","resolution":{"observed_at":"2026-08-07T11:51:05.429002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-09T03:13:16.831626Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-07T11:51:05.571254Z","title":"org/abs/2310.08560","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.571254Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:19853ac215fd3eb0643959de7659b82013ae9d2c7e8e14bb1f249a3d9c2ffdfb","observation_id":"78c27995-59fa-414b-9198-a679498649c7","resolution":{"observed_at":"2026-08-07T11:51:05.571254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12110","last_updated":"2025-10-08T01:46:37Z","snapshot_observed_at":"2026-08-03T02:27:06.991396Z","submitted_at":"2025-02-17T18:36:14Z","title":"A-MEM: Agentic Memory for LLM Agents","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12110","snapshot_observed_at":"2026-08-07T11:51:05.762334Z","title":"Zhao, W., Yu, X., and Qin, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.762334Z"},"links":{"cited_paper":"/paper/2502.12110","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:f63a0169106fc7716b22dd14a5c7a60e3bd2091515c3a8805a414368334e91af","observation_id":"8d44bdc4-d0ee-4ff9-9e65-0497dbcebbf1","resolution":{"observed_at":"2026-08-07T11:51:05.762334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T11:51:04.320683Z","title":"Chen, Y ., Niu, Z., Ma, Z., Deng, K., Wang, C., Zhao, J., Yu, K., and Chen, X","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.320683Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:2735223909ed69acc9f93c9dc39b4c4bca371288f5be46915c80131f3116c2bc","observation_id":"ec703a81-7e0f-4f34-a261-8ffd45324d39","resolution":{"observed_at":"2026-08-07T11:51:04.320683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T11:51:04.888761Z","title":"Grattafiori, A., Dubey, A., and et al., A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.888761Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:5ff538f217b5a6a907ac89287c0293b2e0bfb08a98b9749df133e6e6deb795a7","observation_id":"513c0d1a-42c4-42dd-b0f3-cc15745d5245","resolution":{"observed_at":"2026-08-07T11:51:04.888761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:51:05.676589Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.676589Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:3caf99c3ee2005433438ff130a745771ca006d39fd65140f7d244b740a3594a4","observation_id":"b3c97642-4e2f-49ba-b054-61c624db5296","resolution":{"observed_at":"2026-08-07T11:51:05.676589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:06.266679Z","title":null,"venue":null,"work_id":"b36e2ead-fe64-477c-bc62-6767ad37f42b","year":2000},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:05.295653Z"},"links":{"citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:c300275fb400860dc531fb492d31a115d9b21767189512332ad95ca2b8d3496c","observation_id":"901496e1-65c4-44b9-8657-027c864ba0cf","resolution":{"observed_at":"2026-08-07T11:51:06.336818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17746","last_updated":"2024-09-26T11:22:16Z","snapshot_observed_at":"2026-07-06T19:22:41.483499Z","submitted_at":"2024-09-26T11:22:16Z","title":"Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17746","snapshot_observed_at":"2026-08-07T11:51:04.271321Z","title":"Brown, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.271321Z"},"links":{"cited_paper":"/paper/2409.17746","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:f38538b52e7bea15c6f1874f7dd737dcaccf318ee66349adbd059d6908262779","observation_id":"bdf259b0-3689-4d5b-baa4-6cf15306f100","resolution":{"observed_at":"2026-08-07T11:51:04.271321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T11:51:04.450022Z","title":"DeepSeek-AI, Liu, A., and et al., B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:04.450022Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2506.01268"},"observation_digest":"sha256:479d85d7c8311085376c520b24f95de07e84f8ee66679a8e3791f5077dd0f4c7","observation_id":"17274775-abc9-4f93-85c8-7927546b49ff","resolution":{"observed_at":"2026-08-07T11:51:04.450022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01268","last_updated":"2025-06-02T02:40:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:44:11.245080Z","submitted_at":"2025-06-02T02:40:46Z","title":"CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2506.01268."}