{"as_of":"2026-08-18T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aaa737f15629f6c1d7e5dbdb858c63b136e663a702a22ecbe7e391318046f61","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:47:52.778178Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:33:55.251451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2605.08847","last_updated":"2026-05-09T10:01:21Z","snapshot_observed_at":"2026-08-15T14:53:39.230520Z","submitted_at":"2026-05-09T10:01:21Z","title":"EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T02:32:35.333227Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2605.08847"},"observation_digest":"sha256:2c68d2471afe550fc1b62daf69e5af61c50fd96f62edd65afb6c00eab06634dd","observation_id":"8375cedf-f628-4809-be40-bb2805f9e2a9","resolution":{"observed_at":"2026-05-12T07:31:33.556834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:4ceb6e79f2a43657a638635b82582a7e6ea5e2bed0532aacafd8ed2b08b37bf8","observation_id":"8aeddb8c-0870-42e3-8557-840d46f94454","resolution":{"observed_at":"2026-05-21T02:43:55.088844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:cf3f57d10bd2a56b726bd5916f446a84f1bde621b6084d86a71648922cba3839","observation_id":"57dc6c13-b400-45cb-822b-464e6734da8d","resolution":{"observed_at":"2026-06-30T17:34:57.349819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:dffb5dce3bf1ed96f0b58dfc3a7e43492635e5659eac2a4ddc9485c913728ff9","observation_id":"4d1cc85d-18b3-4337-b6cd-4e2310f524e0","resolution":{"observed_at":"2026-06-27T13:20:57.347831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2606.30553","last_updated":"2026-06-30T15:48:46Z","snapshot_observed_at":"2026-08-13T12:08:04.689267Z","submitted_at":"2026-06-29T16:49:17Z","title":"COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T03:09:57.069086Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2606.30553"},"observation_digest":"sha256:e1e4754ed5a201a0a8cf393c7c5a66bb903c50fdf026376dd967e1250399caaf","observation_id":"523fcff5-c0a9-4e53-bd9f-7f9eac891c1c","resolution":{"observed_at":"2026-06-30T03:14:14.956765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2606.30553","last_updated":"2026-06-30T15:48:46Z","snapshot_observed_at":"2026-08-13T12:08:04.689267Z","submitted_at":"2026-06-29T16:49:17Z","title":"COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:28:07.670564Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2606.30553"},"observation_digest":"sha256:cc6d9c94dcaf2e61b8a877e9193eabe9fa2678134c2a654c460a19300f1fbd4c","observation_id":"861f0d5d-5929-4867-ac51-c5f99282675b","resolution":{"observed_at":"2026-07-01T09:35:39.879111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-12T00:33:55.251451Z","title":"arXiv preprint arXiv:2505.02707 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-14T06:32:53Z","snapshot_observed_at":"2026-08-18T15:09:53.369358Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.251451Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:a7196c27c164b15d061e35701918e83bc92cadcbbcad674474fe72a531fded47","observation_id":"97497c93-ea4a-4ecd-b488-ea0dfa8c8a84","resolution":{"observed_at":"2026-08-12T00:33:55.251451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02707/citation-record","integrity":"/paper/2505.02707/integrity","json":"/paper/2505.02707/citation-record.json","paper":"/paper/2505.02707"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-16T17:41:05.963766Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-16T00:47:52.506447Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.506447Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:af81cbb3e7d53a1738e7e3e294ac7a05d36eb78e82a21e65dd063a7963620072","observation_id":"e124b35f-b9c8-45e1-a784-0dfd85b264ff","resolution":{"observed_at":"2026-08-16T00:47:52.506447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.491198Z","title":"B \\'e rub \\'e , M","venue":null,"work_id":"a93164e2-3e4b-4b47-8edd-38ecb70ff77f","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.511006Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:56f8caa718adb2adfbaf1f9a13eda92ee96f647761f6a461af3653cdc6766929","observation_id":"d8be03d7-7dcc-4c1d-b70d-58b1911250be","resolution":{"observed_at":"2026-08-16T00:47:53.494593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.480725Z","title":null,"venue":null,"work_id":"0966b5e0-6c34-4aad-ae3e-6d2a0d9d624a","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.514268Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:ffb12d748b341701411ac0ce4c1f405ddbbd444fa38f8899996c1551cc159a7c","observation_id":"a510f1b4-927b-434a-962d-9f3fad62be5c","resolution":{"observed_at":"2026-08-16T00:47:53.484279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.517186Z","title":"Borsos, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.517186Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:941b5da0feb63e7af705505790a9b420ae2728f4ecc788d9b6b92a0d51dc1af9","observation_id":"a2033109-87c9-4f83-9d1c-4f044543f15f","resolution":{"observed_at":"2026-08-16T00:47:52.517186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.463018Z","title":null,"venue":null,"work_id":"793755f7-da72-499f-931f-2f2b4384ea12","year":2012},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.521195Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:4295b4c73209c0239b6673888803214ab3a4ee96d7ff4490b040c4c1848ccfb7","observation_id":"4b35f937-b2db-4fb5-9955-91b3c754920b","resolution":{"observed_at":"2026-08-16T00:47:53.466867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.453269Z","title":"Buyukgoz, J","venue":null,"work_id":"a951a98f-cfe7-4b5a-9fed-06bbdf5519b6","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.525052Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:8e911a7eb9042aeea03d4eb9113ebd639d1cc63ace21fab7d1610c0a2414e50c","observation_id":"17bb2e35-9205-470f-8be0-6d7182b9cc2c","resolution":{"observed_at":"2026-08-16T00:47:53.456685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.441305Z","title":"Casanova, J","venue":null,"work_id":"a9834ec1-62c4-4a5a-baea-3bb395a0304d","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.528913Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:f2e8d0c8105366d80c36cd8eebda96902df853d64de1a4d51b18b855397fa9dd","observation_id":"56c71573-1471-4375-ad9c-1864319638e5","resolution":{"observed_at":"2026-08-16T00:47:53.444870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.431838Z","title":null,"venue":null,"work_id":"cd9d2285-fbf0-4dbf-8146-99cae0861cf5","year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.531889Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:cb34db835c42bb61640af3c625775bfddd68277a0716ec18f148ca8dfd736e73","observation_id":"8903aae6-1e15-4f3b-abd8-a70f88f14332","resolution":{"observed_at":"2026-08-16T00:47:53.434951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-16T00:47:52.535285Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.535285Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:3410a84ddb253d4bdb5417baea12c12590792959df42451d6f0b2af896134fae","observation_id":"59d1fd59-0ee8-4a84-8bb0-b17c4195c86e","resolution":{"observed_at":"2026-08-16T00:47:52.535285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-16T00:47:52.538991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.538991Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:edd0c182a8c6220623ceec9d2c042a04bdc6cfe4fcc133238fd53ce9e8d95ad6","observation_id":"519002cb-9b15-4bfb-bb92-b18a5bb4d9b3","resolution":{"observed_at":"2026-08-16T00:47:52.538991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:47:52.542207Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.542207Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:781b6e1b80e7c9fc933420e4a6d0c7588c6c0dc26141847c4febddc22f7e2a57","observation_id":"67784ff6-797e-40cb-aff3-b5e552203ed2","resolution":{"observed_at":"2026-08-16T00:47:52.542207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-16T00:47:52.545213Z","title":"D \\'e fossez, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.545213Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:76c086cd3d1c43e6d7e47f0cd70ee01b70fe581869f19c64e10d348574c1f0b6","observation_id":"46bf2d6a-3dad-426d-bc88-c789309f10ac","resolution":{"observed_at":"2026-08-16T00:47:52.545213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-16T00:47:52.548376Z","title":"Défossez, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.548376Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:2caadd438dd8bb9e48541d3f44db3b7a319bd4db8d2c689c0e560f315268ba3b","observation_id":"c5bcc4a5-56cd-4a66-8135-89fa41d12f68","resolution":{"observed_at":"2026-08-16T00:47:52.548376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.422078Z","title":"Faruqui and D","venue":null,"work_id":"04877ed7-a28e-4de2-a940-f533e0e030e1","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.552419Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:4075a32219c7e2d5bb2c1bef3696955a26880005564b3ce489e4518716ffc7c7","observation_id":"39adc5f5-de4b-46f5-9e91-8dea42713698","resolution":{"observed_at":"2026-08-16T00:47:53.425302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.412523Z","title":null,"venue":null,"work_id":"49f37a67-9d60-4973-b942-56552a7e87c0","year":1972},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.555483Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:64bf44e2123168907d962bedce166c7f61e1ba948839f3aec3cd798be3fca12e","observation_id":"c3771bc7-2dde-4bdb-b3b9-b4c92714756b","resolution":{"observed_at":"2026-08-16T00:47:53.415727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.402722Z","title":"Grosinger","venue":null,"work_id":"38e6f6f1-11c6-4638-b39e-9b9d41d43ab6","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.559084Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:0191c1d060d27a3595bad8c73f87df2f18d6e5f99c07c51984b56e555921124b","observation_id":"b95d26c8-5e12-4a1b-94df-07cace989b7b","resolution":{"observed_at":"2026-08-16T00:47:53.406167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.392311Z","title":null,"venue":null,"work_id":"9c0268fc-ad70-48f5-9a35-c56d0cc7f049","year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.564368Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:161318e3dd799e2f2a74073e1edf9db14850c5dbdecde3f333fe44a576af4975","observation_id":"706bec63-9814-477f-ad16-35a6009adc6d","resolution":{"observed_at":"2026-08-16T00:47:53.395594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11554","last_updated":"2024-01-15T23:52:21Z","snapshot_observed_at":"2026-08-17T00:59:25.531672Z","submitted_at":"2023-05-19T09:54:21Z","title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11554","snapshot_observed_at":"2026-08-16T00:47:52.567799Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.567799Z"},"links":{"cited_paper":"/paper/2305.11554","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:f413fe22dba0274b39528407fd00436c1886c4c6a6ed41d4de71f65189e98a0e","observation_id":"e6ae605f-3df7-4622-a997-8a7a2297bdc2","resolution":{"observed_at":"2026-08-16T00:47:52.567799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.383713Z","title":"Hassid, T","venue":null,"work_id":"2c311972-7f38-4f5c-87a4-63239c72705d","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.571005Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:5b85215661b268820f1bc65f6953bd2a1d840f41a10afb94ea4f37647ccf9c83","observation_id":"b51c8092-1136-4c74-b1a2-3a93f23398aa","resolution":{"observed_at":"2026-08-16T00:47:53.386549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.374905Z","title":"Hendrycks, C","venue":null,"work_id":"eb55c18c-da0e-4a9f-af6b-9c00c97b095b","year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.574760Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:03923987de4b39cf66d2f6b1b302fd4c367e7f829bf2bfd84794715ad553b07e","observation_id":"9e948fc4-7731-49bd-8472-069c295a0b0a","resolution":{"observed_at":"2026-08-16T00:47:53.377707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T00:47:52.578112Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.578112Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:e4fac960a9e199ef8b0cb9cf5d5a9b52f1b1f16167350736f3a1fd8ecb0d4c98","observation_id":"aa217a71-8c4e-4921-8de3-4dc61eb4c6c7","resolution":{"observed_at":"2026-08-16T00:47:52.578112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.365015Z","title":null,"venue":null,"work_id":"e4ca4320-5fe2-444a-a0f3-dae2d8690d5c","year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.581601Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:19c0f98033d023d2fa753abca34f1d438c34008a3b14c7e1a79b5a613660113a","observation_id":"2ad3e9ab-9dcc-41e0-ae84-a367fa1adab2","resolution":{"observed_at":"2026-08-16T00:47:53.368341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-17T11:07:54.315530Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-16T00:47:52.584754Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.584754Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:97754359ca677e131490d3a80f9480237a2787f9ce7b1cd0f1e796d6a0d3ced3","observation_id":"dd19769d-df76-4e6a-b750-8aebb223ab4f","resolution":{"observed_at":"2026-08-16T00:47:52.584754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-16T00:47:52.588104Z","title":"Huang, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.588104Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:413e52dfba20690097ad01f8a360c2d16831ab37422a7becf840f36cc40c07ed","observation_id":"ca06c36e-4cf8-40d8-8e86-b79fe08c4bef","resolution":{"observed_at":"2026-08-16T00:47:52.588104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-16T15:37:47.663231Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-08-16T00:47:52.591562Z","title":"Huang, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.591562Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:f6cf71e989af3641dc1c8f392090be28355a57d308f1d014850af732762ab13d","observation_id":"1fecb7db-846f-4aed-b124-fb178a8a67bd","resolution":{"observed_at":"2026-08-16T00:47:52.591562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T00:47:52.595206Z","title":"Hurst, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.595206Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:3e0c32364c0619a4ba65e04497ccb08dd54c9400f4b20ef029a448e2a25f3941","observation_id":"9ad78b39-1085-43a6-af14-bdb6d5897c9b","resolution":{"observed_at":"2026-08-16T00:47:52.595206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-08-16T14:20:12.870542Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-16T00:47:52.598526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.598526Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:8323d10c24baca4230fbb251b2b83f10606ba94e18a054b13e91c4f6822f0a3a","observation_id":"65fb27dc-5e98-43e8-9467-071900e7a294","resolution":{"observed_at":"2026-08-16T00:47:52.598526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.354632Z","title":"Kumar, P","venue":null,"work_id":"b29335f0-8bbc-4fb0-9bf2-679e19e7dbba","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.602591Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:93fe60bc90fa12cddaf529d9eb43e1ba482e0622e1de1a2bf51abd793d931e77","observation_id":"4042dfa0-57e4-4d32-81e1-636e573b1533","resolution":{"observed_at":"2026-08-16T00:47:53.358299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.605505Z","title":"Kwiatkowski, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.605505Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:a880dfa550313e5ee4e64f89196321b43b2731c24c88c0de9061181b23aed1b9","observation_id":"ce7b5bce-bbf4-4000-998e-05a92f83cb3c","resolution":{"observed_at":"2026-08-16T00:47:52.605505Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01192","last_updated":"2021-09-09T22:36:33Z","snapshot_observed_at":"2026-08-16T18:48:26.469145Z","submitted_at":"2021-02-01T21:41:40Z","title":"Generative Spoken Language Modeling from Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01192","snapshot_observed_at":"2026-08-16T00:47:52.608982Z","title":"Lakhotia, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.608982Z"},"links":{"cited_paper":"/paper/2102.01192","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:95eed43169ac97f2cb16feb56a7a97e03801fa6ae5aefcf9a1a3d89f7ebeadc5","observation_id":"0e8e9f1c-2813-427c-a6a7-182d5e2dcd28","resolution":{"observed_at":"2026-08-16T00:47:52.608982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.343557Z","title":"Lebourdais, M","venue":null,"work_id":"ddceb436-0c7b-4c6d-b8ff-45c121bf70b4","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.611927Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:2ead70f9d268c47447fa927f7e48fdd673e83020c7e7eae5fd9f7b50ffae1975","observation_id":"b0a35792-c6de-41db-8eb3-49c802a4c071","resolution":{"observed_at":"2026-08-16T00:47:53.347076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.614452Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.614452Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:9b9a024b3d9608a138237d56f28fa7328dd3f4d3de76028338884ebcdc829144","observation_id":"60ed26f4-d025-4287-b213-755b7d048d7a","resolution":{"observed_at":"2026-08-16T00:47:52.614452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.331721Z","title":null,"venue":null,"work_id":"56281f26-426c-48f0-83e2-9c7246423d0c","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.618402Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:481a79e3a5c0af6ea5e53c25351e8850e414e28e2f467fac8126b15a89bd9496","observation_id":"12aa6e90-c54c-4c1d-81fa-8b68fb61d921","resolution":{"observed_at":"2026-08-16T00:47:53.335224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.321808Z","title":null,"venue":null,"work_id":"868f4846-da4e-4ee1-9ffd-9ae022ba365e","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.621910Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:c964a25cb982b3af9fdc975023a5a0623963365c5d8c4bc8bc32d697b8c56b51","observation_id":"731ece00-b6c7-4959-bacc-3173929f9821","resolution":{"observed_at":"2026-08-16T00:47:53.325123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.310919Z","title":"Maiti, Y","venue":null,"work_id":"f2cef68f-9cc2-4aa2-9422-a79833b7f41f","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.624714Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:873e5623f558bf8d2b030ded1cdd2be481e64686409c1579738c63600011be11","observation_id":"321b423b-9119-4aeb-a979-6bb06a3172e4","resolution":{"observed_at":"2026-08-16T00:47:53.314597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07937","last_updated":"2024-01-24T15:36:31Z","snapshot_observed_at":"2026-08-18T13:30:19.060570Z","submitted_at":"2023-09-14T03:13:18Z","title":"Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07937","snapshot_observed_at":"2026-08-16T00:47:52.627183Z","title":"Maiti, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.627183Z"},"links":{"cited_paper":"/paper/2309.07937","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:87598fd264acbc61a51fd689ca6ea6cd3083ba78f42d5fdd81f0b2291253b42d","observation_id":"66e86393-b44d-4274-bbff-2a3de08adac7","resolution":{"observed_at":"2026-08-16T00:47:52.627183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.300103Z","title":null,"venue":null,"work_id":"36c61b2d-9ce4-4325-97d2-3d2398e97a21","year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.629900Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:1f645d58d03b48e20db794c27600151a4b8d664533a803cdd53d7eadcaa233ab","observation_id":"df2f3311-6684-4854-b1b5-22349b1cdcbf","resolution":{"observed_at":"2026-08-16T00:47:53.304127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12428","last_updated":"2024-10-03T05:17:25Z","snapshot_observed_at":"2026-08-16T13:41:54.519513Z","submitted_at":"2024-06-18T09:23:54Z","title":"PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12428","snapshot_observed_at":"2026-08-16T00:47:52.632277Z","title":"Mitsui, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.632277Z"},"links":{"cited_paper":"/paper/2406.12428","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:60f3959813f9fc50482647805c5e233a185e333b67bd221ee9f279f58dff716c","observation_id":"86f2ce39-1688-49cc-ae51-f7f4d60645bc","resolution":{"observed_at":"2026-08-16T00:47:52.632277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-08-16T15:30:06.294841Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-16T00:47:52.634671Z","title":"Nachmani, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.634671Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:41fd2594ca7704f70ab7d3da6737b935edd4bf61106907ef5dd0ebe8aa1828e0","observation_id":"c602c896-a122-405c-a812-cc008e55911c","resolution":{"observed_at":"2026-08-16T00:47:52.634671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-16T14:20:11.430991Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-16T00:47:52.638150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.638150Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:9631faad16fd531f0b5d2555186a9f02acec8d1ca3953e2e4bef9ce4125cc59b","observation_id":"040bb85f-0076-4631-938e-9eb39ba930aa","resolution":{"observed_at":"2026-08-16T00:47:52.638150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.642350Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.642350Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:5698632a740fefd0999a725339889215d743c8fd2e5952ee3ca1c6283ffa792b","observation_id":"0be1560d-72f5-4df5-9a23-8668bbd4e047","resolution":{"observed_at":"2026-08-16T00:47:52.642350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.283951Z","title":"Panayotov, G","venue":null,"work_id":"4a9c74f4-ae51-4bef-87a8-dd6944d73cde","year":2015},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.645654Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:bdd3d021025761aa766c6952ca15620ab516b9bdcab30a726b2f9861b4f613e7","observation_id":"d13bd9c0-4b51-4b27-b020-590eadd590b5","resolution":{"observed_at":"2026-08-16T00:47:53.287763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-16T18:34:32.910572Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-16T00:47:52.649088Z","title":"Polyak, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.649088Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:6d0099257a8c5f8efc2bf766251c6af0d9929b7c8d07a3ba5076e8f01b4ac770","observation_id":"020236d6-44e6-45b9-a87d-e9494255eace","resolution":{"observed_at":"2026-08-16T00:47:52.649088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-16T00:47:52.652682Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.652682Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:69427cef6ea5741ea19d7a0ae01bcc3d4cd388367017c979eff892b6df11da51","observation_id":"29aa0f4e-35be-494a-89a7-13f78d16c65d","resolution":{"observed_at":"2026-08-16T00:47:52.652682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.272770Z","title":"Rekesh, N","venue":null,"work_id":"f223c183-274a-4b4b-bc31-d0905fa059a6","year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.655586Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:239c0f12cd8a56980b77bdb1d6c05fa48132dd2dcaeb35a0369f769bd974e8f4","observation_id":"a827304e-1275-4db8-8515-77e71f3623c0","resolution":{"observed_at":"2026-08-16T00:47:53.276218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-16T00:47:52.658941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.658941Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:4e3990f5a71478d649feb799d2b1ec18a8ae381a15d52eb61392876581c7c1e6","observation_id":"f8ba1da9-bc90-422a-85b2-6627000f6fba","resolution":{"observed_at":"2026-08-16T00:47:52.658941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.262914Z","title":null,"venue":null,"work_id":"7401f01b-eafb-4e28-a157-201c202e6e2b","year":1995},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.662957Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:7daa7c2b9c042c06c280aca9e8079cdfbd21e6308d702a827a45f2bb169bbd13","observation_id":"cf50e6d5-0777-4971-8ee7-e200be675097","resolution":{"observed_at":"2026-08-16T00:47:53.266294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-16T00:47:52.666078Z","title":"Schneider, A","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.666078Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:101f673a4fdf9368685482466953e8c8259dc04846350a14ac995635f6bf6659","observation_id":"780d4055-048f-4c61-9f8a-fdb0d592921b","resolution":{"observed_at":"2026-08-16T00:47:52.666078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.251486Z","title":"Schroeder and N","venue":null,"work_id":"1c18fad5-4e5c-4e0c-a4f5-843f2db1c264","year":2016},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.669859Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:34c536f8bb2b415c68fc5a466a554f92fb8d5d29c6221b2ef64f2991c2fa7e1a","observation_id":"391b8b51-aa3e-4abb-930b-35c049ae8bf1","resolution":{"observed_at":"2026-08-16T00:47:53.255410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10158","last_updated":"2023-12-14T11:49:17Z","snapshot_observed_at":"2026-08-17T13:10:25.454290Z","submitted_at":"2023-10-16T07:58:56Z","title":"Character-LLM: A Trainable Agent for Role-Playing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10158","snapshot_observed_at":"2026-08-16T00:47:52.673073Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.673073Z"},"links":{"cited_paper":"/paper/2310.10158","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:7604a86cddb34ca0abd4257ee504cb69963e39ead2fc34876592b8c1e781d074","observation_id":"c404d6b6-b12f-41db-a962-fdae744eea6c","resolution":{"observed_at":"2026-08-16T00:47:52.673073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-12T12:50:51.005571Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-16T00:47:52.676290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.676290Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:fdb8ef10a544333ef4e8161a5c4ca65ab1f628a957b836b08954384a28229cfc","observation_id":"97022753-9f82-4bda-9b23-9a7034fe7dc1","resolution":{"observed_at":"2026-08-16T00:47:52.676290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.240194Z","title":null,"venue":null,"work_id":"aab256cc-9033-4e5b-a5b6-c78e833e54ae","year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.679284Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:0420e407e0807c3bfc064e3054e1ee7adb2d18bb91dc7993c86a8ebe7afc4f83","observation_id":"04b6a8bb-7126-4b30-929d-db844060fb51","resolution":{"observed_at":"2026-08-16T00:47:53.243969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.230761Z","title":null,"venue":null,"work_id":"e02973ac-9880-48a9-bd9e-0daab18441ae","year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.681853Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:c041ed4fa7d92423c69a4edc34ad53011e3da781c05eb1b4d7b9a0b9f3ad273d","observation_id":"33e96a23-b2b9-4a47-a0d5-fea449e9efe4","resolution":{"observed_at":"2026-08-16T00:47:53.233519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.221163Z","title":"Introducing hertz-dev, the first open-source base model for conversational audio generation, 2024","venue":null,"work_id":"fa76a2bb-80a7-4966-93af-0e41d76d5fa1","year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.684728Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:9ebbe0a462f8e49a38949c9c9cae6abd162761f8d5de43efe82cb93ce03a58c1","observation_id":"1e8faf03-4548-46eb-8a99-15ad140b7bdb","resolution":{"observed_at":"2026-08-16T00:47:53.224794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.210882Z","title":"Stivers, N","venue":null,"work_id":"acb175ca-0105-4c4e-a141-21c3e30c677d","year":2009},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.687522Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:0c9f48907c17856e91e07bc98c3af8924709ad4f37013bc18e92eee6380b1c4d","observation_id":"d9205236-29ae-423c-862d-48785d9ae384","resolution":{"observed_at":"2026-08-16T00:47:53.214806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00168","last_updated":"2025-05-17T15:25:50Z","snapshot_observed_at":"2026-08-18T06:47:13.393271Z","submitted_at":"2024-09-30T19:17:46Z","title":"SSR: Alignment-Aware Modality Connector for Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00168","snapshot_observed_at":"2026-08-16T00:47:52.690476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.690476Z"},"links":{"cited_paper":"/paper/2410.00168","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:2abe835dc52b89e8275135dda283b113d82d8fa750d54fb8d9d896b358655b0e","observation_id":"d5d39c18-155c-4ffb-8298-20d9fa53c0ef","resolution":{"observed_at":"2026-08-16T00:47:52.690476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-16T00:47:52.693798Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.693798Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:4645d1de6efec7f594c139ab6019e320642753ffb347e6936fdac2f39b9b7156","observation_id":"05124a52-219b-4a34-b46a-bf77dd7c50a0","resolution":{"observed_at":"2026-08-16T00:47:52.693798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-16T00:47:52.696916Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.696916Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:12a8bafffd8e4a866356aed8165210015686888fede3ccd3a9e806b2d6c5272e","observation_id":"9468cbe7-5613-4786-b2ca-87458060fb61","resolution":{"observed_at":"2026-08-16T00:47:52.696916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.199051Z","title":null,"venue":null,"work_id":"305490a8-86ca-4c1c-a65a-f471a994da84","year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.700497Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:c6bb240a88a0668c491ee4773ddc6ca5efb11573f83215978f0f2c2a4e3fe367","observation_id":"d7d929f1-4a1e-4044-b00b-41f099df31a0","resolution":{"observed_at":"2026-08-16T00:47:53.203398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-16T17:50:12.347206Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-16T00:47:52.704511Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.704511Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:7c1f9f9b7a7b89b6a9c815033e4a24a6686a76f995bd500ab47c50d389e2ad9c","observation_id":"8a6fca1c-7c2b-486d-b314-96c269d06ed8","resolution":{"observed_at":"2026-08-16T00:47:52.704511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.712479Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.712479Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:86ae99fb17df6f07a7d55f85f57cb2b76c553a32414c8d4caf7b86e9ccb03fd0","observation_id":"5ede4a8f-2d46-40e6-b28d-b2bb80cfd332","resolution":{"observed_at":"2026-08-16T00:47:52.712479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14231","last_updated":"2024-05-23T07:03:56Z","snapshot_observed_at":"2026-08-18T08:46:15.288643Z","submitted_at":"2024-05-23T07:03:56Z","title":"From Role-Play to Drama-Interaction: An LLM Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14231","snapshot_observed_at":"2026-08-16T00:47:52.726959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.726959Z"},"links":{"cited_paper":"/paper/2405.14231","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:6660cf523e4a3fd3682e87a6f46fabecada8c96c35a046e69e32513f7d6a0bf2","observation_id":"668f5971-9f1b-4a44-8233-570d9d7e1fc4","resolution":{"observed_at":"2026-08-16T00:47:52.726959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-16T00:47:52.756762Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.756762Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:09e9303e2f75031c722ceb8c2a2dc2115449252d771041e0b87bc086998e60f3","observation_id":"4dde856f-4d42-4f7e-ae86-fc7c80882e52","resolution":{"observed_at":"2026-08-16T00:47:52.756762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:53.182101Z","title":null,"venue":null,"work_id":"fb12b547-464c-4c80-a5a2-b9b69996b3ca","year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.760363Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:84ca0c2f9a2a5c4b396319c3369cae7cf52f709900273b0a59fc984e0dfc33b5","observation_id":"addf096c-29e5-4612-8417-8eb86aeb6bca","resolution":{"observed_at":"2026-08-16T00:47:53.186620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-16T00:47:52.764544Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.764544Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:6791b374ac7a44abf5673ddee4c5a0faea147705fe81b4cda123e9140744b6eb","observation_id":"cba341f0-e7f1-4915-b679-65993d3d94ce","resolution":{"observed_at":"2026-08-16T00:47:52.764544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:47:52.767540Z","title":"Zeghidour, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.767540Z"},"links":{"citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:780a41ff2254e937ffd36a79b6a5c97614e6f5c6169f87a078f1f3aba5d33063","observation_id":"50d1e163-6763-4fb1-b4a0-e8add6acbc77","resolution":{"observed_at":"2026-08-16T00:47:52.767540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-16T15:31:59.521123Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-16T00:47:52.770658Z","title":"Zhang, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.770658Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:b5e3717d993a956d586ce601d7f1d9e91169658470972b544259e75f53f42f03","observation_id":"09397b9d-0bc5-4036-9df7-19890a7270cf","resolution":{"observed_at":"2026-08-16T00:47:52.770658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-16T00:47:52.774628Z","title":"Zhang, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.774628Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:fd3268af6d84c138d655c63cacd6dd7e02c7c9e58dbeb47d954445f449735f0d","observation_id":"f08281d8-d065-4ac6-92cf-81953a788e60","resolution":{"observed_at":"2026-08-16T00:47:52.774628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00976","last_updated":"2024-11-01T13:54:48Z","snapshot_observed_at":"2026-08-16T13:46:54.193784Z","submitted_at":"2024-06-03T04:16:30Z","title":"Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00976","snapshot_observed_at":"2026-08-16T00:47:52.778178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.778178Z"},"links":{"cited_paper":"/paper/2406.00976","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:d5e895485644965d4a10e2e2096f141e8600d3ca3cb14c2019daa75dbaa222f1","observation_id":"3c77d63f-3d38-4005-bdbd-50969192f301","resolution":{"observed_at":"2026-08-16T00:47:52.778178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T18:17:11.118154Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 7 inbound Pith citation observations for arXiv:2505.02707."}