{"as_of":"2026-08-14T20:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b44df8e3acebf7430b821ad78c052cbecb20dd03e036e255e8382c1d440ccad0","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:32:05.104984Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:17:03.456746Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:17:28.830734Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2508.18167","last_updated":"2026-05-14T18:20:00Z","snapshot_observed_at":"2026-08-04T20:09:49.064679Z","submitted_at":"2025-08-25T16:16:42Z","title":"DiscussLLM: Teaching Large Language Models When to Speak","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T22:09:03.740109Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2508.18167"},"observation_digest":"sha256:0ef41cfb0f98907a441d307cb0d24374791c506a99d1d51941dda659b66dd6c7","observation_id":"98d0d316-9867-42b6-906e-0f4a5197af4f","resolution":{"observed_at":"2026-05-21T22:10:42.302323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2605.23954","last_updated":"2026-05-11T06:30:25Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-11T06:30:25Z","title":"EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:52:43.396119Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2605.23954"},"observation_digest":"sha256:277510c8c6021060c535a063f0c6981d2bd52ed33c8701a7dcfcb9029b974f30","observation_id":"591a55c2-6b29-4495-81f7-6d9c3820f334","resolution":{"observed_at":"2026-07-01T13:45:45.501676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-13T01:32:48.141437Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T15:18:17.427707Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:ab89b85f387c3cd137e33212630cfaf48b86b4699d7d821a4d6d757fe3113018","observation_id":"34137ee2-642b-454d-b847-092e5d8a2f04","resolution":{"observed_at":"2026-07-01T22:36:17.001064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-13T01:32:48.141437Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-02T23:17:03.456746Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:b3cdb1e8816acdd8e7636513f21d21416790986376f090cdd2ba95ddc9b38959","observation_id":"166861d5-7603-435a-95a3-54759ec464b2","resolution":{"observed_at":"2026-07-02T23:17:28.832711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2501.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01384","snapshot_observed_at":"2026-07-02T23:17:28.830734Z","title":"Omnichat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","venue":null,"work_id":"fd7b28dc-ab3d-48a7-ae35-eeda5a06981b","year":2025},"citing_paper":{"arxiv_id":"2606.04306","last_updated":"2026-06-03T00:25:56Z","snapshot_observed_at":"2026-08-05T10:27:41.050145Z","submitted_at":"2026-06-03T00:25:56Z","title":"Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T04:17:18.483765Z"},"links":{"cited_paper":"/paper/2501.01384","citing_paper":"/paper/2606.04306"},"observation_digest":"sha256:43feafb51931555a39b005821332000ae1befb5f456451b4e781cb5236f8514c","observation_id":"719381de-8387-42fb-8ead-4d789199210c","resolution":{"observed_at":"2026-07-02T11:16:53.731741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01384/citation-record","integrity":"/paper/2501.01384/integrity","json":"/paper/2501.01384/citation-record.json","paper":"/paper/2501.01384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.13340","last_updated":"2025-01-16T08:34:36Z","snapshot_observed_at":"2026-08-14T06:51:18.096017Z","submitted_at":"2024-06-19T08:46:29Z","title":"SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13340","snapshot_observed_at":"2026-08-10T22:32:04.897175Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.897175Z"},"links":{"cited_paper":"/paper/2406.13340","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:4fd289b68c078deae941f7716c94438eb3d62bd391e33d1a0fd3b7233320cbcb","observation_id":"6f033cc8-adac-4012-aae0-4cf27578d44c","resolution":{"observed_at":"2026-08-10T22:32:04.897175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-10T22:32:04.927050Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.927050Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:c7f910d8bcb20a58c0af4bd91767046c4260b8b048b8bf520d99c726c75212c1","observation_id":"0d6982a2-999e-4f38-8807-0b918d657330","resolution":{"observed_at":"2026-08-10T22:32:04.927050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T22:32:04.952630Z","title":"20 Preprint version Kristina Jokinen and Michael McTear","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.952630Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:4868bd9fdb9bfbc9e331442ba55cdb5f68acca739be9b07f7187c99da0bce001","observation_id":"ac489d20-9269-4d47-9b1f-015ee9aef61b","resolution":{"observed_at":"2026-08-10T22:32:04.952630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.782062Z","title":"Dailytalk: Spoken dialogue dataset for conversational text-to-speech","venue":null,"work_id":"2cf613d2-9416-47f5-b351-e2ce18cf83f4","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.973121Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:fc69734bd9c3bc6d48f49590d1abf6941323f58923cb6737f1c553add31e9d50","observation_id":"eea48f33-c7b0-4afa-98f3-7c95a493b137","resolution":{"observed_at":"2026-08-10T22:32:05.788900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12786","last_updated":"2024-05-30T09:06:34Z","snapshot_observed_at":"2026-08-13T04:14:45.027101Z","submitted_at":"2024-02-20T07:51:43Z","title":"Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12786","snapshot_observed_at":"2026-08-10T22:32:04.980466Z","title":"Advancing large language models to capture varied speaking styles and respond properly in spoken conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.980466Z"},"links":{"cited_paper":"/paper/2402.12786","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:4d90919a43d38dcf363a763c4e9578b61d7f28bce9cb8c4e5970cbe3c39da328","observation_id":"a1bda65c-69da-42a3-9bee-ba9a7428ecda","resolution":{"observed_at":"2026-08-10T22:32:04.980466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-13T04:54:51.180904Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-10T22:32:04.987198Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.987198Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:5ecb3f080756e9eb1f5c29b0a59c4fc94f9abb66d49608fc52fae0f1b5b67c11","observation_id":"cab6075e-e96e-4126-8053-974c7a93de7b","resolution":{"observed_at":"2026-08-10T22:32:04.987198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-13T10:37:03.795815Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-10T22:32:04.997721Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.997721Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:81838522f4060efb72cfa5cf7293af23d35c29ac9a7e7ae506e0d18650b2970b","observation_id":"ee9a3be0-a176-45b5-bda9-b2bdf0e8327e","resolution":{"observed_at":"2026-08-10T22:32:04.997721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-10T22:32:05.020670Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.020670Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:106287c0281fbf387734fadd993a01e0d848bcb9d29376e921ff1289c4c590b5","observation_id":"afe84b7f-9da2-47d1-bc17-7dabddfe33cb","resolution":{"observed_at":"2026-08-10T22:32:05.020670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.682692Z","title":"A neural network approach to context- sensitive generation of conversational responses","venue":null,"work_id":"ea7d8ce5-2a10-46bd-af21-6c3425d9e15d","year":2015},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.039082Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:76902a3c40e4d388350a32dcab339a548212b30f45401451f4b851f049354471","observation_id":"9671ed34-5a79-4e7e-bbbb-c4cda352f985","resolution":{"observed_at":"2026-08-10T22:32:05.692164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-10T22:32:05.053591Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.053591Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:aa4e90bed8a956c4d5bdf51503899779700f29bf490e0da102cdc92822ef04ad","observation_id":"1ad2cbf5-6b74-41b7-9b27-00e041e858cf","resolution":{"observed_at":"2026-08-10T22:32:05.053591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:32:05.059346Z","title":"Llama 2: Open founda- tion and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.059346Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:df86f93d4f998383db51ac1ce1c5fbb9734a770cc8d12b3610e76b7f6153dd23","observation_id":"88a7abdf-79f4-43e8-81b2-56563feb7325","resolution":{"observed_at":"2026-08-10T22:32:05.059346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00475","last_updated":"2024-07-27T07:45:43Z","snapshot_observed_at":"2026-08-13T04:50:49.204103Z","submitted_at":"2023-12-31T12:29:12Z","title":"E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00475","snapshot_observed_at":"2026-08-10T22:32:05.068528Z","title":"E- chat: Emotion-sensitive spoken dialogue system with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.068528Z"},"links":{"cited_paper":"/paper/2401.00475","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:8b8f2017c60364dff12df5b2a5c80cdb453a093e4c8adcfb4f8769fbc044e3af","observation_id":"a5841562-877b-45c3-bd93-eb0892b3e020","resolution":{"observed_at":"2026-08-10T22:32:05.068528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.653920Z","title":"AIR-bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":"87b377ac-92ff-426c-982c-8fc0e7b67cf5","year":1979},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.076706Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:dda32ce9296f7a39a6f7d8228580ba52b4db32f66f72d3cc3d1a601e8c0dc291","observation_id":"e43f5829-5526-46f4-9607-2323038d955b","resolution":{"observed_at":"2026-08-10T22:32:05.661560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.625694Z","title":"URL https://aclanthology.org/2024.acl-long.109","venue":null,"work_id":"5a4e0b73-f2d6-4fc3-9231-f85f84c3bdc5","year":2024},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.086658Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:931eee6cc91c9a3d332a4530309fe83197a7c80a4e7a5edd899e26b2bc2b678b","observation_id":"adc1fbc1-a86d-44fb-aee8-b0fc8579a74b","resolution":{"observed_at":"2026-08-10T22:32:05.634168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-10T22:32:05.104984Z","title":"Bertscore: Evaluat- ing text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.104984Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:dde301a3f8b5b3a3af1058c257eaede7ebf190fd50a579c96ba01daf2d6b8958","observation_id":"01ab8409-5a99-4ad8-afe2-e538f4505f41","resolution":{"observed_at":"2026-08-10T22:32:05.104984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.763077Z","title":"The cocktail fork problem: Three-stem audio separation for real-world soundtracks","venue":null,"work_id":"8321f3b4-abb4-4b69-a939-b0c74aecfc4f","year":2022},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.003775Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:153af0a8c9c5941b1cb7f43ed25f06cfb0d7fa3be59bbd1cd706b892333eaab0","observation_id":"877814fe-560f-402c-b46d-27869174b329","resolution":{"observed_at":"2026-08-10T22:32:05.769732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-10T22:32:04.935843Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.935843Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:0b0899a7e52cf179bb913ec6b80199115f068ad38069370ee740a3edd6a47ce4","observation_id":"5dc1f954-88bb-4038-835a-2cee7b608670","resolution":{"observed_at":"2026-08-10T22:32:04.935843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-12T22:36:43.974750Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-10T22:32:04.906306Z","title":"Emova: Empowering language models to see, hear and speak with vivid emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.906306Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:60f7c4165282743f6e3d5a08ed2d4b8097d691bfdafa5c154076749f88110f71","observation_id":"52a13339-d729-401b-a598-487c74ecd778","resolution":{"observed_at":"2026-08-10T22:32:04.906306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.802823Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"1e67573e-da0f-46a4-a6b0-e863b07d83b3","year":2019},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.958676Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:07776f31a8579816e564273ddc3a48d578dbf446d9263c9664ece7dd52e71406","observation_id":"6c7903c7-8257-44d3-9781-757f4e9e1fec","resolution":{"observed_at":"2026-08-10T22:32:05.808751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-14T17:40:31.626392Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-10T22:32:05.045777Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.045777Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:b5fd725849ad10fd90bfc3f01e480d9c019ffc3e12c12ee5ed3f6953adea373a","observation_id":"d88343bf-aec6-4c1d-8fe9-89664e868fb1","resolution":{"observed_at":"2026-08-10T22:32:05.045777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-10T22:32:05.095673Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abil- ities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.095673Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:a660d433d0d0b030b52717855bea4535da79b6dd404cfae524d5416b50744ef7","observation_id":"f3b5d209-1f93-46e1-82d0-411060b47e74","resolution":{"observed_at":"2026-08-10T22:32:05.095673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.707204Z","title":"End-to-end task-oriented dialogue: A survey of tasks, methods, and future directions","venue":null,"work_id":"c8520e38-d97f-476b-ba00-bd1cc42c0edc","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.028644Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:332cbeb348e40aa35d23f498fe5343a98391541e9ea5b88b5f819f215ab61ae5","observation_id":"fbdf322f-519a-4dba-b972-20fc0eb0faa9","resolution":{"observed_at":"2026-08-10T22:32:05.713573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-13T04:28:07.254735Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-10T22:32:04.966190Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.966190Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:4dd04efec1376106f649a6aa135017ff53f976187f2dbe6f2255e0face1bd2d5","observation_id":"b9183a36-597e-44dd-b039-53690bfd8af4","resolution":{"observed_at":"2026-08-10T22:32:04.966190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:05.735785Z","title":"Powerset multi-class cross entropy loss for neural speaker diariza- tion","venue":null,"work_id":"7bd8bac5-ece7-493b-9c0d-917d71e80fa6","year":2023},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:05.011324Z"},"links":{"citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:1e0dca181e5513008afa2533736422b2df4a3ab67ce29890cc41dddfadf9c4ac","observation_id":"80b7864c-4b9e-420f-8ed2-081b2ee94f50","resolution":{"observed_at":"2026-08-10T22:32:05.744280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T22:32:04.916461Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.916461Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:ee077c2d86a3f753f093e16b9a6783a2188e924955e8ac35e57d4f06cf32eeba","observation_id":"988a7467-632c-4296-85ca-059b6b981f90","resolution":{"observed_at":"2026-08-10T22:32:04.916461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:32:04.944578Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.944578Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:843e432fe7b194a08d501868a373f3a867051aff6ff1e60e1e5f55612943657f","observation_id":"11f15a96-f792-494b-9a28-65498dc40a30","resolution":{"observed_at":"2026-08-10T22:32:04.944578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T18:22:07.698955Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 5 inbound Pith citation observations for arXiv:2501.01384."}