{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87ee9d544655518b06cbb8fbfb6d6ce0459f58897b15a67302b68dc60093b12e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:56:16.007863Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27756/citation-record","integrity":"/paper/2607.27756/integrity","json":"/paper/2607.27756/citation-record.json","paper":"/paper/2607.27756"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:10.416778Z","title":"GPT-4o System Card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:10.416778Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:bc633b0494acbd504c9f872c01742ee312a7008dedd9f8f12a683e539ce223cc","observation_id":"788b3f6c-4db0-4df3-bd2c-836e83fa7150","resolution":{"observed_at":"2026-08-01T01:56:10.416778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-01T01:56:10.528940Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:10.528940Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:e2576ce47e3bb0f48e3cbafb75fd7d577953dc27af425c326ed37703efe0e1f3","observation_id":"9560a833-0e86-4a0c-ab01-bab6f584bcbf","resolution":{"observed_at":"2026-08-01T01:56:10.528940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:10.668140Z","title":"Personaplex: V oice and role control for full duplex conversational speech models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:10.668140Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:ab1e79846cb739876e7a356d5662e827719c96ea2862fe38866be0b1560102ca","observation_id":"1153c227-50cf-4b9e-89d4-0338aa6350c9","resolution":{"observed_at":"2026-08-01T01:56:10.668140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-01T01:56:10.827949Z","title":"Qwen2.5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:10.827949Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:8b5c37e1f8aac0813c74dae14dccf44c8f981f4b5fa229a8eb67506a3ca0e4aa","observation_id":"e624201f-2ee7-4850-a6d0-590cfeb18e85","resolution":{"observed_at":"2026-08-01T01:56:10.827949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T01:56:10.937839Z","title":"Qwen3-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:10.937839Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:9601758096afda5372e6b6705546a68677374120bf5c06fbf4c9e43964d89ec6","observation_id":"fdea526e-90f8-425c-8698-6402185f0f7d","resolution":{"observed_at":"2026-08-01T01:56:10.937839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T01:56:11.074176Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.074176Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:ee1a9745509adb6bbc83af7cb3574cf05eecc405d168c8534c63522121377e7e","observation_id":"69039bc1-eb5e-4a90-b17d-cd000c1e5a83","resolution":{"observed_at":"2026-08-01T01:56:11.074176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-01T01:56:11.217841Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.217841Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:5fae80da70e85f792da53bd748fd15cad738ca60d87fca8c30eae8b93faa3318","observation_id":"00afae82-4b4e-4571-bcd0-fbd8ddfa345e","resolution":{"observed_at":"2026-08-01T01:56:11.217841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T01:56:11.344932Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.344932Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:d58f93ffc41e9f7ca55ed5ca1d8d96e602af7bf78c9c86459fefda4904d23fec","observation_id":"5e6763b9-2544-45e1-82ae-e2b4c8cbe348","resolution":{"observed_at":"2026-08-01T01:56:11.344932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-01T01:56:11.504456Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.504456Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:6165b85a53946c8220f113067b52754a5be6582dd31516a16978805b82517260","observation_id":"48c84c9f-daa9-43a0-bb18-054a639450ad","resolution":{"observed_at":"2026-08-01T01:56:11.504456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-01T01:56:11.607296Z","title":"Mini-omni2: Towards open-source gpt-4o with vi- sion, speech and duplex capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.607296Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:04bfdd2e14bff614028a6234d568394eb6d86e4c6a41dc426271bdad17d12eb6","observation_id":"d9f3b444-9dcc-47d1-adb1-8860bdf40f52","resolution":{"observed_at":"2026-08-01T01:56:11.607296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:11.708738Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.708738Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:aeaea6a6ea202ee4889f00aaea461e279903ada594d415ff3db54c4e896e4b82","observation_id":"853fd419-db93-4bc9-a2f8-5aa3d67b57ab","resolution":{"observed_at":"2026-08-01T01:56:11.708738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:11.843244Z","title":"The cocktail party problem: what is it? how can it be solved? and why should animal behaviorists study it?","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.843244Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:babf05bf22ad5f44535c5b97c0905641c23c0bca633fb27b4b26c61defcd7662","observation_id":"1f3ad423-b469-408b-8477-4966ba6f9131","resolution":{"observed_at":"2026-08-01T01:56:11.843244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.025784Z","title":"Just ASR + LLM? a study on speech large language models’ ability to identify and understand speaker in spoken dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.025784Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:2f9cb6a5c00a2e4f100941388ec389c285220e53eb52a340d0fee9c1cdd4474b","observation_id":"b55221ab-6ea2-4c20-bc9b-964280ef28dd","resolution":{"observed_at":"2026-08-01T01:56:12.025784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.212161Z","title":"Avmeme exam: A multimodal multilingual multicultural benchmark for llms’ contextual and cultural knowledge and thinking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.212161Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:51d918228cca4446c341f46ba0c968ee7b84741017942bff47f8b157768c643a","observation_id":"96e98f15-bfea-43ce-955f-b0418946de49","resolution":{"observed_at":"2026-08-01T01:56:12.212161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08155","last_updated":"2025-08-11T16:31:32Z","snapshot_observed_at":"2026-08-10T06:38:31.654565Z","submitted_at":"2025-08-11T16:31:32Z","title":"MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08155","snapshot_observed_at":"2026-08-01T01:56:12.264320Z","title":"MSU-Bench: Towards understanding the conversational multi-talker scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.264320Z"},"links":{"cited_paper":"/paper/2508.08155","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:b06d362840d01ee7815f9a66bfca6d8287b3563d77048d94368f9bbb51a2212a","observation_id":"e849d692-f02c-4dcb-b34b-cdadafa53b4d","resolution":{"observed_at":"2026-08-01T01:56:12.264320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.391103Z","title":"M3-slu: Evaluating speaker- attributed reasoning in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.391103Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:88fa0837d07a16a381a92520eb0387b13ae3dfa2c4444a650a0ff5d351a2fd4a","observation_id":"8b535e89-b1aa-4c09-bd24-d92b16131d16","resolution":{"observed_at":"2026-08-01T01:56:12.391103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-09T21:30:12.152751Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-01T01:56:12.513345Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.513345Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:d5e461453a6fd8b1247e538516465f0026ccc2c7687b54f669e8754f75205eed","observation_id":"a86a3fd3-8800-476b-a9e9-0bd5e4630dfc","resolution":{"observed_at":"2026-08-01T01:56:12.513345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.628782Z","title":"Full-duplex-bench v1. 5: Evaluating overlap handling for full-duplex speech models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.628782Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:fb96e80cba16be1927ff00aa3db8d8dd999a7d1a64320bc58dea6ca87cfa5deb","observation_id":"028a8f72-c847-4269-b3c0-590c0f7d91ac","resolution":{"observed_at":"2026-08-01T01:56:12.628782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.788543Z","title":"V oiceFilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.788543Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:2f45938bca40da928cb4d229379f6486593183daefb9c95681ec1f4dc7f42969","observation_id":"6a0378b2-c122-4747-bbde-d0362c82c417","resolution":{"observed_at":"2026-08-01T01:56:12.788543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:12.958206Z","title":"Listen, chat, and remix: Text-guided soundscape remixing for enhanced auditory experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.958206Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:fc68f4e7556dd72a8591017cab427cc36bcb27b9879e5e57488d67a4ec82cf31","observation_id":"db2eec55-b872-4286-8d59-91c69257d43d","resolution":{"observed_at":"2026-08-01T01:56:12.958206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:13.053366Z","title":"Meanflow-tse: One-step generative target speaker extraction with mean flow,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.053366Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:266475f69a2b2ac2103dd4ccb46fe9847a27f998075682d00fd56518a5b65aba","observation_id":"82ce8180-6ef9-460a-9ea3-20aaf2cabc5f","resolution":{"observed_at":"2026-08-01T01:56:13.053366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:13.218631Z","title":"Auxiliary interference speaker loss for target-speaker speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.218631Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:81680431ac38486b3e8c4b9c8cc1c27fcdf0d8c89954627c86c0e2b1dda71a1b","observation_id":"63e40c67-e0bc-406c-a7a7-292ac888e500","resolution":{"observed_at":"2026-08-01T01:56:13.218631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:13.368342Z","title":"End-to-end multi-speaker speech recognition using speaker embeddings and transfer learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.368342Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:c802c02b6644bd41ac8343d0daddddaa56aa15fcab6364c97fd66a6e5e4d4eeb","observation_id":"9c0be647-fc06-45a2-bd0f-82b140f1b894","resolution":{"observed_at":"2026-08-01T01:56:13.368342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:13.501136Z","title":"Conformer- based target-speaker automatic speech recognition for single-channel audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.501136Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:bf549b3c8fce6ab0c9f44917968ca69ce2b3e807e6d9c8de6b579cc0b8ffa387","observation_id":"94a13fbb-261c-4d05-b1de-a7f176bdab43","resolution":{"observed_at":"2026-08-01T01:56:13.501136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:13.641217Z","title":"AAD-LLM: Neural attention-driven auditory scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.641217Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:96736afe57d8ad0a880f40f853a6f34d8aa55091f2f4187b2755a8238de12641","observation_id":"bf4ed2fd-706e-4a63-a44a-245fa8281854","resolution":{"observed_at":"2026-08-01T01:56:13.641217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04862","last_updated":"2026-06-26T09:06:14Z","snapshot_observed_at":"2026-07-15T14:58:41.001080Z","submitted_at":"2026-03-05T06:35:59Z","title":"Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.04862","snapshot_observed_at":"2026-08-01T01:56:13.771206Z","title":"Focus then listen: An empirical study of plug-and-play audio enhancer for noise-robust large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.771206Z"},"links":{"cited_paper":"/paper/2603.04862","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:7af918dfffdfaf16387aee6cb68685c8e81d1f588ff4016e5b7b92c423cafe3d","observation_id":"ebd308f0-ab70-4ee6-a978-9b24da0e7a4e","resolution":{"observed_at":"2026-08-01T01:56:13.771206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T01:56:13.878197Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:13.878197Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:99df27d834556f9846c30e8b0f1fe7bd5dedaeb234aa5623bcdf26e04f7040c7","observation_id":"cb5b584b-f626-4d57-9d08-740ad6673e3d","resolution":{"observed_at":"2026-08-01T01:56:13.878197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.046887Z","title":"CHiME-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.046887Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:3c3225d7ddaf14102dd2c85584a2017700da2678a85eafdc3736a6af4843dc9e","observation_id":"abbb6c8e-01d8-4b57-a69d-a5131f0dfa40","resolution":{"observed_at":"2026-08-01T01:56:14.046887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.210808Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.210808Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:40994fcfa85c883644d32bd40824074cb83a155dfb8e0e979662e89819fd99ad","observation_id":"372b49b6-6131-4442-87d6-0f3b4d26654b","resolution":{"observed_at":"2026-08-01T01:56:14.210808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.318275Z","title":"Speak or stay silent: Context-aware turn-taking in multi-party dialogue,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.318275Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:88c734fb33cdeaef287bab223f9c55fb79271c97ec5a3b0dbd01834afb451c11","observation_id":"e7e893e9-b2e7-4de0-8798-c424b85a8856","resolution":{"observed_at":"2026-08-01T01:56:14.318275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.440453Z","title":"Demand: a collection of multi- channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.440453Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:3373426db675c8779835993d61178c13b0df2c38f840ac925e830c287ba552f7","observation_id":"1b73ee49-b7d7-48fc-a4cf-e3096c73c695","resolution":{"observed_at":"2026-08-01T01:56:14.440453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.600689Z","title":"Dailytalk: Spoken dialogue dataset for conversational text-to-speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.600689Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:38fa11bb5bcd9c71f719f34d52cb955632a60b8fa271e47162b5a32b96ada46c","observation_id":"322c8393-bb2d-436e-82e8-f7a5aaf6ef24","resolution":{"observed_at":"2026-08-01T01:56:14.600689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:14.764304Z","title":"Gemini 3 Pro Model Card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.764304Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:3c11939b8df0ad0eb12fa0da6b1db2dd760431360f839bb5bef0c389c938c052","observation_id":"8d352b3c-bae2-405b-abd6-074198edb42e","resolution":{"observed_at":"2026-08-01T01:56:14.764304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-01T01:56:14.899573Z","title":"Qwen3-tts technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:14.899573Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:4ee11dc1e5b21ee75e2db00c94be5b01e42bee6243f3d50349dd78660a63f281","observation_id":"16a9853d-7f3f-4647-89fb-32106e1f0d4e","resolution":{"observed_at":"2026-08-01T01:56:14.899573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.055628Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.055628Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:d017b36827c078486c1a559b6dc9e5c7b0907e03a2fdf209ce7d8dfba76fca2d","observation_id":"70c8fe36-c9f4-459e-8653-00ee3bb37596","resolution":{"observed_at":"2026-08-01T01:56:15.055628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.219253Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.219253Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:461283eeb794b64bc97191e4053baf5933afb60013ef5a8354852f70511977fa","observation_id":"2746be07-1660-430e-9efe-098d854ecdbb","resolution":{"observed_at":"2026-08-01T01:56:15.219253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.367153Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.367153Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:0fc63d92cfd927dfdd6532d95f979c7822123c7b7fce609527e6fa3fb4dac736","observation_id":"c4a143f9-fc06-49cd-a2f6-9738a33dd814","resolution":{"observed_at":"2026-08-01T01:56:15.367153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.428263Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.428263Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:dead330c10ca1eaf0feeb84f3a9192333c689b2147a7cb4ade4088051b72d547","observation_id":"2247c9d4-d3f0-4796-a860-6908b53e6719","resolution":{"observed_at":"2026-08-01T01:56:15.428263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.516842Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.516842Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:ea128e8d1d1fdd6786fa5541b8012205e2fe565b2ec7c4442632662177b6a2a9","observation_id":"c80b2d73-dec6-4751-a870-8d5ae80c90d6","resolution":{"observed_at":"2026-08-01T01:56:15.516842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-01T01:56:15.582007Z","title":"Step-audio 2 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.582007Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:96dc029f4fa5ef07d5631450b83cd346d77234127a351c96bed090547193fa31","observation_id":"5d816465-5b4d-4edf-9dae-ef9edcb73b9d","resolution":{"observed_at":"2026-08-01T01:56:15.582007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T01:56:15.643853Z","title":"Kimi-audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.643853Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:a058068e03af6ea62d5175ffc65faf0090348eff9f6fcf3342222eda54dca986","observation_id":"58d307b7-9d7c-404c-854a-5ea24074648e","resolution":{"observed_at":"2026-08-01T01:56:15.643853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.710381Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.710381Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:6b669466a5d10a1ae629e5cbe40a52f594feea23018fb349e48b8d9aa1664f83","observation_id":"d578521b-6cf5-42c1-9e29-891972d52e35","resolution":{"observed_at":"2026-08-01T01:56:15.710381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.786819Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.786819Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:65eb8cb2c432757e72bd6e421f59fd5045ed232e75695f316219e672fe89ff12","observation_id":"439f410c-7174-4e76-9da5-854c20fb5d8f","resolution":{"observed_at":"2026-08-01T01:56:15.786819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:15.898512Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:15.898512Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:ce3dcd90ece75bf9bb642f3a8067da41ac698270ef204854aee1860c532704ee","observation_id":"9b6ba220-21d1-4e99-b018-4c3eff565498","resolution":{"observed_at":"2026-08-01T01:56:15.898512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:56:16.007863Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:16.007863Z"},"links":{"citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:941b43e0ac136bc015d9742683ec7c4f23dfd87c84291eab5a36e433770cd4ee","observation_id":"68fa27f4-268f-4a15-a670-90b7d39b72ba","resolution":{"observed_at":"2026-08-01T01:56:16.007863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.27756."}