{"as_of":"2026-08-20T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fab2fb9b084547ba934ade3d484923c92ec5edea8de1b6a12d0a4d3fb6b90568","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:35:09.308182Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12597/citation-record","integrity":"/paper/2505.12597/integrity","json":"/paper/2505.12597/citation-record.json","paper":"/paper/2505.12597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:08.960163Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.960163Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:f130e8c574a72ed698b9637b11d9b3a5630b292b6e63e7fb814ce3f62a873865","observation_id":"ae5e58f0-03d1-4346-a055-802cb183332d","resolution":{"observed_at":"2026-08-15T20:35:08.960163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:08.967705Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.967705Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:8da7898e7513fd7f90b76903747ac4ed648ac0b8807d295867cb4591cca8f998","observation_id":"6409d19f-3b55-48d2-87e4-622526bfb733","resolution":{"observed_at":"2026-08-15T20:35:08.967705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.636010Z","title":null,"venue":null,"work_id":"a9445093-a9c4-48f8-bf95-7e24be20b820","year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.977202Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:17d02ee02fc836a094ae7042671c0158a00da051bb842c33ecac17b88f89e1c6","observation_id":"09bc8a9c-ec9f-4e2a-b5b0-e8e24d2f5a2a","resolution":{"observed_at":"2026-08-15T20:35:10.646922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T20:35:08.985545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.985545Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:f300ad944fa8ae30efc25fbe37650a5063820fbfbfd8c096ec19e44e9d96dd3c","observation_id":"72e8507c-a362-4953-b617-07b8a5c1d75f","resolution":{"observed_at":"2026-08-15T20:35:08.985545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.601720Z","title":null,"venue":null,"work_id":"9e6dc1d5-9c5b-49ba-85e3-3ab3bbe7b459","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.994140Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:683bcd50e382197cb3bab863f2ecfd23ac6162d849e8eed6ca011dd145abd37a","observation_id":"052230bd-327f-417c-a3b9-9cf3fe48c31a","resolution":{"observed_at":"2026-08-15T20:35:10.611767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T20:35:09.001537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.001537Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:edec1c9b728fd9f4fdfd633282d4ef3ad7cad79f0b4a85e6f131006d99bc971e","observation_id":"90e12740-26e9-443c-96cb-39f7a57ca83c","resolution":{"observed_at":"2026-08-15T20:35:09.001537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.011603Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.011603Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a26f14c2f1f58794856ad5970941bfa4114b7d928776740095b632364dc2ed9e","observation_id":"0b4f0f68-8f82-411e-aefa-e840f1812c7c","resolution":{"observed_at":"2026-08-15T20:35:09.011603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1428","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.460006Z","title":null,"venue":null,"work_id":"e89a4654-63cf-47b9-a239-582fcdc7f7a9","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.027141Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e4fbf7f517ea1183f95314af85b6bd371d46243a50f2adc6bc0d50ef376c9915","observation_id":"af5f3f72-0113-445e-8928-2fc4a699b899","resolution":{"observed_at":"2026-08-15T20:35:09.466550Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.552757Z","title":null,"venue":null,"work_id":"7619f4e9-a605-44af-939c-ba2cc5259a93","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.035478Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:2ba37e9a41e01a3b9ca845cd7f0281a5f5a60e7b7e0f56a623148f271a6d40ca","observation_id":"3861db62-1acd-4612-9da2-66096d02e633","resolution":{"observed_at":"2026-08-15T20:35:10.558146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.045829Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.045829Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:6eef4bfc10b0643514446db5f7293ceb7f27194a1f237d46f65b66dd313927c5","observation_id":"7a787d59-741f-4955-82ce-d974d43b1bac","resolution":{"observed_at":"2026-08-15T20:35:09.045829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.500625Z","title":null,"venue":null,"work_id":"0753374c-649a-4b3c-b9b2-2a1a8fe8a73c","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.055204Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:2beac277c5d2fa97b1c4d6cc887e5cae4f8e5136c15c44f86eb80999964d7e35","observation_id":"8566b159-294f-4389-8b42-9c01aaff301b","resolution":{"observed_at":"2026-08-15T20:35:10.505488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.062445Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.062445Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:4b1e0a4b2002d8a8ed9c0e9bdc98456ccf7e2a685921646ff881f7a3bc0ad9aa","observation_id":"3c89afce-a0b6-4fad-86ee-e1758a20f5c1","resolution":{"observed_at":"2026-08-15T20:35:09.062445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.448408Z","title":null,"venue":null,"work_id":"9058ac4f-a232-46df-91eb-8d33a43e7294","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.068899Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:c1948f735a34d586cfade5971c13105e9fc10dfc842e74f37502a5756283d851","observation_id":"290739a4-6f00-4403-b9e1-f3abbd42c752","resolution":{"observed_at":"2026-08-15T20:35:10.463471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.423759Z","title":null,"venue":null,"work_id":"73a95251-36aa-4e7e-8c08-98411d9f7249","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.074744Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e5dfbca8170d824490cc6685a623f1c151d6086f0ab9c3f4ee9f87f90971f1e8","observation_id":"bcd9ec48-c036-49ee-b09f-f2b4ca8b2e99","resolution":{"observed_at":"2026-08-15T20:35:10.432740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.399147Z","title":null,"venue":null,"work_id":"97788d18-4916-42d9-b07f-2970a280dba6","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.083856Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:7fa9db93c29ab0463ba3764328e59c508e602c6e9227472ce85dca33f61db911","observation_id":"342abdd9-2457-45b3-9d3c-3c3846fa8420","resolution":{"observed_at":"2026-08-15T20:35:10.404876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.360399Z","title":null,"venue":null,"work_id":"834dc076-2227-4fd2-8670-428fdda8e58a","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.092236Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:c3551ca9772897a419414ead8c797e51788cdcfebf3b73bfa1f7e2becd453da4","observation_id":"04f72e2c-c816-4b53-9300-ea24b0799737","resolution":{"observed_at":"2026-08-15T20:35:10.376420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.340253Z","title":null,"venue":null,"work_id":"cbfcc685-8bea-4eda-a59f-3db049365fe9","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.102166Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:b9e346aab373d0b95cc735e8c925a1c972a946ba1a81b8bd5625ab0138f226f3","observation_id":"c9dab023-8573-4b0f-a375-fa78cfff497e","resolution":{"observed_at":"2026-08-15T20:35:10.345252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07218","last_updated":"2024-04-10T10:05:16Z","snapshot_observed_at":"2026-08-16T15:16:18.193848Z","submitted_at":"2023-07-14T08:21:25Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07218","snapshot_observed_at":"2026-08-15T20:35:09.112409Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.112409Z"},"links":{"cited_paper":"/paper/2307.07218","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:604de6562706a8da6b2fc9ad49b1487d22458883fbe629d0481ffb76ad4aa56a","observation_id":"ddf68caa-924b-4436-8be3-1522db9fd80c","resolution":{"observed_at":"2026-08-15T20:35:09.112409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07969","last_updated":"2024-06-12T07:49:21Z","snapshot_observed_at":"2026-08-16T13:43:52.089811Z","submitted_at":"2024-06-12T07:49:21Z","title":"LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07969","snapshot_observed_at":"2026-08-15T20:35:09.120769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.120769Z"},"links":{"cited_paper":"/paper/2406.07969","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:7d7e9de53ac86b7781a360870b350d15a455f71b06196342117b915ef621658c","observation_id":"f25ca859-113b-45ab-be92-2fa7fbc5aff1","resolution":{"observed_at":"2026-08-15T20:35:09.120769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-08-16T14:20:12.870542Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-15T20:35:09.129467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.129467Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:7b1e6e66e43dfe43b1dd38d3bb96e8bd714025ae660582ec3b4100b0116252b6","observation_id":"9daea345-5ca3-45fc-9e0a-eb44fcc4d76c","resolution":{"observed_at":"2026-08-15T20:35:09.129467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.136192Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.136192Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e60e413d262d48eb64ec8b90d11a20a340cf8bb035ff6002d16605ba3c7a9d9f","observation_id":"84fb09ab-4d60-4217-ad46-6f559a93dd0c","resolution":{"observed_at":"2026-08-15T20:35:09.136192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.284094Z","title":null,"venue":null,"work_id":"ab50d541-2fe5-475a-b32a-e4ad3f3608bf","year":2020},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.143137Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:fe8a274500dc704bf1d4476cd58275d9f0d3fb284ed6cda053661e07e5299afb","observation_id":"e0060550-d73f-472b-99e7-7411a283bb40","resolution":{"observed_at":"2026-08-15T20:35:10.292571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.257798Z","title":null,"venue":null,"work_id":"201b4340-4efb-4888-b58c-f6f48969689e","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.149304Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:9cd41745128085254fc93c6e9c316b789637d988ae000424058f3ccdeb60763f","observation_id":"23b5998c-79cd-425f-9132-a8fbab975011","resolution":{"observed_at":"2026-08-15T20:35:10.263124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-08-19T21:34:57.724125Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-15T20:35:09.157532Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.157532Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:877e8f66d39a3500bbec3a63bafeb62110a09b162414262d741533ddf8e2be9a","observation_id":"661acce7-0c14-4e54-80d2-eb2490f43e65","resolution":{"observed_at":"2026-08-15T20:35:09.157532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01495","last_updated":"2025-05-07T13:05:04Z","snapshot_observed_at":"2026-08-16T13:13:23.795289Z","submitted_at":"2024-10-02T12:45:09Z","title":"OV-MER: Towards Open-Vocabulary Multimodal Emotion Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01495","snapshot_observed_at":"2026-08-15T20:35:09.164163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.164163Z"},"links":{"cited_paper":"/paper/2410.01495","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:1b2cb087971bf80e718d08f63f6277cb4a4a2bf70a4317dbf0e5ef030136c969","observation_id":"4ecb5401-b47e-4399-9825-5412c6dafa06","resolution":{"observed_at":"2026-08-15T20:35:09.164163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.232466Z","title":null,"venue":null,"work_id":"537f4378-349a-407f-ac28-cc24b9887aa9","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.169932Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:5408d34b0fc7101a1eea9bc6072786249fd60c6d685fdacf1fe4644e9369ac11","observation_id":"4818460f-74e7-4b60-b2df-470a071c069c","resolution":{"observed_at":"2026-08-15T20:35:10.242731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.204197Z","title":null,"venue":null,"work_id":"0419cf98-16e2-4530-96c8-dc3d0e50cc87","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.180889Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:120341049f19856fdd6ae33ba5ad05aeafec33c3bfb53cb45ee72741bdf21b44","observation_id":"c250e613-1fca-485e-b1f5-06f0858b39eb","resolution":{"observed_at":"2026-08-15T20:35:10.211795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.171590Z","title":null,"venue":null,"work_id":"9790a453-aec2-4764-ac27-f17a62b55da0","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.187867Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:d1cf8e4095a4d88faf7e0d2e0619cea70c7facd8b5fbba5c2666edadd6173578","observation_id":"2c2dac6c-502b-4542-8bc7-5ba4c38a7982","resolution":{"observed_at":"2026-08-15T20:35:10.182529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.146953Z","title":null,"venue":null,"work_id":"bc5d2d44-e2c4-4cfa-8eaf-e88d19492103","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.197429Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:629ffda29d0a79fe4ec9ae0cd58971f1588e3a4f9879b1c81ca8e50beae54cc9","observation_id":"f2128cd9-b8a7-492d-8622-d3d181b17db1","resolution":{"observed_at":"2026-08-15T20:35:10.154278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T20:35:09.206229Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.206229Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:231ed4ead80d306b937ed52c4d86ec57beeecdd3e2bfdbfe4d7fc67bf0576f8a","observation_id":"5381c12b-3e5b-459b-b08c-a135c30f2813","resolution":{"observed_at":"2026-08-15T20:35:09.206229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.212575Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.212575Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:bbbd2e26cbae91ea4d7486f5756dc2e7ec23491d5c12eedf0820871d5e47d5fc","observation_id":"eff4ed8e-3c28-4211-b36d-a0a579300c0c","resolution":{"observed_at":"2026-08-15T20:35:09.212575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.126543Z","title":null,"venue":null,"work_id":"611863c0-e11c-4056-b2c4-abacc1997899","year":2016},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.218883Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:32972b6c80732eaf91e97be4e436878ad96ed1be39f8c70f4e27397350502f64","observation_id":"513a7016-5a73-4aa6-a4e8-dfe475672083","resolution":{"observed_at":"2026-08-15T20:35:10.131715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.099815Z","title":null,"venue":null,"work_id":"4871bbd2-d5f6-468b-84d6-336b9b15ee14","year":2007},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.225707Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:ba65f40e3af97e46cc9499d9b0740fb5e26829a815e6ce55fb49d07fc06e6a8d","observation_id":"9d08bf7c-8886-45df-bf3e-f7e27e75e283","resolution":{"observed_at":"2026-08-15T20:35:10.106727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.077668Z","title":null,"venue":null,"work_id":"91b17a11-5539-4b59-a417-6168a8b11db6","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.232870Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:d2ece0fdcb3250e05261d03a40fc50035aaceedcd88b52cc080c98f5ab32b825","observation_id":"d9977433-5100-4220-8b89-58ce33f24bc4","resolution":{"observed_at":"2026-08-15T20:35:10.085317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.043924Z","title":null,"venue":null,"work_id":"fa532ed9-3505-4ff4-be39-9658c42d6247","year":2022},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.240599Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:194ad84607065ab3c8d8bb571ca4f244fffe7f9a2f8d8f7b3f6ea24e3f1aef3e","observation_id":"2dd36ac2-1e86-446e-a0c5-ff68e7140166","resolution":{"observed_at":"2026-08-15T20:35:10.054942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.246706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.246706Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e39a58570ad3b1cf069da66a89bf6b392bb11c6066c27c360bc57e0e9dcbc37c","observation_id":"a6264e87-526f-4abe-9fd6-b1897fabfcee","resolution":{"observed_at":"2026-08-15T20:35:09.246706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.251906Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.251906Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:fdb81452701d639584ed7bbc2874f65b22e3d3c14044d7cadf094c6a4d7e34c5","observation_id":"17d98a7d-415a-4cdc-a503-544fc1431829","resolution":{"observed_at":"2026-08-15T20:35:09.251906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.999014Z","title":null,"venue":null,"work_id":"5e8ead22-4f16-4e1e-934c-0ca1e1682fad","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.257213Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:85534c3649c947a321135a843907f5db6002c2554118d041fade450f887fd0b1","observation_id":"1ecbe796-3b91-48e4-a023-59ce90f95e29","resolution":{"observed_at":"2026-08-15T20:35:10.007664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29902","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.402866Z","title":null,"venue":null,"work_id":"cff096f1-1e79-43b1-844d-b6de62fd3796","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.265484Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e6edc908d57a1b4629fd8b10f01ecdb6aeeb4000d2fb371bbdcf3b93c3e608cc","observation_id":"10ba1b14-69a6-4419-aae6-79cbb382c351","resolution":{"observed_at":"2026-08-15T20:35:09.416747Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.965565Z","title":null,"venue":null,"work_id":"22715a60-c9a5-4d7e-b989-b638f94f9b43","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.271929Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:b262f07183c537950ab1b9afa25db593091ce9ee06a36f6b1338731bd110c129","observation_id":"75da115d-3de1-45a7-9744-4d92a234a9ea","resolution":{"observed_at":"2026-08-15T20:35:09.974745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.931261Z","title":null,"venue":null,"work_id":"c4b06e36-97b1-458b-b3bb-e86c2fda447e","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.277919Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:91df92564d72073977af6645a6cb57ad5a7ab531cc60a8cf35a6495f8e155c70","observation_id":"709a7201-9fd7-4612-b282-45c6fa2ccee5","resolution":{"observed_at":"2026-08-15T20:35:09.938624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.285624Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.285624Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a0b23da14991c95c62ff5c32f0aec80a70b6e05445b1dbd4ce5e43696e8a0dbc","observation_id":"e334ab5a-63c6-45b4-b0c6-8ca3475082ca","resolution":{"observed_at":"2026-08-15T20:35:09.285624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.292659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.292659Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:ed9f55626e63deeb46d222c8bb0c2f3944eae2fe0d96e52a5801f33e3cb88127","observation_id":"506ec9c9-a4c9-4816-83c9-6070504c19a2","resolution":{"observed_at":"2026-08-15T20:35:09.292659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19669","last_updated":"2024-10-14T12:19:44Z","snapshot_observed_at":"2026-08-18T13:55:08.057127Z","submitted_at":"2024-07-29T03:12:28Z","title":"mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19669","snapshot_observed_at":"2026-08-15T20:35:09.300807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.300807Z"},"links":{"cited_paper":"/paper/2407.19669","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:9b3f5f6a822eccc8420b2cc55dfb611ce07129561efffb070431ad2fc6d85309","observation_id":"1dc25a84-3d3b-4142-86fc-1da7a4cddafa","resolution":{"observed_at":"2026-08-15T20:35:09.300807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.308182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.308182Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:279f8dd5a7bcc38cb6d0893b6796bfbeee7495602491f7321f14fc62926c227b","observation_id":"10f93fe0-7955-4e98-a85b-5f4a4b1b358e","resolution":{"observed_at":"2026-08-15T20:35:09.308182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.12597."}