{"as_of":"2026-08-10T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73e4c3a7708d198e14d3a3d1acde3deb1ffa68485e19d2fc95d44c7a7c427290","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:07:04.687245Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09389/citation-record","integrity":"/paper/2508.09389/integrity","json":"/paper/2508.09389/citation-record.json","paper":"/paper/2508.09389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:03.392930Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.392930Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:8910268d5b3c1f55b38e0559a1cd925f4ff111cf3cfedc83829a67843a37bd86","observation_id":"af1a2e70-ef1f-4678-9637-0e6f929c58fa","resolution":{"observed_at":"2026-08-05T21:07:03.392930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.444869Z","title":"Wagner, A","venue":null,"work_id":"9362c7f0-e9cd-491a-a5d5-91568d1da164","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.426682Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:c2b7db86af1eebd3e58eb67e1152d1935a23995b5c529c666b4897e14948360b","observation_id":"b5873b97-a4c4-4314-99f3-7984d46fb1ec","resolution":{"observed_at":"2026-08-05T21:07:08.485839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.339794Z","title":"Baevski, Y","venue":null,"work_id":"2070cb99-92a6-4e93-b07c-68bfff553902","year":2020},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.468678Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:5072f34a435271cc40811af8c1e904022e599dae88613757c0d40ac6a82a4f60","observation_id":"52a0aa08-64bc-4cd2-9676-469174888258","resolution":{"observed_at":"2026-08-05T21:07:08.399393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.182148Z","title":null,"venue":null,"work_id":"2a501847-0403-4b32-8251-b5f43fbee281","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.512136Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:1e46f5640c0fcb704925564cf54e70d0bdf1f8822881943f3c85585e1c32a805","observation_id":"30ba750f-32dc-495a-b0c0-4af55fa2fdee","resolution":{"observed_at":"2026-08-05T21:07:08.261096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.046495Z","title":"Jiang, Q","venue":null,"work_id":"658209e7-ef20-4634-b2e1-ac3cf8bc0612","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.556782Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:50ece20c74aec808af11e591d75ed6499c50b1c2e1c8afd670dab933990e470a","observation_id":"073d556f-515d-4951-b668-902da2c5dd30","resolution":{"observed_at":"2026-08-05T21:07:08.129029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.910462Z","title":null,"venue":null,"work_id":"3bb33af9-1dfe-46c4-9f81-7334971db078","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.589543Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:fd982b9a2d01b63c1ce47c4cbe831f6a794d697dd359397e3417e7fb49f31b7b","observation_id":"8b485f06-3b51-41a9-9497-33afda1f5c45","resolution":{"observed_at":"2026-08-05T21:07:07.965985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.802777Z","title":null,"venue":null,"work_id":"566267fc-f2ac-4480-ae25-259509df7d36","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.625457Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:47c20478c30f111e38dd76cf270b9fd3d53a49be1d9f32cf91574fb706a9c8ae","observation_id":"510c333e-deb1-49cb-9811-631a0ef59daf","resolution":{"observed_at":"2026-08-05T21:07:07.854392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.724527Z","title":null,"venue":null,"work_id":"4eaa8e08-7fa6-4a10-9e5a-83889262bb08","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.662986Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:c1d62475fb2c1cb9177aab60e0dd775d81397d6d27aef820b74d7eae76739d6e","observation_id":"849a7761-7d76-48e1-8936-273a62fed5b9","resolution":{"observed_at":"2026-08-05T21:07:07.754490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.645220Z","title":"Chen and et al., `` WavLM : Large-scale self-supervised pre-training for full stack speech processing,'' IEEE Journal of Selected Topics in Signal Processing, vol","venue":null,"work_id":"6b2398da-0d83-4d4f-b8af-876e512dcb57","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.690668Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:38e96d8bf26845525fc267773ffc61c71218c5ebb78fdebe2ae21d55c0f7b4ca","observation_id":"33bda1b8-93c3-48ee-a26b-0ef4fb9edb24","resolution":{"observed_at":"2026-08-05T21:07:07.675074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.559696Z","title":null,"venue":null,"work_id":"1f06a6b6-774b-4aaf-82de-32f8f1bd053a","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.723867Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:58eedbaea1d9cd641bfb7710cf01df510cb90a9d78190604cbffd0f4fc61fddd","observation_id":"68ce735c-3cea-4a7f-a8a8-ef00fb36557b","resolution":{"observed_at":"2026-08-05T21:07:07.574432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-05T21:07:03.766330Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.766330Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:e488fb9a74e42de1667b7b5abcbcc4e78cf058d750fd65a6dd4b936d43562a77","observation_id":"2146cef1-0d9c-445e-8e79-3a3c1cf73e2a","resolution":{"observed_at":"2026-08-05T21:07:03.766330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.473170Z","title":null,"venue":null,"work_id":"645d2049-d0b5-4437-987d-629adbd6df86","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.800887Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:90f9638f0165499c5dfaabc5426e2a38b67fb163ba29076738d5757a46a7d656","observation_id":"ebae925a-c0c4-431a-9a5f-6daf5f8979c3","resolution":{"observed_at":"2026-08-05T21:07:07.523069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.391870Z","title":"Jaegle, S","venue":null,"work_id":"b00f6af4-bfb4-4fbc-a54c-6a174290f2c7","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.822689Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:4cc12d4167e257cbd85bf76a98c7a3d27b56cc4c3836686d81c1322932c8ff7a","observation_id":"9e9cc14b-066b-44b6-927d-de7b65985e09","resolution":{"observed_at":"2026-08-05T21:07:07.433153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T21:07:03.845459Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.845459Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:56c5676418f61fcc3e08a9db2edf48674d1cae2eb5cba5f896b0d50dcf429dbf","observation_id":"8a8a0fbf-90ba-4799-b43e-99a25a9b2dc5","resolution":{"observed_at":"2026-08-05T21:07:03.845459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.326865Z","title":"Thienpondt and K","venue":null,"work_id":"ca8cfcd5-bc5e-419c-9a27-44adfc61fede","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.879763Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:28c56b9d8a5ddea3a9d1ac20b191df4c7f62d1e10af6f6a2d53b2c87c667f23e","observation_id":"46bb490b-bbde-45f4-904c-71f4528fcfdc","resolution":{"observed_at":"2026-08-05T21:07:07.354116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.267356Z","title":null,"venue":null,"work_id":"518b2d4a-8636-413c-ba92-fd71ed16a4ea","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.909560Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:797d1dfd9316eaaa702a73b551d8c076fb09893fde2351f0b592b66e2ec3700b","observation_id":"1cf83928-2b6c-4840-9b02-bc8bcb071a9c","resolution":{"observed_at":"2026-08-05T21:07:07.292966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.133632Z","title":"D \\' e fossez, G","venue":null,"work_id":"193376e9-ec70-4e10-ad2a-598c3063582c","year":2020},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.953723Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:4665d1356fa8f1f75b30a915a93d4c9c3763c673cd6d60496c1d077ddccd8ac2","observation_id":"4fbf5936-3483-4f98-80c6-83eea5fa60d7","resolution":{"observed_at":"2026-08-05T21:07:07.235373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.064878Z","title":"[Online]","venue":null,"work_id":"84e2bff3-a222-4754-93c4-44003837be9a","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.989061Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:5bd6de1e2408b75259d53986b71c44e31ba088a0d214cb6e9322150c1bf1bc67","observation_id":"416172af-8556-4ed3-9f76-b28532e974f2","resolution":{"observed_at":"2026-08-05T21:07:07.107419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.017960Z","title":"Savitzky and M","venue":null,"work_id":"a199a735-8a49-48f1-9c87-3fab8ebe48b8","year":1964},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.025652Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:ecaa3ed71dc8b460b082c5b44311f3a3ba623a293b99f346134c5ee49396d2fb","observation_id":"afc6c093-800b-474b-a11b-abdde27d1a8b","resolution":{"observed_at":"2026-08-05T21:07:07.041268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.963206Z","title":"McAuliffe, M","venue":null,"work_id":"f45403e6-262c-4548-a732-689954be4841","year":2017},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.063921Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:1c085947d388a13f8190f1db978ad2d9812f7bc3902513348a716cca069c31fa","observation_id":"0ffb8e84-dbd6-47a9-af88-b77afcc43944","resolution":{"observed_at":"2026-08-05T21:07:06.989837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.865114Z","title":null,"venue":null,"work_id":"6b0a67a9-6ee5-48d7-8b86-9148e0fedb0f","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.097536Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:9f6711376e54d2b02773a9974e22f37c779987cb36b7356213539f158247c121","observation_id":"ebc4f2b6-ecab-416c-b742-da4688d141b8","resolution":{"observed_at":"2026-08-05T21:07:06.899480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.786043Z","title":"Ho and T","venue":null,"work_id":"323af39b-81c5-4eae-b08e-2caa1a050f39","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.133097Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:b20583411d90d47e32032e9480c90689abb4a7a8020287c680b87aae45265e1f","observation_id":"d78f63c6-a3a1-493e-9751-33e2ce28aa84","resolution":{"observed_at":"2026-08-05T21:07:06.819254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.700253Z","title":null,"venue":null,"work_id":"afdf2741-74a4-40b2-905c-3ff1e8239d88","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.161999Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:0802b774ebd97c9e9b27f71bf411be9e9d11b14b56eb7cb13212357555ea2ac2","observation_id":"779a764b-a4ca-4ea6-9193-ebae064395b7","resolution":{"observed_at":"2026-08-05T21:07:06.732893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.587729Z","title":null,"venue":null,"work_id":"37c3cc31-e584-4f0a-9886-ed2b50d60b5d","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.184020Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:867236536cf53c6225d0bcbd8dcecf074334a345471fb3e52390ad2815b46a99","observation_id":"a279429e-af67-41a2-8811-3b7a78d59f09","resolution":{"observed_at":"2026-08-05T21:07:06.653050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.457506Z","title":null,"venue":null,"work_id":"06f5de1d-1810-41dd-8f47-2d397ec89ed3","year":2015},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.219170Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:829c97d770bcbd85b9565d2c0463704741ba7818e2601cee1278073e645f8b32","observation_id":"4a6ac999-b6fa-47d2-a0ba-95e04b6be0cc","resolution":{"observed_at":"2026-08-05T21:07:06.514086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.280922Z","title":null,"venue":null,"work_id":"068e7053-1786-4ea9-8e0d-ded00de26bb7","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.244925Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:5c6971d08ad13ba1d73b0801b22c676261ef9d6dcdfced63ca6230ba7a3b3c41","observation_id":"f938aa3e-05a2-4e59-b06e-1b254ccb8a0c","resolution":{"observed_at":"2026-08-05T21:07:06.350653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.156850Z","title":null,"venue":null,"work_id":"07fe48a2-d029-4efa-a49e-4eb2a7037469","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.272721Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:9126585c4d5d554652d3018bfcc9be239bf94efdef056f2c60c0521cff550d49","observation_id":"445d7921-3f95-4ac2-85e9-c3dd7f0b231a","resolution":{"observed_at":"2026-08-05T21:07:06.215093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.982403Z","title":"Chien and H","venue":null,"work_id":"050cb73d-3b01-47ce-a543-c2090a67df2e","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.304091Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:512ac73613803c34a6b3cfff1a515a0acd0d81c96f56818dd929d0c16f60736c","observation_id":"4bbd39f6-33c2-4024-8488-2ec61a01b45e","resolution":{"observed_at":"2026-08-05T21:07:06.073832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.829599Z","title":"Raffel, B","venue":null,"work_id":"794491b4-5775-4cf8-b511-fb1052957146","year":2014},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.329730Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:ef181b49174f0f95e3c7f4c06681d60b3aa9bf8afb86dd943f60c9c522f32fd1","observation_id":"4b244e50-cfc9-468c-be08-82b4a237f0ab","resolution":{"observed_at":"2026-08-05T21:07:05.915428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.660043Z","title":"Kum and J","venue":null,"work_id":"280545c8-45a4-4dd0-873f-0d2684e1f6fc","year":2076},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.376099Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:bb3ba19b75d64cdfc820fc40b9b4120c432d25a001913a1042cb605ed089e00d","observation_id":"085fcc26-4427-4cef-97ae-1b99dfeba0b0","resolution":{"observed_at":"2026-08-05T21:07:05.717625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12258","last_updated":"2024-08-12T03:23:09Z","snapshot_observed_at":"2026-08-01T14:42:12.372500Z","submitted_at":"2023-01-28T17:30:47Z","title":"Cross-domain Neural Pitch and Periodicity Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12258","snapshot_observed_at":"2026-08-05T21:07:04.400204Z","title":"Morrison, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.400204Z"},"links":{"cited_paper":"/paper/2301.12258","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:2e1f94b96e9e743e79268d8482a2b3d1c24ec40ec905453bec04bdec05056d03","observation_id":"b953254c-8fb6-49bb-aab0-3c25f2473642","resolution":{"observed_at":"2026-08-05T21:07:04.400204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.556917Z","title":null,"venue":null,"work_id":"6e5b44e3-feba-4382-94aa-f8792bd88e47","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.437160Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:a4c7e8437676472c0a6b35243db46dd57f4ef74c27a529b3b9ef0b1ece42dc5e","observation_id":"7d9b7316-2466-46dd-8d55-e72c6777a1e8","resolution":{"observed_at":"2026-08-05T21:07:05.609688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.385961Z","title":null,"venue":null,"work_id":"e65de8c0-ed3e-4088-a91a-153884e77c8e","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.476948Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:755e4f5d5db7570bdf9de4a00360df5497601edd6149afa97e7605b499cdcde6","observation_id":"757d582c-7539-4185-883e-98236c4a11f3","resolution":{"observed_at":"2026-08-05T21:07:05.453706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.197042Z","title":"gil Lee, W","venue":null,"work_id":"b56cdf4f-19a0-4f4b-b07c-808c540a1ae4","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.502451Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:a018297ac3729fc2aeb97275d1bca46e9574bcea9e98f18674eb866d9197b071","observation_id":"438cf40b-a22c-46a8-924f-86339afdbdfa","resolution":{"observed_at":"2026-08-05T21:07:05.287075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.128935Z","title":null,"venue":null,"work_id":"ef676bef-5025-48ca-8ac9-359b6b22a850","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.550439Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:1a7f06ad091096a59728fa23343cce55c9db0a3e5d489e0dbb5fdedf5f9737b0","observation_id":"1ff76753-3a61-4009-814b-4b9ede024937","resolution":{"observed_at":"2026-08-05T21:07:05.150939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.067029Z","title":"Casanova, K","venue":null,"work_id":"619df10c-0b48-4600-8c4d-7e3969266bcc","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.587098Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:dc9f437ae8c4094062e918ddf4fec5defd11ccfb5b18097c9a4a520be135b046","observation_id":"585a22ff-5893-4dfa-a74a-fc7f4143d51c","resolution":{"observed_at":"2026-08-05T21:07:05.095755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T21:07:04.621533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.621533Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:3ba355b6e3823bb58c6309cf332189a465f81c18c8250ad5a3880bc4f086f3f7","observation_id":"629c8f73-b06a-4b22-b96e-9b67c73425ec","resolution":{"observed_at":"2026-08-05T21:07:04.621533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.007983Z","title":"Peng, S.-W","venue":null,"work_id":"0f0dda4b-513e-4abf-ad49-c6de6ae022d5","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.649558Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:b83db60ae6475d7d355bd7fd49a75eb41caa2a0b7995b198554d84e7e637f479","observation_id":"59de97ae-fb79-4ea4-a473-fef5f4c7a4e3","resolution":{"observed_at":"2026-08-05T21:07:05.023785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:04.923009Z","title":"[Online]","venue":null,"work_id":"a6f5e126-b0c9-4657-81f2-df7fc05b6610","year":2025},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.687245Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:9423b1197bd10e646a03fae8b23f0f3566dfa8166f8af50d1bde8354b4539647","observation_id":"19a7a2ec-eee2-4611-88ef-c64fb9797595","resolution":{"observed_at":"2026-08-05T21:07:04.962167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T18:37:58.620699Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2508.09389."}