{"as_of":"2026-08-10T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58a35744b3ffc9a3ec422001f47eb00998f4e3b035409794f50fe9a117377068","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:46:19.243232Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T06:04:29.936928Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T06:04:30.077501Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"cited_work":{"arxiv_id":"2507.10109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10109","snapshot_observed_at":"2026-08-06T06:04:30.077501Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","venue":"cs.MM","work_id":"bef773ce-eb93-4042-8cd4-056e9f270511","year":2025},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.936928Z"},"links":{"cited_paper":"/paper/2507.10109","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:3f3ead3a36e80c7ae2a5daaf28ece43336fff7b7cdc542bbad9e1031c40eee8f","observation_id":"9f73405d-b2d7-4205-bea6-b06ea22e0311","resolution":{"observed_at":"2026-08-06T06:04:30.083418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10109/citation-record","integrity":"/paper/2507.10109/integrity","json":"/paper/2507.10109/citation-record.json","paper":"/paper/2507.10109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.522607Z","title":null,"venue":null,"work_id":"2141eacb-b791-4e44-abdd-1c0f1506083e","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:12.972404Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ad8d14554866dfe8fde5c0d700f9b4579d50b5d4e94779c904118f5a098b5821","observation_id":"37ec9f19-0267-400f-8dc4-186cffcba3fa","resolution":{"observed_at":"2026-08-06T17:46:26.620782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.291768Z","title":null,"venue":null,"work_id":"2464b5db-08db-49e0-ab8d-6492e6a0df69","year":2020},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.063080Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:aaea81a134dd9bf616989087db030e063b9aa490178a6967945ec8d7932da4f2","observation_id":"33e3d267-b0bd-4db1-9e4a-d1cc222ff02c","resolution":{"observed_at":"2026-08-06T17:46:26.409135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.085279Z","title":null,"venue":null,"work_id":"162e5a0d-87aa-47d8-ba0f-0202b248838d","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.181371Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4ebcba100ba8f21bbaf726e259f9f5fb9009796a923046ad959eab56e13dd262","observation_id":"279008d1-a795-4170-97b3-afdac7bdc411","resolution":{"observed_at":"2026-08-06T17:46:26.181674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T17:46:13.348025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.348025Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a21bbdbee37c457c352cabc3d044036c326d67e9043fbe22ab493c54a98de960","observation_id":"e6801440-a98a-4f92-acfd-75a1da97f3bc","resolution":{"observed_at":"2026-08-06T17:46:13.348025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T17:46:13.509047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.509047Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:781bf583f18c0aabead8cbdaa4b9dea426d28dcd84813e0b9136c48ac398205e","observation_id":"20b2da09-6e34-4360-a3a7-76032610e109","resolution":{"observed_at":"2026-08-06T17:46:13.509047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.941019Z","title":null,"venue":null,"work_id":"cfd24d23-ed4e-4244-a865-442d35e14cbd","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.584990Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:223d22e23c10493feab48a3144649c79c8d45de5588712a75790552b02861bab","observation_id":"5fb1a958-27a4-49d4-a92e-1e2e09f2bb59","resolution":{"observed_at":"2026-08-06T17:46:26.008575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-06T17:46:13.686519Z","title":"Schwing, and Yuki Mitsufuji","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.686519Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:2410e86029db851a5dcdae6aa6b44a55f1dc4f50ac579dcb74f280663355d548","observation_id":"713fd661-c934-40de-b955-c4023f195efc","resolution":{"observed_at":"2026-08-06T17:46:13.686519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.775695Z","title":null,"venue":null,"work_id":"2946d361-ba5e-40e0-8ed6-0b22fdd12cf6","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.792235Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:5acb4f3123bbb25c696d2503e183dd4a672109da0679cd5f341110dc8b891e62","observation_id":"96d79e06-cee1-4956-9569-cf243ea2cd07","resolution":{"observed_at":"2026-08-06T17:46:25.846602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19486","last_updated":"2025-05-30T17:57:46Z","snapshot_observed_at":"2026-07-06T19:58:44.149533Z","submitted_at":"2024-11-29T05:55:20Z","title":"V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow","version":2},"cited_work":{"arxiv_id":"2411.19486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19486","snapshot_observed_at":"2026-08-06T17:46:19.902908Z","title":"V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow","venue":"cs.CV","work_id":"4fa30ae3-e5d8-4974-a14d-2f330d729bd0","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.885497Z"},"links":{"cited_paper":"/paper/2411.19486","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:7f42121e1fd661ed74d4d10de7cfc5120c78488ec9e48a25d1134f7182c0911b","observation_id":"af46798e-68a2-4bfc-a683-538e14f5b39d","resolution":{"observed_at":"2026-08-06T17:46:19.957973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.599365Z","title":null,"venue":null,"work_id":"46716336-006d-4ef3-88d1-a1780eabfc11","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.957998Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:950c3bd798b9d759a587eebe393c9ba074ea0500c68c7a1c5b542ecbc7b6bb74","observation_id":"3539a8e8-b6b9-422e-b7e8-535a6d171926","resolution":{"observed_at":"2026-08-06T17:46:25.693597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.374291Z","title":null,"venue":null,"work_id":"a20c611b-9ab2-4dcc-9b44-3301503625bc","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.028538Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:8f9402c4ae69d0facd3e55d33e06e8e9ce964ec533e5a68f53dd8c748dc9d508","observation_id":"bd1e16fc-e7a3-459a-8aa2-8b710ccffd68","resolution":{"observed_at":"2026-08-06T17:46:25.478203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.174781Z","title":"Russell, and Andrew Owens","venue":null,"work_id":"39b0ad6b-7387-47a7-9ce8-904826240383","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.097517Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d3fde0c56cebe75c536679f2ee0a8204bb6704fe4afdf674fa66691b3a90f15e","observation_id":"05516ffb-ffcb-411c-b448-4b524f94e2d8","resolution":{"observed_at":"2026-08-06T17:46:25.270345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T17:46:14.237637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.237637Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:c38da99dacc16f2adda7197e07944ff1bf641434e6dc7973bfc0bfcdf98d117e","observation_id":"7500dc1f-d9f1-4e22-816f-8eff8d1f2d58","resolution":{"observed_at":"2026-08-06T17:46:14.237637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:14.325703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.325703Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:5d82435564b5f02ff7670810db75883382fe4ee4cf31f61e546469ff22251077","observation_id":"f60c6bcb-e0e9-4e14-a6af-32311c28ccdc","resolution":{"observed_at":"2026-08-06T17:46:14.325703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.520476Z","title":null,"venue":null,"work_id":"16a64206-0b0d-4359-a9fb-8dd326c456b4","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.470174Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:b4feef2025e214d5c9c581e46b543eefa33bc668bf7f6d1b37224eb2f764b5b6","observation_id":"da33c1e8-ba39-4f81-b34e-d7a3e86c388c","resolution":{"observed_at":"2026-08-06T17:46:24.620552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.721251Z","title":"In IEEE International Conference on Acoustics, Speech and Signal Processing ICASSP 2023, Rhodes Island, Greece, June 4-10, 2023","venue":null,"work_id":"49eefc9c-ba93-471c-ac55-478585c545b3","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.399881Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d8f9f378915821c8fe28f6580c6839d33df1af50f691c1bfecea8b32c7bd1e29","observation_id":"93b9eb47-acfb-442e-98db-12b9101fda90","resolution":{"observed_at":"2026-08-06T17:46:24.828783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10591","last_updated":"2024-06-15T10:47:36Z","snapshot_observed_at":"2026-08-04T01:51:42.072498Z","submitted_at":"2024-06-15T10:47:36Z","title":"MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10591","snapshot_observed_at":"2026-08-06T17:46:14.616924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.616924Z"},"links":{"cited_paper":"/paper/2406.10591","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:cb38c5d440a0db2679177078b4c13d81039b7729353b72492207ee524b48c04a","observation_id":"3e0bb405-fcd7-4792-a562-d92b225e889c","resolution":{"observed_at":"2026-08-06T17:46:14.616924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.285410Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":"b98fd863-83ed-43ba-9d63-4bd506f2efbe","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.542109Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:e680ffafaac143aa1de0baf4e64399a1347bc5695db60cbe07a3f8008986ecd2","observation_id":"c03ef0c9-698a-47ef-b11b-dc059e450910","resolution":{"observed_at":"2026-08-06T17:46:24.392742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T01:58:32.784453Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T17:46:14.781335Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.781335Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ab3bb2b51154ce4885419f05ccd60226aafce2068c059e4d0d8979b88a2eca96","observation_id":"abba1354-4e34-4433-88c0-93456f3e50af","resolution":{"observed_at":"2026-08-06T17:46:14.781335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.071932Z","title":null,"venue":null,"work_id":"77432c50-9b37-4c4f-ad7d-0db11e1b5109","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.711057Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4b6c2307b6dfe87430c446fe089f17776b538dd6630ffd9cb9e477d009f6f9f6","observation_id":"b9b38237-e27d-4dac-af82-ec1e839fb9f0","resolution":{"observed_at":"2026-08-06T17:46:24.175716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:14.936094Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.936094Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:de99fa1700bcaa1d1c96308cc3dfcf335a0a48466b57f80f408e4d3d9589aa4c","observation_id":"ff0220a8-2b66-47d3-abd6-7c0f316c06f6","resolution":{"observed_at":"2026-08-06T17:46:14.936094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.851887Z","title":null,"venue":null,"work_id":"17ef2d2c-eea7-48dc-a791-f028ec65ba29","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.853327Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:cd437745e6e6f6aac929d3570c0924d36cf34028499dfcae3678ac7431aa3aa4","observation_id":"1eda6f2e-526f-4acb-b809-f56b05765310","resolution":{"observed_at":"2026-08-06T17:46:23.960830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.283737Z","title":null,"venue":null,"work_id":"b6332381-b145-4a41-91ac-f6c751d42182","year":2021},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.132879Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:c31590aed38b6205a19015c3481ad1f73ec43061da80ee8aef4128523404769a","observation_id":"1ee185fd-e353-4680-b406-11bc1b508eea","resolution":{"observed_at":"2026-08-06T17:46:23.412143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.573481Z","title":null,"venue":null,"work_id":"a9b7d344-7ce6-4c4d-9684-49f884e1c95a","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.031709Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d80e9c658a6eafba8389b047330e451d7ecf1ad77a2890bbb0e08b32ea171825","observation_id":"ce3f8763-5543-4aa8-a484-95c08a948cd2","resolution":{"observed_at":"2026-08-06T17:46:23.702173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07218","last_updated":"2024-04-10T10:05:16Z","snapshot_observed_at":"2026-08-03T16:12:09.462591Z","submitted_at":"2023-07-14T08:21:25Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07218","snapshot_observed_at":"2026-08-06T17:46:15.334498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.334498Z"},"links":{"cited_paper":"/paper/2307.07218","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:901e4d4929d656177d2baab4b84c50d1597a3acf23335986e4064e4bd5ee2aa1","observation_id":"a7780ee1-ce41-48bc-aa46-3f2993a269f1","resolution":{"observed_at":"2026-08-06T17:46:15.334498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-06T17:46:15.230611Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.230611Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f383230a52cad3da03019f018956b3567124e1a7d6f5cdee49f14239ecce4c7d","observation_id":"2292ea90-dbba-4505-9b79-ede17c98baab","resolution":{"observed_at":"2026-08-06T17:46:15.230611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T17:46:15.533022Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.533022Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:2db2b4269fa9eb3069dc469bff18813a3245dd4e8489a389e0ce1852f38bcb43","observation_id":"03647407-1f64-4c07-840f-723e7258cd1f","resolution":{"observed_at":"2026-08-06T17:46:15.533022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.075373Z","title":null,"venue":null,"work_id":"24a09dd4-ccf3-4904-8a99-39f6f8824bac","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.431630Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:beeb02e3e849546e991fa8dad38485b2cca66544f63fbb50a4f163db9863b4c8","observation_id":"1183abe4-53c7-4251-8fd3-81917221eb3f","resolution":{"observed_at":"2026-08-06T17:46:23.177628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.872982Z","title":"Salik, Rajiv Ratn Shah, Yifang Yin, and Roger Zimmermann","venue":null,"work_id":"00408590-88bc-448d-819f-6b2a8e6ded2d","year":2019},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.732760Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:e1dc06e001ca75b6bf2d7175883f8d344bab71127a863357820a58db63910d73","observation_id":"cb3d7ec8-f2d5-4e92-acaf-e0b4150495b1","resolution":{"observed_at":"2026-08-06T17:46:22.955376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:15.631928Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.631928Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a976b9d99b03ba6441f221d110a9620019875d781f6fcd1ad5af14677c36569e","observation_id":"cfe93e57-9358-4e6b-ae3c-1fd69c32cc39","resolution":{"observed_at":"2026-08-06T17:46:15.631928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.471918Z","title":null,"venue":null,"work_id":"03b3dfc1-5ecc-4c0f-9dd0-08e6e8d2b513","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.965671Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:96725cad97cf0017d634aba72579a9e6f9e4fc1b5daab50bc8150996122cdf9e","observation_id":"c1b4caf5-dafc-4d0a-bb99-b0f39eb64b0c","resolution":{"observed_at":"2026-08-06T17:46:22.591730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.694723Z","title":null,"venue":null,"work_id":"b26be8ca-9868-4dc1-9d2b-cee6674a6d99","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.862042Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:04baba1615a692d50f7714ca31bcddc71709584e39ed630960aa6e84547e950e","observation_id":"6f9c274d-f627-426c-829c-1842c25a0dfc","resolution":{"observed_at":"2026-08-06T17:46:22.788610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.080815Z","title":"Mandic, Wenwu Wang, and Mark D","venue":null,"work_id":"9a969694-be4e-40d3-a129-4a2149802601","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.165396Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:3baaa36ff6ec44db166b744f9d5ec8069ab656d958660ff01e952ad9bb53b4c8","observation_id":"3f69a0db-57dc-429a-8de0-b4d50dccc736","resolution":{"observed_at":"2026-08-06T17:46:22.193356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.270397Z","title":"Raghavan, Gavin Mischler, and Nima Mesgarani","venue":null,"work_id":"3cd66da7-dcd4-4e94-aa37-7ac96d902700","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.059867Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:127d0e1ff327b126cbaddb2af40f842c13d1282f78b5a08b4f529c9ab17c5ca4","observation_id":"9cd59548-046e-4908-977a-3d14562cecff","resolution":{"observed_at":"2026-08-06T17:46:22.365402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-06T17:46:16.401709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.401709Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ec24b6d4b85caa62a5b3f37eb7347f6249fe3f6b2119fd7497fea9788f43a2f1","observation_id":"e3194c8a-04cd-421e-adef-e2557f37f3b6","resolution":{"observed_at":"2026-08-06T17:46:16.401709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.917733Z","title":null,"venue":null,"work_id":"46101d9b-f562-4a02-9bc8-f59aaa8da8f5","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.281334Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:751cd2397985048c7350f2868c614b8ca4d417eddac4f67608da0694847f51cb","observation_id":"99e73ac7-28ec-4a05-8240-968939682a8b","resolution":{"observed_at":"2026-08-06T17:46:21.977075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:16.612710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.612710Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:0599ebc28758ddc6214b2b743ef380d055e406e34b797b929dda91af7225fcf9","observation_id":"3af9a247-6149-4362-b3ec-3b5024433dbf","resolution":{"observed_at":"2026-08-06T17:46:16.612710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.791821Z","title":null,"venue":null,"work_id":"17eb81ec-ff5e-4e40-b684-52c321d177d7","year":2021},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.513575Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:b4cab728e282269526b8581bd7da0ad30dd2fcb2b760e0d1b813f3b103c774aa","observation_id":"42533c02-709b-444c-ba82-f108d0b1d43e","resolution":{"observed_at":"2026-08-06T17:46:21.844207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.626529Z","title":null,"venue":null,"work_id":"3dd963b5-162b-4cf5-a17f-8afc8db5929b","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.856077Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4be2952bce10e23d100736ff50eecabfa14ba0e661205f3157256da647196dcd","observation_id":"0c3fb29b-10e6-4788-9da2-c122d56c57c6","resolution":{"observed_at":"2026-08-06T17:46:21.699975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T17:46:16.729243Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.729243Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:0336b518263644b7bfc0addcea4f806347332e2cf7cc458d41a81ffd72b59a5b","observation_id":"bf519b0d-1df2-45f7-a72c-fb11017f577f","resolution":{"observed_at":"2026-08-06T17:46:16.729243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.308390Z","title":null,"venue":null,"work_id":"51936307-ccfb-4b15-a7b0-023328b941e8","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.074451Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:73e0624a9f8c0e8c27cec10d33695b9f11095a6e7a88fc1561344c6af41a794f","observation_id":"6d151fd1-b8cb-4da5-b6dd-dafea2042c69","resolution":{"observed_at":"2026-08-06T17:46:21.376640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.461924Z","title":null,"venue":null,"work_id":"dca2dd77-c8b0-413d-a2c0-d23f9ed65c58","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.972078Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:38ce2bb38b3b496b95486522f87c9f4b9317928e28b5f62b5441b6d34444ce57","observation_id":"d5aff840-67a9-4dbe-861c-bc0ed3ecf6f6","resolution":{"observed_at":"2026-08-06T17:46:21.517553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-07T18:14:46.399260Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-06T17:46:17.295613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.295613Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:3a2c82db318dd98803f560504d63a871751c0336416335a59455d133409fbe82","observation_id":"c778f8fa-b4e8-4720-a550-e1c19f05d7d0","resolution":{"observed_at":"2026-08-06T17:46:17.295613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:46:17.194390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.194390Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:02a591a357158f897611256917a7f74630fbf5e12d532d168dc8543e4ecc590f","observation_id":"13942b3b-21ae-497b-8103-3869f8f17fe3","resolution":{"observed_at":"2026-08-06T17:46:17.194390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01809","last_updated":"2023-10-03T05:53:23Z","snapshot_observed_at":"2026-08-05T12:42:38.656980Z","submitted_at":"2023-10-03T05:53:23Z","title":"Mel-Band RoFormer for Music Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01809","snapshot_observed_at":"2026-08-06T17:46:17.731914Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.731914Z"},"links":{"cited_paper":"/paper/2310.01809","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f27f3c1491179734c969a0d7197230f5bad2314d65bafd94b016a00f7a9b70de","observation_id":"5aadd354-21aa-434d-b3e4-e651d848f1c5","resolution":{"observed_at":"2026-08-06T17:46:17.731914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.150614Z","title":null,"venue":null,"work_id":"4bf0e004-e051-44ee-a291-adb25d52eb6d","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.454006Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:7a1c7f88da697657f7137cfdc6d5260b9da9d993eca5ef7a3068284169215e4d","observation_id":"80d1a0b5-080a-4f04-8e92-8ef224a181b4","resolution":{"observed_at":"2026-08-06T17:46:21.242636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.685632Z","title":null,"venue":null,"work_id":"8a5a04ab-971c-4577-9442-b4037732b6ff","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.070098Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:c90a28e59edf1c674fdb37b565e969ade826d6f87ce8e645199c3f5975001081","observation_id":"25de76f6-9bd3-4faa-b791-113c7b55626b","resolution":{"observed_at":"2026-08-06T17:46:20.768252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.555969Z","title":null,"venue":null,"work_id":"001a8059-e67a-499b-ad81-e297f7fb2f9c","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.195413Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ffbe3d9441efd11964c78e1c4be91ba12c770060eeb6c8c90f1279a4057f5d87","observation_id":"3869cc5b-f98e-484f-8fbd-91cb5e62436a","resolution":{"observed_at":"2026-08-06T17:46:20.618868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.839089Z","title":null,"venue":null,"work_id":"854f2623-f564-486f-95d8-e288bcb8b68a","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.855498Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d7c2eba16703246a37f136dea3ea97f4c9da10ab94f94894eb10efebc4c34955","observation_id":"91a24ba9-2e29-43ef-827b-95867ffd5fa3","resolution":{"observed_at":"2026-08-06T17:46:20.915025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:46:18.500277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.500277Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:48207959a5c486383219d6a1b8d609e6f971cd6f93f69fd35d3d490e2aa9f528","observation_id":"c6e79082-fc53-44c9-8f1e-6ec750618d11","resolution":{"observed_at":"2026-08-06T17:46:18.500277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.416513Z","title":null,"venue":null,"work_id":"36406e46-9d36-45e8-85b6-be0b2b3ed953","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.587362Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:26da79afe2db0d092728d87909e4bbd101d3f5c6d7bde38432bae045687712d8","observation_id":"5232a114-2d96-40a1-b022-b42e42fff0c2","resolution":{"observed_at":"2026-08-06T17:46:20.489871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T17:46:18.341711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.341711Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:e2bef48da1ad86bf065dd910f0f7f512d691cdeb5991a80541ef67477492b215","observation_id":"b3fbe57a-f389-445e-a3c7-8911c34f56f5","resolution":{"observed_at":"2026-08-06T17:46:18.341711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T17:46:18.798620Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.798620Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f5e17793a4d8e841cbec5d2921131e757040bbf984f51d3d6227d024d4aedfa9","observation_id":"7eda949d-c7f0-4718-9603-63ce8d097b60","resolution":{"observed_at":"2026-08-06T17:46:18.798620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T17:46:18.900460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.900460Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ec5dbec9beb052ffd3c09a83ea0192b2785e2802a3e5d3371ad177a2015ef9f2","observation_id":"66285bcf-7fed-49f0-8900-4f4d5a0d744f","resolution":{"observed_at":"2026-08-06T17:46:18.900460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16429","last_updated":"2023-09-28T13:26:26Z","snapshot_observed_at":"2026-08-06T23:39:18.970710Z","submitted_at":"2023-09-28T13:26:26Z","title":"Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16429","snapshot_observed_at":"2026-08-06T17:46:18.671928Z","title":"arXiv:2309.16429 [cs.LG]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.671928Z"},"links":{"cited_paper":"/paper/2309.16429","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:36fcf61c06ba769868cc631a45db9ec5426f21e660363e01006dad961a142f25","observation_id":"7417fdab-75af-4ed8-918e-d769dee767a7","resolution":{"observed_at":"2026-08-06T17:46:18.671928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T17:46:18.709302Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.709302Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:9a6ee6c9d32de14314a9d78adbac3d256c24a0309fe4cc468ff3e5933c5645ae","observation_id":"f08d860c-4432-4423-a6b6-64609e10eb18","resolution":{"observed_at":"2026-08-06T17:46:18.709302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16761","last_updated":"2025-01-28T07:32:07Z","snapshot_observed_at":"2026-07-06T20:27:14.226247Z","submitted_at":"2025-01-28T07:32:07Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","version":1},"cited_work":{"arxiv_id":"2501.16761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16761","snapshot_observed_at":"2026-08-06T17:46:19.515364Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","venue":"eess.AS","work_id":"b8b4082e-5b67-4d1e-a1b3-5d759ef6b240","year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.155991Z"},"links":{"cited_paper":"/paper/2501.16761","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:172eb583f3de69e874a476075358caa3deeabe3cd66020c23142a34da4250d7c","observation_id":"e39c3107-8a78-4cd1-b18b-1e2b4f16793d","resolution":{"observed_at":"2026-08-06T17:46:19.565364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:19.243232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.243232Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:6bd058ff8c8aed59a079542a96618cfd99a5fa344c5ce6ad3ba41e6e5b289985","observation_id":"5b4e0a7c-e4c5-4cd3-bead-1dee93540884","resolution":{"observed_at":"2026-08-06T17:46:19.243232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.247721Z","title":null,"venue":null,"work_id":"c5e8a5b7-3203-4171-a4fb-3d86d37fb107","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.985234Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:45f4d439d61507badd5763129a47bec058b517ad5b1621d759839cecfb0764ab","observation_id":"952abe25-feca-40f1-a9b9-985be6455714","resolution":{"observed_at":"2026-08-06T17:46:20.344490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.095375Z","title":null,"venue":null,"work_id":"cabbeb1a-70ba-4131-b6be-683ca6dfb14d","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.066327Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:fbeaf69e7c0bc208811ced103035f60a6ba80736ed1984c53bcc9cda8b0a628d","observation_id":"6bed8f7c-9191-4d2a-b1a7-59f1dd70c6e5","resolution":{"observed_at":"2026-08-06T17:46:20.150751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.973350Z","title":"In IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17-24, 2023","venue":null,"work_id":"b8e7ca3d-38ef-4490-81ef-9d4f0e02e309","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.166030Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f5cf5405cf0ca244082eb67790c46b5d016c703cd3368ca83d03112fc46b0ed9","observation_id":"946540d6-4f50-4a0a-bf43-337744e816ff","resolution":{"observed_at":"2026-08-06T17:46:25.054650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.977298Z","title":null,"venue":null,"work_id":"f43a5837-8fad-4439-bd54-616f52940301","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.612626Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:55384739882a2db6e27f8dd46ea0db73be03d1ad9db81c0dd6967a2bec3965c8","observation_id":"6ecb8ab1-8022-41c7-bd52-9c10e0998921","resolution":{"observed_at":"2026-08-06T17:46:21.053627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2507.10109."}