{"as_of":"2026-08-10T20:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed77dcb4e5be5973e8f0fb26990e4f12eab279dbb3a3141ccb63ac47141daff3","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T06:04:29.971825Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:25:58.872482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:27:35.612458Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-08-03T16:25:58.872482Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.arXiv preprint arXiv:2508.00733, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:58.872482Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:a1e5ae08afeb7fdc7b3f8a1635e94734398cd3d56c04f1c388c01e2722910668","observation_id":"5db16c02-bee4-4b43-8764-32f82764cc54","resolution":{"observed_at":"2026-08-03T16:25:58.872482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T17:25:38.591071Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2601.02731"},"observation_digest":"sha256:3d44d6c6106798be7fd09f7d62a38469bb9ac7b4c87f91571fc0f733c31dae5f","observation_id":"92cd37fc-20d2-409e-97b6-218e161ecbb2","resolution":{"observed_at":"2026-05-16T17:28:10.031207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2604.10542","last_updated":"2026-04-12T09:11:55Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T09:11:55Z","title":"VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:52.748220Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2604.10542"},"observation_digest":"sha256:14e0428f4535873fbd54fbfc7bad5d471ba1c751b65847d9f647166bee8f34db","observation_id":"3cdf2ce2-884a-4cdd-8752-e50636cef16e","resolution":{"observed_at":"2026-05-11T09:25:59.838588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2604.15086","last_updated":"2026-04-16T14:47:24Z","snapshot_observed_at":"2026-07-30T19:59:53.380806Z","submitted_at":"2026-04-16T14:47:24Z","title":"ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.483263Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2604.15086"},"observation_digest":"sha256:2ec319b6148a9091e7bcdbf1760b5573ec5497b6322f128625d975b1ae9e5667","observation_id":"d4725871-7853-4a8c-b72c-0e3b8675d5eb","resolution":{"observed_at":"2026-05-10T09:23:37.060801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2605.30940","last_updated":"2026-05-29T07:28:24Z","snapshot_observed_at":"2026-08-02T04:51:57.721054Z","submitted_at":"2026-05-29T07:28:24Z","title":"Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T21:17:48.886421Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2605.30940"},"observation_digest":"sha256:6824c080e8197ec653115bc774de99292b69f40ef8ba86e4060d8a1ed9e0c926","observation_id":"3baa02ea-0a50-43c0-be32-347d30bc946a","resolution":{"observed_at":"2026-07-01T20:16:12.355982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:2089f7123ed697055fb292550ba1faa813cd5308b8b52af27b13743c77d997fe","observation_id":"1ae5565b-83bd-4351-8c3a-fa0453af18b8","resolution":{"observed_at":"2026-07-03T03:27:35.615037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.00733/citation-record","integrity":"/paper/2508.00733/integrity","json":"/paper/2508.00733/citation-record.json","paper":"/paper/2508.00733"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.18505","last_updated":"2024-07-26T04:27:13Z","snapshot_observed_at":"2026-08-06T20:35:28.187816Z","submitted_at":"2024-07-26T04:27:13Z","title":"VoxSim: A perceptual voice similarity dataset","version":1},"cited_work":{"arxiv_id":"2407.18505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18505","snapshot_observed_at":"2026-08-06T06:04:30.278075Z","title":"VoxSim: A perceptual voice similarity dataset","venue":"eess.AS","work_id":"e4e7d89b-e381-420a-9e87-3e68217b629f","year":2024},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:28.939172Z"},"links":{"cited_paper":"/paper/2407.18505","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:460d39295d8630f1efe969f0afc91bb5c1cdefb811351902c1da8bdc52c70e9d","observation_id":"2b310c81-4c27-40cb-8c4f-8af5af29d927","resolution":{"observed_at":"2026-08-06T06:04:30.281776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-10T11:54:00.577607Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-06T06:04:29.181087Z","title":"Beyond efficiency: A systematic survey of resource-efficient large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.181087Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:dbd2f8c0eb20054b0e2d07d856704cc1d944baed49d8ff2c969942f9b65405f1","observation_id":"5f9e9fc9-d300-46c9-b166-d826846c8561","resolution":{"observed_at":"2026-08-06T06:04:29.181087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.422178Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"d473a2c3-d1a3-43c5-b933-f40443f5996f","year":2020},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.266404Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:025144a68ee2dab5121eac10a486ef3fded4a8ab65860af1dd0b8f99420fad21","observation_id":"7e15cb2d-cf4c-47ea-9263-17ef14bee244","resolution":{"observed_at":"2026-08-06T06:04:30.426627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.410391Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"944ac32f-65bb-4bb5-b85b-8d29ea0ee83f","year":2020},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.760649Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:9375229cd31ead4943669e4e8ee9f9788b031939b2ae39d9ada94c747816b2df","observation_id":"866d9cf6-06df-4edb-b9e8-78ed43b07394","resolution":{"observed_at":"2026-08-06T06:04:30.415330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T06:04:29.852239Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.852239Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:c4bccc0b074cc644cf1331e4784bf9fa2615ed8adca2387528b4f26aa195711d","observation_id":"437d8bde-4f5d-4bd7-941d-3210bf9447a2","resolution":{"observed_at":"2026-08-06T06:04:29.852239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.399920Z","title":"Vid2speech: speech reconstruction from silent video","venue":null,"work_id":"a2ab87d3-98dc-4cc7-b254-128d959b3c92","year":2017},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.872025Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:9cb62f5b4a3ca1f84225b2d7c395aad9335af6b5032075a5f451f108a7f00d5b","observation_id":"01a1f4a8-eec3-40a9-97e4-402710127371","resolution":{"observed_at":"2026-08-06T06:04:30.403698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T06:04:29.876089Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.876089Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:4138a6e0caedef096076c5e8f1b8b2dd2dd1089403fa3f2829a1de1d592cd925","observation_id":"ac1f3415-c111-4879-a6d0-e4066fe59202","resolution":{"observed_at":"2026-08-06T06:04:29.876089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-06T06:04:29.880406Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.880406Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:cbbb0188e36b99e5b593fddfa49a38e4816604ab28a13f80cb48a56455a65c42","observation_id":"c7bb091b-edf2-421f-808d-1cf2109f21c1","resolution":{"observed_at":"2026-08-06T06:04:29.880406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.389393Z","title":"Effect of clustering on the me- chanical properties of sic particulate-reinforced aluminum alloy 2024 metal matrix composites","venue":null,"work_id":"70013952-6015-4bec-b7b6-037a187c4d13","year":2024},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.884269Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:620326bb44615d8ab873b4138045c72db985a362f91a921d609f961e02d62532","observation_id":"b5e1a81a-9666-4ad7-80a5-dabf59f440e6","resolution":{"observed_at":"2026-08-06T06:04:30.393012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.368804Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"2bac98b7-b51d-461b-b657-0a79d15d8453","year":2019},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.891922Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:67bc14ad06918df5bb89a64f7d98ebdb710f3675fef7dfb3c46029bec735a617","observation_id":"edaf99ee-7cd4-4aae-bc7d-8bb2d0200b9d","resolution":{"observed_at":"2026-08-06T06:04:30.372452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-10T10:27:54.456913Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-06T06:04:29.895970Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.895970Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:8e5b6bd7a337085552cabbfe2aa33a49b4eb3531c7d545f621db52f971f4445d","observation_id":"a8231362-d76c-4f73-a1dc-76c8d930a7af","resolution":{"observed_at":"2026-08-06T06:04:29.895970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.357490Z","title":"Ntire 2023 challenge on efficient super-resolution: Methods and results","venue":null,"work_id":"d7dfc2aa-029f-4c7a-bf8b-7ea62ec0b667","year":2023},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.906533Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:6fc01eb48275aef317d8fae57a11e63ba12c04024a1e51355ad432a8f08c2ae3","observation_id":"fff1aa02-8cbb-415d-b915-9fc0222fc5f8","resolution":{"observed_at":"2026-08-06T06:04:30.360907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T06:04:29.910372Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.910372Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:e718c999540e52dd8f58ae662069938d633ad16e66270d7a03ccd87969bd5d50","observation_id":"7f62678e-05c4-4db8-b0a7-0fd6f90625a6","resolution":{"observed_at":"2026-08-06T06:04:29.910372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T06:04:29.913997Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.913997Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:e2e3e66be2acabd013dbda3af807da486f96f20b83c05418c68aaad3a21621eb","observation_id":"1d75771a-4415-4798-b175-2d463d71af6d","resolution":{"observed_at":"2026-08-06T06:04:29.913997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02058","last_updated":"2022-08-15T18:38:37Z","snapshot_observed_at":"2026-07-06T13:06:34.544826Z","submitted_at":"2022-05-04T13:34:07Z","title":"SVTS: Scalable Video-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02058","snapshot_observed_at":"2026-08-06T06:04:29.917486Z","title":"Svts: Scalable video-to- speech synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.917486Z"},"links":{"cited_paper":"/paper/2205.02058","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:7509cbcb020790699f0e216a7d053a383bd7a0deb3431a015f1d8ca8cafef253","observation_id":"a90c9f78-cc57-45cb-a67f-e79f1a80ff1e","resolution":{"observed_at":"2026-08-06T06:04:29.917486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.347057Z","title":"Effect of large cold deformation on characteristics of age-strengthening of 2024 aluminum alloys","venue":null,"work_id":"1bc2171d-1a91-462b-b3fe-21ecde4984c2","year":2024},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.921132Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:3fde4354dc724493f2ccd158633c1b8b68fdcf53d56d57d48e44ee8833d189ae","observation_id":"f586a7f7-b5e1-4e4f-99eb-96e5cb855338","resolution":{"observed_at":"2026-08-06T06:04:30.350721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.336050Z","title":"Egosonics: Generating synchronized audio for silent egocentric videos","venue":null,"work_id":"afff0c6d-fb0e-4bb5-a19f-80d58c611f1e","year":2025},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.924581Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:a807b242305442ada285e96b5143ed34ebb19b7f1b6700686f1e46f985296d38","observation_id":"e55a50ed-15c8-4340-baba-00de4d55dffa","resolution":{"observed_at":"2026-08-06T06:04:30.339603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.324813Z","title":"Dnsmos: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors","venue":null,"work_id":"5f94d105-0cda-424b-af05-6376b126c673","year":2021},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.928332Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:bb90c943f5dcd54a3fa18c02b8f8c56cbdd7b0f88d858121f7e971f3b73972dc","observation_id":"f01b5d7c-4379-4464-bb4f-9c504a24c72e","resolution":{"observed_at":"2026-08-06T06:04:30.328331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T06:04:29.931990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.931990Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:c53c136c8fdf134144039b2f069da671491147f922eecf3ad2e962691aaab5ef","observation_id":"3d927eec-728b-4229-b022-3f745738ec2e","resolution":{"observed_at":"2026-08-06T06:04:29.931990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"cited_work":{"arxiv_id":"2507.10109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10109","snapshot_observed_at":"2026-08-06T06:04:30.077501Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","venue":"cs.MM","work_id":"bef773ce-eb93-4042-8cd4-056e9f270511","year":2025},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.936928Z"},"links":{"cited_paper":"/paper/2507.10109","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:3f3ead3a36e80c7ae2a5daaf28ece43336fff7b7cdc542bbad9e1031c40eee8f","observation_id":"9f73405d-b2d7-4205-bea6-b06ea22e0311","resolution":{"observed_at":"2026-08-06T06:04:30.083418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.300658Z","title":"Generalized end-to-end loss for speaker verification","venue":null,"work_id":"ba7be288-7db6-4c11-844d-be40e67e3c45","year":2018},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.945502Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:cd908fdf7136f6844f299c1e8755474ba17e62628ee426353e89312e1aa80889","observation_id":"07986a81-9e19-4ab0-b216-8451bc314589","resolution":{"observed_at":"2026-08-06T06:04:30.305063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T06:04:29.952467Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.952467Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:b36b126e6edc6e2793f9bfce6b68f5022a7436a35f8d1b8f78eb96b04bfced92","observation_id":"85d6e32a-0eb4-48bd-b14e-ec1ec0be758d","resolution":{"observed_at":"2026-08-06T06:04:29.952467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T06:04:29.956434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.956434Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:907ee3c8af1aa952a07883014e21be4fd486ae2e8b6f0fd4a071fb222598af69","observation_id":"479b8915-b319-4b6c-9bc6-c948f19904f9","resolution":{"observed_at":"2026-08-06T06:04:29.956434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.289548Z","title":"Forecasting china’s regional energy demand by 2030: A bayesian approach","venue":null,"work_id":"a45b9702-d273-4fd4-be9d-c8655b43bf74","year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.960482Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:75266dc4f74fcc9add7866d1dc781ae51fedbd96443e65abf9247b1d4a7df89b","observation_id":"3d9ffcc9-19c2-4fb1-9bcb-88c4668eab94","resolution":{"observed_at":"2026-08-06T06:04:30.293381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T06:04:29.963674Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.963674Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:0bbbcd149057cc869bbd0c21895746cac20fff333019bfc57c9a01689ff62bad","observation_id":"bc06c7c8-a161-4847-8105-a415e8d1c1ba","resolution":{"observed_at":"2026-08-06T06:04:29.963674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T06:04:29.971825Z","title":"Fo- leycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.971825Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:cd088d1ab88220b0f3bb360e8eb79e93a9bd4fd46baff461bcc4d2dea5686df0","observation_id":"7e2735b9-945d-4da9-bf83-a8d4ac21bf7a","resolution":{"observed_at":"2026-08-06T06:04:29.971825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.379346Z","title":"Synchformer: Efficient synchronization from sparse cues","venue":null,"work_id":"85727407-c363-4959-b7cb-1ccdab1ad9cd","year":2024},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.887959Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:2c7396518dcf0a46926676c6866842704071400eedaa5f91e7310d75c53691e2","observation_id":"0d639cc2-a4a9-48bf-9a87-a1675c0146ce","resolution":{"observed_at":"2026-08-06T06:04:30.382529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T06:04:30.313203Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":"cd81a69d-7f23-40ad-8b56-24ac9fe41be5","year":2025},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.941955Z"},"links":{"citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:226e846ddd41539b65b4e016416d00965be58cfa8e9af59a0d36172131f581f6","observation_id":"1dd81864-a54b-460f-8af5-3e6306a72611","resolution":{"observed_at":"2026-08-06T06:04:30.317525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T06:04:29.948925Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.948925Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:81a0b539c98221b91287ceccfbffc872860add9337728948558b8cca65559f39","observation_id":"a8811ba4-f8e9-4233-bc25-30129c684a9b","resolution":{"observed_at":"2026-08-06T06:04:29.948925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22265","last_updated":"2025-03-28T09:29:08Z","snapshot_observed_at":"2026-08-09T23:22:10.023129Z","submitted_at":"2025-03-28T09:29:08Z","title":"DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22265","snapshot_observed_at":"2026-08-06T06:04:29.967160Z","title":"Deepaudio-v1: Towards multi- modal multi-stage end-to-end video to speech and audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.967160Z"},"links":{"cited_paper":"/paper/2503.22265","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:db59ddc69391d7316b6f3c4f45be57c6d0e6dfb6e78713730940b1d7b1fddfbd","observation_id":"cf95400b-5535-4a27-8787-6e8f5fe34cb5","resolution":{"observed_at":"2026-08-06T06:04:29.967160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T06:04:29.398373Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.398373Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:ad3b8a12305aee31cf60f639694d5f496760263a300a94fd052a79f32d01ac1c","observation_id":"a9f25310-eeaf-42b5-a2f9-e18080661d87","resolution":{"observed_at":"2026-08-06T06:04:29.398373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T06:04:29.899392Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.899392Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:f4295819eb62c029a6089adcf804b9d2ef1de6f769bfc7dd21a1aa342c2a8aa3","observation_id":"30c34803-a6cb-4e46-873f-06920348492f","resolution":{"observed_at":"2026-08-06T06:04:29.899392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-10T10:43:25.582099Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-06T06:04:29.902919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.902919Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:6577d15fe259ee1d551b975a63faeff52f140b0ebb350c17fa600cc65a1e9278","observation_id":"46465fa8-6932-426c-8b48-9bfda381a29b","resolution":{"observed_at":"2026-08-06T06:04:29.902919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-06T06:04:29.619107Z","title":"Jukebox: A generative model for music","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.619107Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:5a8fb1e29d5b38eb8e8449e297a691b127745d756b9f66dadea1eda2c8deadd7","observation_id":"e37e05cc-f7ac-4ffc-84c7-b3678e1ae25c","resolution":{"observed_at":"2026-08-06T06:04:29.619107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T06:04:29.065491Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.065491Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:0f08e077e53ae2c2f67f9ebe119cac00d760d0e3b69371748b9f1acbf8896d4b","observation_id":"c770a0db-f760-470e-a2bc-9da33e913861","resolution":{"observed_at":"2026-08-06T06:04:29.065491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19603","last_updated":"2023-05-31T07:17:32Z","snapshot_observed_at":"2026-07-06T15:35:49.019768Z","submitted_at":"2023-05-31T07:17:32Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","version":1},"cited_work":{"arxiv_id":"2305.19603","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19603","snapshot_observed_at":"2026-08-06T06:04:30.231041Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","venue":"cs.SD","work_id":"a2147df0-8758-4154-8d82-6bd46a0e516b","year":2023},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.497216Z"},"links":{"cited_paper":"/paper/2305.19603","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:38c4e0903948a229c3c71ab4a17671a28fc19f66326a21e54e1e2659f478825b","observation_id":"cc18a5d3-7b85-4190-9dbd-4c6d356f4faa","resolution":{"observed_at":"2026-08-06T06:04:30.235068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","latest_version":4,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 6 inbound Pith citation observations for arXiv:2508.00733."}