{"as_of":"2026-08-03T22:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b38b605e59f1e3a65222325f3f2252e27137fb68eb40f699b5927f92e0132e8","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T20:23:36.774359Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:39:22.070629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T23:45:08.232528Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"cited_work":{"arxiv_id":"2604.04348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04348","snapshot_observed_at":"2026-06-30T23:45:08.232528Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","venue":"cs.SD","work_id":"eba79e0e-d1da-484e-b2c8-d1c5b7a135b5","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-03T12:53:30.755817Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.04348","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f2f4f003755c9ccbcb27099251bd3c1fdae5e248cf2033edb4776dab3a70b548","observation_id":"f703365e-a69d-494b-bbf3-5a12f52a8deb","resolution":{"observed_at":"2026-06-30T23:45:08.233900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.04348/citation-record","integrity":"/paper/2604.04348/integrity","json":"/paper/2604.04348/citation-record.json","paper":"/paper/2604.04348"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":"1809.00496","doi":"10.48550/arxiv.1809.00496","metadata_source":"pith","pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-07-10T12:57:07.603842Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":"cs.CV","work_id":"2f4e32b3-48a5-4b83-946d-739ea8df5168","year":2018},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:050508493139c73799361ffed91ecd9a8e4c56d194fd68401a1a7ccc6f099a28","observation_id":"d5871b25-db4c-4d8f-bd79-cdf3399182e8","resolution":{"observed_at":"2026-05-10T22:00:47.511047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing","venue":null,"work_id":"1ae873cd-bfbd-4e75-a863-22a37da4a77f","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:2c82257af1dded6b68653cfda5fc4e2fd5b17dc636b1fa83bd1a148f7181722c","observation_id":"96e47384-3e35-472c-abac-a350b4d9b12b","resolution":{"observed_at":"2026-05-16T01:37:06.369239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Com- mon voice: A massively-multilingual speech corpus","venue":null,"work_id":"6ea0501f-c74f-4643-8d54-090c18654fef","year":2020},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:f7e30860c0c7e03db4cdf5ba15a46c1bd9988d7c244335abfe5cbf082547132a","observation_id":"b050bbc0-4049-4f9b-b088-79ca37476313","resolution":{"observed_at":"2026-05-16T01:37:06.466475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"b4db97f8-9081-40eb-98e6-b817afdcc5fb","year":2020},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:577bc38d88a061f41f436b255d4127a6371e89118c104011e07745b2b70aa01e","observation_id":"8aa19022-5f78-464a-a6bd-4c127539ca8a","resolution":{"observed_at":"2026-05-16T01:37:06.453117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":"6ffec659-cee6-4b67-af17-60f1ca91f383","year":2025},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:1bd49f3bb07551fc0a96d4f87e3c06f2e6d34a06c6ea5c337f5b11b7d3752e77","observation_id":"6eca2bf2-3824-4c21-af5b-47977ae1bb15","resolution":{"observed_at":"2026-05-16T01:37:06.457265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to- audio synthesis","venue":null,"work_id":"7b256923-d2d0-4907-b610-d0caccf9b593","year":2025},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:ee81f19bf4523c6efffab09bea4deec92c40b98826e4ad699f7a4ead544b2476","observation_id":"d283032e-c15b-4255-b48c-e83ca5528e47","resolution":{"observed_at":"2026-05-16T01:37:06.461838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rec- tified flow transformers for high-resolution image synthesis","venue":null,"work_id":"ab4b722c-2fb5-410d-bd7f-58e92722090e","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:265c25ee3160f05f985886adf6506a8cac710add986e7a5b3844df1139d796a3","observation_id":"2cd59036-3345-4036-9612-ada8d7506fef","resolution":{"observed_at":"2026-05-16T01:37:06.470968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-to-audio generation using instruc- tion guided latent diffusion model","venue":null,"work_id":"748cccd5-4a96-42b6-8a3b-adeb643e2530","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:06924961e79d2db93320f36d8457e03f9c90ac848dcf71795a296e1988132d69","observation_id":"1cfe1090-5b0c-4c39-9d47-c81fadba63e7","resolution":{"observed_at":"2026-05-16T01:37:06.475168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:1828d76c004e0d36fc9a133d45eca80c61937f731b7cc876ddb6ce551a17ede5","observation_id":"e4793e25-34b8-4a4d-aca4-f520c8c9e2a9","resolution":{"observed_at":"2026-05-10T22:00:47.536659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:36:44.520239Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"8a129a6e-423c-4204-9b14-0a3bc93c5d50","year":2020},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:adeb488ead97242252067e5e4ba69ce1e19956904fcd3343e258b02fe503d5f4","observation_id":"7088374f-c118-4150-a1cb-da42a3d21160","resolution":{"observed_at":"2026-05-16T01:37:06.426814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:613c87741d3f97ba7e383ac92ed5033f6517b170be3a83768896f981d76967b9","observation_id":"943b4866-f1cf-4a92-9882-25f341233f4b","resolution":{"observed_at":"2026-05-11T03:31:08.340948Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video dif- fusion models.Advances in neural information processing systems, 35:8633–8646","venue":null,"work_id":"7c1a5bf8-0700-4164-8b2d-9c0c60c7116f","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:3697797aa885ef2f7ddcd446f14c45401341e4959fcda9c9ed979d5fa6d9d078","observation_id":"9c0a7983-c51b-44f6-a298-474dac8d5b04","resolution":{"observed_at":"2026-05-16T01:37:06.431154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-an-audio: Text-to-audio gen- eration with prompt-enhanced diffusion models","venue":null,"work_id":"57e1c9d0-624a-42f4-a990-6c7e104c7a13","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:26b14755f36a091276f3e265056a683dfc6da9d7d87e35f6fe136403decf46ea","observation_id":"d41a35c0-fe4c-4622-9a37-6521f67dab12","resolution":{"observed_at":"2026-05-16T01:37:06.417646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming visually guided sound generation","venue":null,"work_id":"e9b37af6-546f-4dfb-a7f8-7dedcd8987aa","year":2021},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:0b5648b56d0af61ece5edd706fcb321dac396299e6d1badc69beb15a708142cb","observation_id":"5b40324d-9df9-4461-a02c-04ef2c347ade","resolution":{"observed_at":"2026-05-16T01:37:06.413435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synchformer: Efficient synchronization from sparse cues","venue":null,"work_id":"b5c8760f-ab29-4722-8362-201068af9acf","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:f63d1c329c1f3487f6e5d274c6093b469744ff6d7fe1ffc5e8c226816f7085b1","observation_id":"42c24fd8-13db-4852-8e03-fbc0d474231c","resolution":{"observed_at":"2026-05-16T01:37:06.421687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oicedit: Dual-condition diffusion transformer for environment-aware speech synthesis","venue":null,"work_id":"c8891df7-28c9-460e-8ec6-9346bb539fe9","year":2025},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:95ed5dcfd4abeb46ee572934d2ad391a180e171e99ac18ea8e46d7ad1a315678","observation_id":"900a516b-0d04-4db6-aa16-b1618722252f","resolution":{"observed_at":"2026-05-16T01:37:06.435228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":"1812.08466","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-07-08T00:04:22.632355Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","venue":"eess.AS","work_id":"64a43367-ac07-49b0-ab37-b8797c50e9d7","year":2018},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:58e22b1e9b42abe9b347e0c74854b362a4d243c798a8fea05f7052f18b678aa6","observation_id":"4d5e1765-f75b-413f-ba56-231900503142","resolution":{"observed_at":"2026-05-10T22:00:47.502823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guided- tts: A diffusion model for text-to-speech via classifier guid- ance","venue":null,"work_id":"c3ea1432-eea6-42f6-b0ef-fb3aac0dcfe9","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:e34dd3956994fcd997a010b601c3647c9d35ef3bee55a9d6bfed6020de4a35ea","observation_id":"8a79be29-c6d0-47ec-8fb7-d2ec2d161185","resolution":{"observed_at":"2026-05-16T01:37:06.439435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Max Welling","venue":null,"work_id":"60fcad43-52e0-4148-b623-d78df7401b14","year":2014},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:2301696efbe8c47ad975673549ff37b9b496bd2109fc2e9ce6b7e6e44700997a","observation_id":"b5c1bd87-780d-4943-92b7-260f673eccf8","resolution":{"observed_at":"2026-05-16T01:37:06.409325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis.Advances in neural information pro- cessing systems, 33:17022–17033","venue":null,"work_id":"00f26871-8470-4188-bbaa-17c714fbc7c0","year":2020},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:c5f80ba893503ce5a3b68e3de460dc34608831939f6e24ca0113e3de132d945f","observation_id":"71d2c3fd-9785-49e7-9466-e673f878638a","resolution":{"observed_at":"2026-05-16T01:37:06.444272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiogen: Textually guided audio gen- eration","venue":null,"work_id":"3b6bd3bc-73fa-415d-8ec6-9c02d2202e49","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:30bfcfb50793e9bca5be30362a4a3e1cae279452028a75ae194b18f031d1b40a","observation_id":"1a8ed80d-aa17-4abe-abab-26924a3a0a05","resolution":{"observed_at":"2026-05-16T01:37:06.448850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vintage: Joint video and text conditioning for holistic audio generation","venue":null,"work_id":"38ee6034-bc1e-4650-81c4-cb5ed2b7de36","year":null},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:a5538d41590039c9869bb244334d96fcd4cd09519a9d92f52ab2025eecbd4b4a","observation_id":"8eb1b796-b397-44d3-99f6-7e577d08ff61","resolution":{"observed_at":"2026-05-16T01:37:06.479262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79e1149c-9ea6-44da-b927-edc2f2b4b011","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:20c00fd55407315cf5259a2ad4529229e4536f5246cfd311719fa0f547a3509f","observation_id":"49933331-aeec-4329-8fe2-24fabd908b14","resolution":{"observed_at":"2026-05-16T01:37:06.396482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oiceldm: Text-to-speech with environmental con- text","venue":null,"work_id":"929382bc-1a44-4021-b653-30a9fcb5a91b","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:3729f1e94a68881a001fe057835e5769cc210ccca80067422bfdcd305ef0935a","observation_id":"0401f434-9b66-4ffe-b986-a327a8d41182","resolution":{"observed_at":"2026-05-16T01:37:06.387377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tri-ergon: Fine-grained video-to-audio generation with multi-modal conditions and lufs control","venue":null,"work_id":"24874f24-c806-4f6b-a31a-7b16ce037523","year":2025},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:4f7732e87f9c62277f946e7af38bffc394040d4c92693f6ca013563376cd40b6","observation_id":"2bc6ba92-01c8-47d1-8afd-b53d37b3e81b","resolution":{"observed_at":"2026-05-16T01:37:06.400734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ec0f2bfb-fc39-4c24-b677-e910db49d4ee","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:8bda64a36cef9cf5b5c9594e570a656d9d94cc6152468e8bc4db65c3e9810097","observation_id":"b6349fbb-f2bc-4e58-baa9-000c3196dfe9","resolution":{"observed_at":"2026-05-16T01:37:06.340924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Au- dioldm: Text-to-audio generation with latent diffusion mod- els","venue":null,"work_id":"23045794-862b-4a78-9e0e-f165c37eee1a","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:9b2cf544d8a5b6976c65b1c8f58859217695203d3c11f4675627162e3e660132","observation_id":"6bebdc63-228a-448e-8733-65480917d072","resolution":{"observed_at":"2026-05-16T01:37:06.345125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioldm 2: Learning holistic audio gen- eration with self-supervised pretraining.IEEE/ACM Trans- actions on Audio, Speech, and Language Processing, 32: 2871–2883","venue":null,"work_id":"f0715fe0-4d72-4120-974f-19822fd52b8e","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:b981a1a16c022184c96e336e6ea338070894a3bec2255c7831b320aa925ea0e9","observation_id":"4c3e5207-7ce4-4266-9df5-bc8887d6c3f2","resolution":{"observed_at":"2026-05-16T01:37:06.373949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"0b27ca80-26c2-492e-8d21-3c2da4cd04e5","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:cdc6b935e9144902b039a847cd1d23d025028ee1dc6c084502aab404dafe7249","observation_id":"85394fce-e6b3-4583-8371-1cd84c11e6bd","resolution":{"observed_at":"2026-05-16T01:37:06.325402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"40928b59-2bc3-49c3-a7e3-cea897f1b2dc","year":2019},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:10caaec934076f73d29b53af34b8d4085cf31b593c2fd8ef474b5614284f2450","observation_id":"17f8027b-7823-4084-8e0e-4cbfee6274ed","resolution":{"observed_at":"2026-05-16T01:37:06.333215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models.Advances in Neural Information Pro- cessing Systems, 36:48855–48876","venue":null,"work_id":"181d2d5a-0d4a-4a52-97b8-426be369c663","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:f531e041bffc9af55cc444159e189a8dca37bbde74b89f150685f4ae031bad7b","observation_id":"b388d655-bc4e-4863-a8fe-90016b242897","resolution":{"observed_at":"2026-05-16T01:37:06.321582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization","venue":null,"work_id":"6dec6ee5-f21a-46c3-b84c-dae0c59f8874","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:e72a957c55b4af7bf753ea3f0b9522ed1e7019e4c0320255f42dd7146781dcc9","observation_id":"5cf8fa71-ef8f-40a9-ab8a-45d733574964","resolution":{"observed_at":"2026-05-16T01:37:06.329158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pytorch: An im- perative style, high-performance deep learning library.Ad- vances in neural information processing systems, 32","venue":null,"work_id":"adb5e328-26f1-4b84-95ff-27be4412ff56","year":2019},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:a8f97658a285e41371d673dc03ae79865e494220e8bccb831f3e149031215856","observation_id":"67070e8e-2bf4-4f95-aa9e-d6c6a8ecda85","resolution":{"observed_at":"2026-05-16T01:37:06.317122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.715460Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"292e4202-5927-473f-b73e-1d6883498f14","year":null},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:c0d2ff32e15c75a94cdfa1ccff6c4042d13f49676921ecfec4fd7d68143bda94","observation_id":"d9a3efc5-8c9e-4cd0-88fc-331eda484d60","resolution":{"observed_at":"2026-05-16T01:37:06.312768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ae15b58e-0299-4246-bd1a-af4cc4a08e31","year":null},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:ecbed1cd971635e1025033389c0e287853224ca7f24aab7b0e1cffe988d1ec6f","observation_id":"db27bd8a-e00f-4aae-b0d5-e6578a1b8a81","resolution":{"observed_at":"2026-05-16T01:37:06.299666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"266a196e-6fbf-48a1-8d07-4d8a60735a9d","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:b59c8abf3e24951f01cc6cf74e8765f0d3ee7ce5a867ca79781f96dac2d7abce","observation_id":"b8a5b66b-b1ce-4a39-95ee-c8ddca8467af","resolution":{"observed_at":"2026-05-16T01:37:06.303958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67","venue":null,"work_id":"e0e49ff4-b407-4a3b-bf29-c83ec5bdde74","year":2020},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:fba16960ee7b2cda470d102427f5f1682eb03d1a8510b180ebbe2cff8f4a7587","observation_id":"e8695b06-01ef-4ff9-89ae-83c5f70cc6d6","resolution":{"observed_at":"2026-05-16T01:37:06.308183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"7cb723ff-46ca-4167-ae34-f8ea3968cf97","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:3d227f3a7bb82f00297d3ac08152be086463abde7e0bc766c781490c14f2cfbe","observation_id":"0b3f25cf-3ae0-4bfb-8a04-bf26a5b63826","resolution":{"observed_at":"2026-05-16T01:37:06.337089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-07-06T22:17:02.502437Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:6da98f977669bd394ca660300b611ed16e64b8daf86c3390f678818720bff827","observation_id":"11a95843-eead-4cc0-a314-db33cee3c359","resolution":{"observed_at":"2026-05-10T22:00:47.496754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I hear your true colors: Im- age guided audio generation","venue":null,"work_id":"e3db3163-074f-48b2-9868-64ed3839183d","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:281106b4a9b6bf1bd5946de4bc9bf785f0293aeb93ebd5cc585934c830cbbee6","observation_id":"e3f2adc0-e94b-406a-b0aa-db1d6ff79c72","resolution":{"observed_at":"2026-05-16T01:37:06.349434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"a93298a8-993f-4a75-8971-20f1e4ac20ac","year":2023},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:9c8a8a9e573cdb12fff88b5406db74449d8511455db7da1141ea6abd30b6acf0","observation_id":"dbe4e294-7924-4f73-b6e8-a00a45ce0ea5","resolution":{"observed_at":"2026-05-16T01:37:06.483737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"bbb8ef0e-32aa-4e12-8994-1b83ef5ed5a0","year":2021},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:c9cb47b5d8f4b08142f29a4700a1843f94040f75457924a8b38a693d24595142","observation_id":"a4d74983-a2cb-4444-aa8c-d3c32bececf2","resolution":{"observed_at":"2026-05-16T01:37:06.378333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"d1af47bd-dd90-4dff-826b-302fd98831d3","year":null},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:fb51a61da94799e043c678be08774ba203ed7f78cb172a992e71b6520337c618","observation_id":"c946163e-c7ca-45fa-8784-d5988bcf4ad9","resolution":{"observed_at":"2026-05-16T01:37:06.383158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naturalspeech: End-to-end text-to-speech synthesis with human-level quality.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(6):4234–4245","venue":null,"work_id":"8c352046-fdb5-4f39-8a91-ae324946f1ed","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:11f908b36acfcdced81df637b13527d17241454a5221054ad39eccd8854f1e7b","observation_id":"2f52d7cf-c424-4d50-b040-5e629ace856a","resolution":{"observed_at":"2026-05-16T01:37:06.392337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models","venue":null,"work_id":"76cf461e-3df4-46c1-9aa5-ea0e4bcdae0e","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:7f325276cf0ad4bfe2450a093782eb4208725565d5c204b896091436a3930064","observation_id":"ab2a469d-4513-4a1d-b1ce-c12323d55708","resolution":{"observed_at":"2026-05-16T01:37:06.405129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching.Advances in neural information pro- cessing systems, 37:128118–128138","venue":null,"work_id":"3fafc22b-b3af-4312-adda-36468be7f4e2","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:12cfb78b0570af0bfb4c5937dc9380ac2a8500514485ce982f8dd6d3e158da97","observation_id":"175a2779-c67e-4365-b733-3e4900bcdfd9","resolution":{"observed_at":"2026-05-16T01:37:06.353573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wav2clip: Learning robust audio repre- sentations from clip","venue":null,"work_id":"1d19b847-21dd-416b-91a1-defaf7973caf","year":2022},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:31529d05d3fb156e835d8bb7c31c09ee89c002058c82e48a89023abe0d8fa754","observation_id":"9ff5c10b-551f-4cf5-9ba3-4911237e2de8","resolution":{"observed_at":"2026-05-16T01:37:06.357445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Son- icvisionlm: Playing sound with vision language models","venue":null,"work_id":"4f245e1e-0af9-4c2e-b04e-b5cbfc2c4a63","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:81568ac19e9ed30348ee752bcb77654927063628c4050a1ce60928efd74be5ab","observation_id":"5b64560b-b850-4f77-a50f-801584deec55","resolution":{"observed_at":"2026-05-16T01:37:06.361354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-03T01:05:23.269633Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":"2407.01494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-07-08T07:14:45.319897Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":"cs.CV","work_id":"15978118-0cb9-48fb-8c66-d8f1ea7e79fc","year":2024},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:e03739ec28865214e5bbba5ac8ae26728dd7dc45ee04ed8f3af11635192c9790","observation_id":"652fc853-fccd-41c3-a7cc-f63e44889002","resolution":{"observed_at":"2026-05-10T22:00:47.523966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"condition–unconditional","venue":null,"work_id":"379dadf0-576e-41fb-936a-92d5503b88ee","year":2018},"citing_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T20:23:36.774359Z"},"links":{"citing_paper":"/paper/2604.04348"},"observation_digest":"sha256:cfab6c2529389d7f037a5abf9eac0e8b69915eba058a2c94b02744e6bd19ee7c","observation_id":"b6f7e65f-b241-4309-b285-fd1a76bfcdfd","resolution":{"observed_at":"2026-05-16T01:37:06.365145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-31T01:17:27.556451Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":5,"verified_fuzzy":42},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2604.04348."}