{"as_of":"2026-08-18T19:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:508861ff8d993317f132e74f2cf68c7ba243ef3762b8781aa564b399217cb910","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:27:56.984255Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11913/citation-record","integrity":"/paper/2608.11913/integrity","json":"/paper/2608.11913/citation-record.json","paper":"/paper/2608.11913"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-16T00:27:56.712678Z","title":"arXiv preprint arXiv:2209.15352 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.712678Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:8ffecf4c880a21f5aa567c3b2b74b5a664ce1b50618c7a0bed723ac53b6df3a4","observation_id":"2e7819bb-46a5-4095-844b-9aa85c87df2c","resolution":{"observed_at":"2026-08-16T00:27:56.712678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.909103Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"ab278869-714e-404a-aab1-3664d1bb7d76","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.718048Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:7fed1ccbabee2c30adbad1de2ceebfdd0ac4319ffd9d13e040480fa810659468","observation_id":"091b67d6-4056-4fb5-b0de-355b858815dc","resolution":{"observed_at":"2026-08-16T00:27:57.913775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-16T00:27:56.722383Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.722383Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:007b6475416f2e52bdc61885c8abac344261864b2a260dbe579251f8cdcf3f1e","observation_id":"5f8384a3-22bf-42f0-bfa5-ca7b7925f6e5","resolution":{"observed_at":"2026-08-16T00:27:56.722383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.896178Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"9ca7fcea-7497-4008-89af-ec630d4d76fb","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.726676Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:79fa8ccfdd9ce3de962d3c89927a58728f3dd4e25a880abc67ad9ce77f8db9c6","observation_id":"732a2beb-af5e-4de3-ae60-8c4583503fb1","resolution":{"observed_at":"2026-08-16T00:27:57.900236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.883535Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"0bba344b-517f-45ab-b3cb-66195775c64e","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.731597Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:5d0a0db9b4baf826b6e01e9f43bc1a01a4a631fab4d1a73c42c2c0b1a8905f96","observation_id":"f2814413-27d7-4f0f-ad66-1b8ce175a5f4","resolution":{"observed_at":"2026-08-16T00:27:57.887526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-16T13:38:02.108888Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-16T00:27:56.735765Z","title":"arXiv preprint arXiv:2407.01494 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.735765Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:bbf1e127e38fb8ec5a4afc545db498b7637f513d6bd9cdb558627b994559001d","observation_id":"52ae80db-ecd6-4720-bd3e-77e755cb7060","resolution":{"observed_at":"2026-08-16T00:27:56.735765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.868994Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"4b0bade3-2c9f-4fe0-872f-18cb4f74cd7a","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.740329Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:51454d60ec52b51666a76c5234f3388dac15cd5c2b3b57b982add40a185fe59c","observation_id":"8252999e-aeb5-4a3c-bbc1-d58235d76c56","resolution":{"observed_at":"2026-08-16T00:27:57.873825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.854274Z","title":"In: 25 Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"dd9b4249-553c-406f-b5fc-0677dbefe123","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.744066Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:5f045a974527c93aeb997c092114850fc6a5e1692a74e7f299e786ff6062bc18","observation_id":"c7850795-4826-465d-92fa-e522197828a4","resolution":{"observed_at":"2026-08-16T00:27:57.858771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-08-16T15:15:38.321253Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-16T00:27:56.747595Z","title":"arXiv preprint arXiv:2501.09732 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.747595Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d242434ec3becba082969a9f8db8d205ab63e467e673bf4778fc21f142c009ab","observation_id":"d56a2bbe-43c4-4577-8b00-6f5b14d534d2","resolution":{"observed_at":"2026-08-16T00:27:56.747595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-16T07:26:47.621702Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-16T00:27:56.752114Z","title":"arXiv preprint arXiv:2005.00341 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.752114Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c84506bddb18de52caba94de03a4a01395f199614988e30dc4eaf55870b2c37b","observation_id":"8c6298df-201d-4fae-a2c8-03a640fb03c0","resolution":{"observed_at":"2026-08-16T00:27:56.752114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.840159Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"75cb5c41-946b-4d51-bd43-4bcc3ab011d0","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.756554Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c5573ab45355848c93f21c00c96af39e2594ead328abbbfce5f01929f28b8f60","observation_id":"a87b5197-e653-482e-b3a6-0de78d8b2111","resolution":{"observed_at":"2026-08-16T00:27:57.844657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.825696Z","title":"Advances in neural information processing systems36, 14005–14034 (2023)","venue":null,"work_id":"a4552fdb-fd16-4667-aca7-926bf24c88a1","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.760900Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:dc577cc7ee18a48c461231f84b8829b9dad2151e5b4af08fce477300b31f4db3","observation_id":"375c3569-f328-43d4-824d-aace6b6e536e","resolution":{"observed_at":"2026-08-16T00:27:57.830642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-16T14:28:48.591931Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-16T00:27:56.764846Z","title":"arXiv preprint arXiv:2401.04577 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.764846Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:b0b679f75ffb0dd5c8105d88d90359a8b1db27c20e8f8079b01a93afcdbc2057","observation_id":"99b3b07d-b06a-4258-8fc5-763fce20dff8","resolution":{"observed_at":"2026-08-16T00:27:56.764846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.811398Z","title":"In: NAACL-HLT (Findings) (2024)","venue":null,"work_id":"e0b93743-37a3-4aae-b881-7ec5e76d0df1","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.769736Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:fb0a17e2775fd498705fed55ba3bda503a5cbb9761f43cbe733ab472c8f5dd42","observation_id":"6323bf76-1628-4056-9d74-21c204b9d7ef","resolution":{"observed_at":"2026-08-16T00:27:57.816176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10634","last_updated":"2025-03-14T23:26:06Z","snapshot_observed_at":"2026-08-16T12:50:16.622650Z","submitted_at":"2025-03-13T17:59:55Z","title":"V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10634","snapshot_observed_at":"2026-08-16T00:27:56.773970Z","title":"arXiv preprint arXiv:2503.10634 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.773970Z"},"links":{"cited_paper":"/paper/2503.10634","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f5e0efa537f7f855242c1252571f527a089024e779d333d14a16b67cac3ae912","observation_id":"cd8c9d4c-7258-4381-913b-ba42fc6b457d","resolution":{"observed_at":"2026-08-16T00:27:56.773970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.796941Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing31, 1720–1733 (2023)","venue":null,"work_id":"d2e63830-2089-4af0-8842-1cf57126fbb8","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.778338Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:702f9cb8514e2b0a3f1406e075297f1dc270512b472423d5a99b7282d6563126","observation_id":"81112b9e-3a70-40e2-b223-891ac4bcf10d","resolution":{"observed_at":"2026-08-16T00:27:57.801617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.782075Z","title":"In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"307994ee-c3d1-4038-be29-356ce58b3077","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.782497Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:dd0b119014efe1b5c345492433ef94a084cdf120de9f07331217032529c19d84","observation_id":"4a26f552-1407-462e-b59e-f41d73cb198d","resolution":{"observed_at":"2026-08-16T00:27:57.786691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.767385Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing (2024)","venue":null,"work_id":"048de954-cdfd-40ec-995d-badd157b9099","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.786388Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:39a21501671e62763f9c3a0922b4523a5a6d560f888753b2be8afc8d7f213b35","observation_id":"a5a43a36-4f0f-4c93-b81a-e3bc9e2bf2b8","resolution":{"observed_at":"2026-08-16T00:27:57.772134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.752509Z","title":"In: Forty-first International Conference on Machine Learning (2024) 26","venue":null,"work_id":"f1bd2309-9d06-4dd2-9332-97c396b6e003","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.790367Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:8f33fc75624f1cba3f99e60a8244ffc9a305bb7c4b40d782a1f003b722eb89d6","observation_id":"b15cb50b-ba18-4504-adfd-2d9bd3e953b6","resolution":{"observed_at":"2026-08-16T00:27:57.757133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.737587Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"385df9ec-cdb3-428d-b016-c2b2b96a5ad7","year":2016},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.794702Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:7eb28ba4c993005d331dc9ba73635c2cd03bf13bdfa3ccfacd83982e2d4b3f79","observation_id":"d6e21cea-612a-485f-ab37-1bb8f76c625b","resolution":{"observed_at":"2026-08-16T00:27:57.742362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.722898Z","title":"In: British Machine Vision Conference (BMVC) (2021)","venue":null,"work_id":"8fded96e-db20-4f83-b7aa-3aa12d10e7a3","year":2021},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.799087Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:420609cd8f5dffeef51569687c2661f209aaf3a5874dd3a0168804f421f3cf47","observation_id":"65c58431-bd3e-4ba4-8909-31fb2fe49cbe","resolution":{"observed_at":"2026-08-16T00:27:57.727619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.707630Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"5005f7c3-875c-4e1d-941e-496deb7c52c8","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.803267Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:ae6eef07d18c0c97e436c880cca6748cead1836a9123e2fb131befc5e8933dad","observation_id":"80fbd0f6-4583-4055-90ef-a5eae7d5d9d6","resolution":{"observed_at":"2026-08-16T00:27:57.712813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-16T00:27:56.807382Z","title":"arXiv preprint arXiv:2308.06721 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.807382Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:a308d775fbbc9cf42b8e6346b4b41eb2c9a52a48f5080cff9a4f7511f3b7e524","observation_id":"f0a71da5-dc07-4b08-8159-5abc0f61ece8","resolution":{"observed_at":"2026-08-16T00:27:56.807382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.812139Z","title":"Advances in Neural Information Processing Systems37, 128118–128138 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.812139Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:270f5b85101b028719b90174372fe89eb653ac1b31138f2cfe180793a58a1c4e","observation_id":"bee83027-0efa-4327-a425-230eaa6c2862","resolution":{"observed_at":"2026-08-16T00:27:56.812139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.683583Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"727fd66c-5c13-45af-b26d-52ce7e05ba51","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.816312Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d854e02fc0965fa8d72588329af933f8f86ce155d5cdee0ffb03d9fd96d62c96","observation_id":"10418fc3-bb32-4f0a-9106-8eb9122011e9","resolution":{"observed_at":"2026-08-16T00:27:57.688460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.669757Z","title":"In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"96626f9f-7659-4464-8ca8-1478d1908ae5","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.820327Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:43709c4bf5e0d557bebd9be74fc32fdbdf1229cac4d6b40b735c156f42cde630","observation_id":"463212b0-d45c-4c69-91d8-1a837e07dc4a","resolution":{"observed_at":"2026-08-16T00:27:57.674109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.655315Z","title":"Expert Systems with Applications249, 123640 (2024)","venue":null,"work_id":"c26b10f1-a9b0-4cd7-8ca0-c6b4de744d02","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.824643Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:5ad88796d91e94435fe4a27ef0fb0e8f6287e50a31dcf1ac4aebd60d0a407967","observation_id":"293e2e7d-31bd-492c-a703-3dc06404301a","resolution":{"observed_at":"2026-08-16T00:27:57.660151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.641499Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"2951cb16-a5f1-4787-a7a8-2a7cdb994a54","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.829173Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:b41b401e8b0ed495c1fcdbf88f7713b3eb0da744830c0e7d2bd33765b1c1987c","observation_id":"57fd110b-6e5c-4d40-a358-8c2ba84d2b09","resolution":{"observed_at":"2026-08-16T00:27:57.646119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.625676Z","title":"In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"6f3ec460-03cc-4bc0-96bf-2e3bb714ad0b","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.833475Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:4727199370128ea1acbe164be23a54699c6b47d92a27115400934edef786a469","observation_id":"1cd0ce97-2a41-4f14-b4d2-d1623e23a208","resolution":{"observed_at":"2026-08-16T00:27:57.630402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.611326Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia, pp","venue":null,"work_id":"dfc8d4ce-42f3-4f20-b038-286dbc4887e3","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.837480Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:42f620409743463aadb8ae6c83da6ee7f0bdb4d08a0cb5d267ee020c5c663a14","observation_id":"b7d643b2-c701-4277-adfb-3cbfe477e85a","resolution":{"observed_at":"2026-08-16T00:27:57.616375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.596791Z","title":"In: Pro- ceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"36ef0fbb-9c72-40fc-886c-714cb7bc4a91","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.841715Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:8b83fede414fe1f00f8b0ff91efc7f72ef4ffa513f50741da630d0ee89896fcb","observation_id":"f07b40b7-08f8-4344-aebf-3158027ea702","resolution":{"observed_at":"2026-08-16T00:27:57.601398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.583200Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"c1650f8c-8038-4b98-a303-3bc56d26c6a9","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.845812Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c0a2795ecdfbacee72f613a47c7571633979405ff09f1e8dd7c7e2678b1af9b9","observation_id":"57d58cc0-26c3-4354-937f-d7c441c7c267","resolution":{"observed_at":"2026-08-16T00:27:57.587214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.569794Z","title":"In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"0c4db2c9-0345-4eb8-9618-94ffa6f8a5f0","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.850012Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:a561faf6331fe3b1012b8cef93fed84faffdc52d9a059ddc450821522c1ccd65","observation_id":"a1f59108-06d7-4902-80fb-7dab094bf2af","resolution":{"observed_at":"2026-08-16T00:27:57.573885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.552982Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"123ca293-a86c-41c2-aff5-e7742fdc8751","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.854403Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:eceb097a56aa41481f0162fad50a9110780cddcfd6c382ac13ba5bb3f323245a","observation_id":"7dbec8da-ac2c-4f17-9efa-eb93f6857390","resolution":{"observed_at":"2026-08-16T00:27:57.559378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14272","last_updated":"2024-06-20T12:52:46Z","snapshot_observed_at":"2026-08-16T13:41:07.931634Z","submitted_at":"2024-06-20T12:52:46Z","title":"MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14272","snapshot_observed_at":"2026-08-16T00:27:56.858527Z","title":"arXiv preprint arXiv:2406.14272 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.858527Z"},"links":{"cited_paper":"/paper/2406.14272","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6fa784f2d823378816821e4cab089c76654cf29f91e2601d13d39c1c6f0740b3","observation_id":"06a8869e-afd8-497b-a31d-23ee28793e30","resolution":{"observed_at":"2026-08-16T00:27:56.858527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-16T04:02:50.118916Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-16T00:27:56.863037Z","title":"arXiv preprint arXiv:2411.18953 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.863037Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9bb01760108dc3439d1e3e907c95477b6261e15be79e0cf020cd48e409edd2a1","observation_id":"6a83718f-d1e1-417e-9475-4ce5a1ed377c","resolution":{"observed_at":"2026-08-16T00:27:56.863037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.538473Z","title":null,"venue":null,"work_id":"f2bb0455-bab3-4f4b-b16e-9aaeb57c5723","year":null},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.867299Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d8f4a36b25aadac194fe09fa9b09707e5c4ca0c38dbd15439695d8fd8ca5a085","observation_id":"394b22ae-1db9-415b-90bc-547dc7b013a3","resolution":{"observed_at":"2026-08-16T00:27:57.542854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.523227Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"cf0c2329-90b9-4381-96c3-fcf7fc14182a","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.871072Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:eab4b29c661372cd8c7cd40c40854da4c1f628c878e1d137128fe2f9d9b335ec","observation_id":"7d27d25d-af74-4969-8c6c-92baafdd4d82","resolution":{"observed_at":"2026-08-16T00:27:57.528185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.874666Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.874666Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:3d9f305a34fdbc009029e3422eef501fb607c8328ce0b028590f6308f3f439ea","observation_id":"509ca0ea-9b3f-4d54-bdc9-be1ffefaa7f0","resolution":{"observed_at":"2026-08-16T00:27:56.874666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.500168Z","title":"Advances in neural information processing systems33, 3008–3021 (2020)","venue":null,"work_id":"05120e7e-2734-4a78-bbe3-f58cbcd478b2","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.878323Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:e4bb93abc7adfa52284588cb6f9e5e61adaef07678bb675ba167a700b5836810","observation_id":"b497b9f1-69dc-41ee-8ec8-eb70a53a3c0a","resolution":{"observed_at":"2026-08-16T00:27:57.504639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.881893Z","title":"Advances in neural information processing systems35, 27730–27744 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.881893Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:db2ba96cb0e2914741a7450a1c7c94029a1941348b6cfcd1cf03c6194e6b2363","observation_id":"f88d134d-575b-42b4-ace0-cfe37d0431ee","resolution":{"observed_at":"2026-08-16T00:27:56.881893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.475436Z","title":"Advances in Neural Information Processing Systems36, 53728–53741 (2023)","venue":null,"work_id":"5df30b0e-292a-461f-abab-f3b1f480c3e6","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.885400Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6f1bc56e34c3f194cc8788ad6e7b0ffe10557a0dfb6e61e09d9a52c646161232","observation_id":"627e4055-c6d2-452d-b298-755be48300a0","resolution":{"observed_at":"2026-08-16T00:27:57.480657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-16T00:27:56.889364Z","title":"arXiv preprint arXiv:2304.06767 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.889364Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:e0fa5f5d656df2065b89e16c45d13cf793cdda34fdade3e514355c5673c64d96","observation_id":"017b35da-32a1-4171-bc5a-c986da2b7c18","resolution":{"observed_at":"2026-08-16T00:27:56.889364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-16T15:41:15.724777Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-16T00:27:56.893803Z","title":"arXiv preprint arXiv:2304.05302 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.893803Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f81e99200216aed5738258586362040eb236686d59b8022b1f57b4dede5928d1","observation_id":"fa21302e-f917-4716-a010-b2d2a414ddef","resolution":{"observed_at":"2026-08-16T00:27:56.893803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T00:27:56.897942Z","title":"arXiv preprint arXiv:2212.08073 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.897942Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:680fcb657fc64fd2d269d7df1bb1b9658fd7a81ce2d03dfc2b305c8a160d1a33","observation_id":"c22c0a52-147b-49a1-94dd-c87ecf787fdb","resolution":{"observed_at":"2026-08-16T00:27:56.897942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.902231Z","title":"Advances in Neural Information Processing Systems36, 15903–15935 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.902231Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:3e27127ae978e0bb650e5193d38a45b5b19e6e643714178dcbdbacf6e90a96ee","observation_id":"1c5d24ae-298d-4fa4-9ae8-de5340b82c53","resolution":{"observed_at":"2026-08-16T00:27:56.902231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.449746Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"a054fc09-ca17-4210-92f0-0b1d8af04481","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.906308Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d615289844ba182296ed3b5dd733e8eeeb3da301d7f6a8d9becc425231f0492e","observation_id":"c8a9da8e-d582-4f0f-8579-e218e17ecd70","resolution":{"observed_at":"2026-08-16T00:27:57.453843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.910237Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.910237Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c52844d27a79378f54bcfd8960820cec3f651e8eb6f7d662865bd468f293478a","observation_id":"31449035-8014-4085-8416-fb6394ee92f0","resolution":{"observed_at":"2026-08-16T00:27:56.910237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.914138Z","title":"Advances in neural information processing systems33, 6840–6851 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.914138Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:017bb764b5f8c280f3031da8a42f6ed101b420370919f5fb036891c528e7b891","observation_id":"b27ff933-b8de-4cb5-b04e-88ee0e7455fb","resolution":{"observed_at":"2026-08-16T00:27:56.914138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.416397Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia, pp","venue":null,"work_id":"36604a15-232a-42b6-b96d-4fd68329f8ca","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.918107Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c2a62413c7f43d489ca26a95c556662c8140bd809f055a6b39db10683c30c2b2","observation_id":"c30dd17c-72f5-4c70-99ce-fb504e5ce0c1","resolution":{"observed_at":"2026-08-16T00:27:57.421466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-16T00:27:56.921927Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.921927Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:27795222eb29e26edc20bc2ccb31d2e1bbb963b4d2734cd3b4dc1fed0962312b","observation_id":"a3a0e9c7-dc9c-49e1-b335-482581e42b40","resolution":{"observed_at":"2026-08-16T00:27:56.921927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.927264Z","title":"Neurocomputing568, 127063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.927264Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:31dcc3bf4652c93606bb88eccfc5f8b3d46d2c8f8881f1564ec095e2ffc6085d","observation_id":"da1d74bb-9cb2-4016-be8b-872fd52240e2","resolution":{"observed_at":"2026-08-16T00:27:56.927264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.393013Z","title":"Journal of Machine Learning Research25(70), 1–53 (2024)","venue":null,"work_id":"3f16563b-f3b8-41d5-9230-76623e1a6fda","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.931337Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:8af10784e565de343fa1dfa15a70165f4e41ed891f838b01d0fc7268d42146a3","observation_id":"291410dc-31fd-44ac-8e07-8a66cb894816","resolution":{"observed_at":"2026-08-16T00:27:57.397921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-16T13:28:23.560818Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-16T00:27:56.935166Z","title":"arXiv preprint arXiv:2408.02666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.935166Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:eb450c66b7dc27b304e462ab276cdc8e8edbbe122ff6d35350e891b8f1acea8b","observation_id":"82135de5-b739-4df1-b12a-9d2478d93f9c","resolution":{"observed_at":"2026-08-16T00:27:56.935166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-18T11:14:43.411768Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-16T00:27:56.939307Z","title":"arXiv preprint arXiv:2210.07839 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.939307Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:96a7007bea394cdef144aa8e9385f71e54bfca7dbbbb7f3785094d0fa2ff59bb","observation_id":"9a3c7be1-1c5c-46b4-a022-e8d7256a9cfa","resolution":{"observed_at":"2026-08-16T00:27:56.939307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-17T16:15:29.907985Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-16T00:27:56.943597Z","title":"arXiv preprint arXiv:2502.05139 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.943597Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6b88ee46a89603228aa8da08bea4a8f0c3c6b8d496278ad2edae0c54e83ee514","observation_id":"39b4b44d-c61a-4f15-a3e5-7edb5a2953c5","resolution":{"observed_at":"2026-08-16T00:27:56.943597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.379119Z","title":"In: ICASSP 2022-2022 IEEE International Con- ference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"c800a53e-ae08-4a83-b52c-f0a171f09542","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.947797Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:fc9710961021b07ca0b3b8ec92972ad510f49b5a794895efe1b84fd282f34159","observation_id":"3c9305fc-45c0-4fd9-915c-d21bf107b95d","resolution":{"observed_at":"2026-08-16T00:27:57.383585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05659","last_updated":"2024-07-17T18:28:48Z","snapshot_observed_at":"2026-08-16T14:11:30.308535Z","submitted_at":"2024-03-08T20:17:34Z","title":"Audio-Synchronized Visual Animation","version":2},"cited_work":{"arxiv_id":"2403.05659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05659","snapshot_observed_at":"2026-08-16T00:27:57.049464Z","title":"Audio-Synchronized Visual Animation","venue":"cs.CV","work_id":"4557fca6-1d14-4ade-a8f3-191758d62bb8","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.951652Z"},"links":{"cited_paper":"/paper/2403.05659","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:556a7ea6de343ff82e6bd9a72345f9b3e86f95eaa70fdd00bac48d815c614aaa","observation_id":"2ef3e406-8604-47d4-8e3c-55c6c4367650","resolution":{"observed_at":"2026-08-16T00:27:57.056509Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.955809Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.955809Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6711336f83443666a5f8e8d6b90fe1dd55e6516c93830bda0b4bb302c7b66556","observation_id":"1e167d94-415c-4193-8688-668b854a9410","resolution":{"observed_at":"2026-08-16T00:27:56.955809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-16T17:48:41.711685Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-16T00:27:56.960058Z","title":"arXiv preprint arXiv:2110.08791 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.960058Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:146823bcf2c20368a7c32433b81cb8e878bc7cb1cf16d4661f33607d8a1a1e30","observation_id":"c67033e6-21a6-441d-a757-4f5aacc88296","resolution":{"observed_at":"2026-08-16T00:27:56.960058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.964446Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.964446Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:551da52b87c3b6d47bc254d4418fc29282ca8cc1eb41df1fd401f3562d3252f8","observation_id":"8e8120bc-b658-4ade-81b8-d6507c21881d","resolution":{"observed_at":"2026-08-16T00:27:56.964446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-16T00:27:56.968322Z","title":"arXiv preprint arXiv:1812.08466 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.968322Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d8b3c3062812b31f3851da70ce992e99ff7666ab1d206fb30ce61c20da5a2849","observation_id":"8e43efb9-e006-433e-a0df-087fe1b17fc8","resolution":{"observed_at":"2026-08-16T00:27:56.968322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.347529Z","title":"In: 2017 Ieee International Conference on Acoustics, Speech and Signal Processing (icassp), pp","venue":null,"work_id":"d2e69ee1-28b6-486d-8925-627929389daa","year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.972384Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:017e88fedc4758fa3ca678d0dc02e9dd9c95dc14fe25d36579bec3b336107f1f","observation_id":"f85598bf-480d-45c5-bd31-b50260cd735e","resolution":{"observed_at":"2026-08-16T00:27:57.352105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.334021Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"02c468ff-b235-43bb-bb5e-09eba106c022","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.976488Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:74dbe79fa65a6d79c79b70fd273ce28b32a6211ac2b214d8c0ae889e01de1a5a","observation_id":"75138c27-91a7-4047-8f9c-bab2aa7b1110","resolution":{"observed_at":"2026-08-16T00:27:57.338428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.319943Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"9ae0bd28-a188-47d3-9c3f-5b33534673fd","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.980300Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:627c86c2dbc6db9feb6285ae901aef0b3f78d05d131ebd14d7d37d76ed1b53ce","observation_id":"4d3be700-3182-49c0-9d76-244937e34b80","resolution":{"observed_at":"2026-08-16T00:27:57.324496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.306050Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"e5a43952-f24f-4822-a04e-4ccbfa9328dc","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.984255Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:3ca89ab2239f465c9caf75bd9bc6df21f0702b3b249daafcb8528af83ddf3b79","observation_id":"33e1ab7a-c8cb-4dfa-af12-52064fc4aeb7","resolution":{"observed_at":"2026-08-16T00:27:57.310492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T16:05:44.578986Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.11913."}