{"as_of":"2026-08-12T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:836a0de6fa183267ea1bddebf1c3935d9f2f703953520ff892b8fdbd67a26d06","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:38:08.713130Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:25:56.032167Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15191","snapshot_observed_at":"2026-08-03T16:25:56.032167Z","title":"Av-link: Temporally-aligned diffusion features for cross-modal audio-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.032167Z"},"links":{"cited_paper":"/paper/2412.15191","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:805807d79fa6a82e4b9aa5c4ad9a07e02c75f829d2b3a424fe4ceed865567b77","observation_id":"16755c82-6b7f-4480-9a83-682402e864d4","resolution":{"observed_at":"2026-08-03T16:25:56.032167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15191/citation-record","integrity":"/paper/2412.15191/integrity","json":"/paper/2412.15191/citation-record.json","paper":"/paper/2412.15191"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.104515Z","title":"Vid- styleode: Disentangled video editing via stylegan and neu- ralodes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.104515Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d21f49e9d22b8c1bbe1b20c436fec45c23d275de1a43760624835fd0f3e7ad67","observation_id":"d296dfca-7f78-4ed4-ad45-9d27d9470b9d","resolution":{"observed_at":"2026-08-11T11:38:08.104515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-08-12T01:15:35.596933Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-11T11:38:08.110731Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.110731Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:1e7e3b90c36beffdf85ca6e1f7d26aa328d004ee9f106ae1b4d0279a0d689684","observation_id":"d9359a8d-e7c7-4f8d-ab45-c9513933f26d","resolution":{"observed_at":"2026-08-11T11:38:08.110731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-06T15:18:41.938107Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-11T11:38:08.116734Z","title":"Sonicdiffusion: Audio-driven image generation and editing with pretrained diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.116734Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:c0d6ce2ff576550fdeae5dae546a4551bfb1ecbb395d5782b623cddabdd333b1","observation_id":"d83f8c8f-4a5a-4581-83f9-9467f2cdbec1","resolution":{"observed_at":"2026-08-11T11:38:08.116734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T11:38:08.122293Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.122293Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:8a9e4a63d3b9b9fc77ce491e967f9f407b93e54c30644a7a8fbe36284edd4852","observation_id":"5d15ec61-52dc-4fb9-9dc3-41e1931aa447","resolution":{"observed_at":"2026-08-11T11:38:08.122293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.128519Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.128519Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0e227c15c565f11031ec3d697c929fceedaa0d1de3adca38e8cc3a4c12726412","observation_id":"c14217bb-83e5-40f8-8dfb-f277c4c48743","resolution":{"observed_at":"2026-08-11T11:38:08.128519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.134204Z","title":"The mtg-jamendo dataset for au- tomatic music tagging","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.134204Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:4059486c0627a9a94e4cf1d1d1cbd00983f38a0627a42e3fc63cbc8a002a4b14","observation_id":"190444a4-fb82-4e21-a2f1-f5700c7d9b94","resolution":{"observed_at":"2026-08-11T11:38:08.134204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.140769Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.140769Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:a8e30f254bf979dcb36cbc9b3a2340e8b6205c95c6c0f29b1e9137fa4f773989","observation_id":"c7e5e277-678d-407e-9756-72b5901cfd16","resolution":{"observed_at":"2026-08-11T11:38:08.140769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.146634Z","title":"Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.146634Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:93d5ccfd08cea66bd9091410586032cf1d10f9e8f9c3eb24469e2cbe6e1bbc9b","observation_id":"c65a41bc-86c4-4fb1-8037-5e0af3aaae0e","resolution":{"observed_at":"2026-08-11T11:38:08.146634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.153035Z","title":"Semantically consistent video-to-audio generation using multimodal language large model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.153035Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:48d448a38915a35facd1c5bdfebbfeb1d3fcb2079498283ff976b3dce4b2d78a","observation_id":"7ebe36cc-7eac-4a74-8eff-e592fb698c62","resolution":{"observed_at":"2026-08-11T11:38:08.153035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.159115Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.159115Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:1004b2b266b83f3c1c5cec6b5f0e0052c89bc68f1186690657a19caa1fd96fc7","observation_id":"53c66c15-5a4e-4dfa-a5b5-8d8d33eadb2e","resolution":{"observed_at":"2026-08-11T11:38:08.159115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.164804Z","title":"Beats: audio pre-training with acoustic tokeniz- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.164804Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:abec77f73f19644dd4c3861689453e7bda1984f451a9894a3981a7643da14823","observation_id":"8835410d-eec2-4e66-ad2a-9bdad8343a2e","resolution":{"observed_at":"2026-08-11T11:38:08.164804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.170524Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.170524Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d928fabd797a37d2fbf9c6f8b8bbbde5147257427d1cdae364104d026a16af92","observation_id":"c2bbfb5e-8eed-417f-803c-5a30e08840e1","resolution":{"observed_at":"2026-08-11T11:38:08.170524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.175962Z","title":"Unrav- eling instance associations: A closer look for audio-visual segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.175962Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:2954ad57c4fa02b08020e60ad2e841140b4bf9599dbda75e7535d958118b597f","observation_id":"fa0388dc-d1d6-4625-bbb7-c2d912a3ecc3","resolution":{"observed_at":"2026-08-11T11:38:08.175962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-08-12T11:47:15.225461Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17698","snapshot_observed_at":"2026-08-11T11:38:08.186627Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.186627Z"},"links":{"cited_paper":"/paper/2411.17698","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:e61089ca0c54009909834411bf15edfd1a22d1973bd56c799b6457a1ede324f6","observation_id":"0bf5ea14-9876-48ba-a115-d84c7c909ef7","resolution":{"observed_at":"2026-08-11T11:38:08.186627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-12T01:16:42.382558Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-11T11:38:08.191695Z","title":"Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.191695Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3cc6acf1ae55bbe9db6cbcda95bb837f4018e8ca5b1d7bfbc71297ca53cc57b7","observation_id":"38893e5b-74f9-4975-874b-f70ba02afcbf","resolution":{"observed_at":"2026-08-11T11:38:08.191695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15157","last_updated":"2024-12-30T05:20:35Z","snapshot_observed_at":"2026-08-12T01:15:47.795023Z","submitted_at":"2024-09-23T16:04:50Z","title":"LoVA: Long-form Video-to-Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15157","snapshot_observed_at":"2026-08-11T11:38:08.197220Z","title":"Lova: Long-form video-to-audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.197220Z"},"links":{"cited_paper":"/paper/2409.15157","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:9223e92b1ece8ed3e6c3613268864a523c565e923ba1ad6670391a5c6eb92950","observation_id":"87acbeb6-f1d4-46a6-8775-7cafb0fc1144","resolution":{"observed_at":"2026-08-11T11:38:08.197220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.203510Z","title":"Visionllama: A unified llama backbone for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.203510Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0b2cb44964bd93f081be87c041fcef835f02310c41e24abefc2495991fe0affd","observation_id":"4da5ae48-9c18-40cb-82d2-614b52eedfef","resolution":{"observed_at":"2026-08-11T11:38:08.203510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.208913Z","title":"FMA: A dataset for music analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.208913Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:042269fecad0ca961a135aad4b35e632ea5ce48655314682be6a6d06964308f2","observation_id":"c916368b-5b23-488c-a859-6da8e0700625","resolution":{"observed_at":"2026-08-11T11:38:08.208913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.214386Z","title":"Conditional generation of audio from 9 video via foley analogies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.214386Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:9d33f8c5c52d69e7b8dc65b7ca54ba4828141be83e7732fe4b360c1873dc114a","observation_id":"86aac1ef-94e9-4e15-85ee-20240d518095","resolution":{"observed_at":"2026-08-11T11:38:08.214386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.219790Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.219790Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:039a7314eb4936d1543e58b93e616d166d7060eb30844527f1d821aa363e5a4d","observation_id":"b9f203f6-1502-4a60-bcf1-3cf0536f07b2","resolution":{"observed_at":"2026-08-11T11:38:08.219790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.225668Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.225668Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:bd140cdd7a04f4b2257c1fbc4ef44d13fb558fd566d7b59a58ece636938efa3f","observation_id":"58dad096-f52e-43dd-b2a4-f5763cc6b66d","resolution":{"observed_at":"2026-08-11T11:38:08.225668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.231204Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.231204Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:65bf3f03f5437ff660cfb912952057176a2323f9fe50bee37693912352c699e2","observation_id":"27cada57-4874-4724-b88c-288452bc6502","resolution":{"observed_at":"2026-08-11T11:38:08.231204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.236538Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.236538Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:a07fd4fa0da3c9d1111592ca311f2e1b45e1de7f4131651470f11d7ec4705e69","observation_id":"c3df8024-a0d7-430d-b42f-f96de7d39de6","resolution":{"observed_at":"2026-08-11T11:38:08.236538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.241917Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.241917Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3df21744f1395d7bcf20f03fe977f80b97f7b9759d1356b1c9810ddde61aec66","observation_id":"345df0a7-7b26-43f5-9dd4-d4e26beb1806","resolution":{"observed_at":"2026-08-11T11:38:08.241917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-08-12T14:15:26.579700Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-11T11:38:08.247422Z","title":"Gotta hear them all: Sound source aware vision to audio genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.247422Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d70e9f0bfe5a8557f35eb46a48470b7200e9e53661767e1092ba0bf55da7babf","observation_id":"b9f57ae0-859d-4f53-97c0-5ea1ff617699","resolution":{"observed_at":"2026-08-11T11:38:08.247422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-10T03:27:46.172940Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-11T11:38:08.253139Z","title":"Taming data and transformers for audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.253139Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3bba881335c068fb1d5ba749371a3f7c2da5b1fc98c2ca447e7ead9b7129e17f","observation_id":"1077e4aa-094b-498e-829b-60aa55850084","resolution":{"observed_at":"2026-08-11T11:38:08.253139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17842","last_updated":"2025-02-25T09:34:26Z","snapshot_observed_at":"2026-08-08T03:43:07.792980Z","submitted_at":"2024-05-28T05:43:03Z","title":"MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17842","snapshot_observed_at":"2026-08-11T11:38:08.258353Z","title":"Discriminator-guided cooperative diffu- sion for joint audio and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.258353Z"},"links":{"cited_paper":"/paper/2405.17842","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0510aa1ff75cb77b9800a0f0d22527c883db75b0e9e1d924da387d20d1d71627","observation_id":"0d3c1d2f-5b50-40de-90c7-60d7aa395fea","resolution":{"observed_at":"2026-08-11T11:38:08.258353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.264064Z","title":"Unsupervised semantic correspondence using stable diffusion, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.264064Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:4f3a3934038bff151a71239e17840707d660f67ea51a934b214284378b82ebc6","observation_id":"ffdbda98-bd85-47f2-bea0-ddef94a55ac9","resolution":{"observed_at":"2026-08-11T11:38:08.264064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.269526Z","title":"Gans trained by a two time-scale update rule converge to a local nash equi- librium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.269526Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:1101725ec666fde6e924f916cdedee9a106d65b448cf1f876fa96163a180880c","observation_id":"be0f8032-d1fe-4f88-9550-82f8162ab192","resolution":{"observed_at":"2026-08-11T11:38:08.269526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.274591Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.274591Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:24a27a237889eba371f79e48c850406d4bc75607b1395d4bfc099f02cd8989dd","observation_id":"1a14cfa0-667a-48ea-b424-a126158d8588","resolution":{"observed_at":"2026-08-11T11:38:08.274591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-11T11:38:08.280118Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.280118Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:802cbe0646b2fd1f66b6f1c9ecc1fbb43dd7e7b1ceee356b6b098fe9c514672f","observation_id":"d4a0bd31-d441-421b-984a-14c116f6da46","resolution":{"observed_at":"2026-08-11T11:38:08.280118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08628","last_updated":"2024-09-13T08:33:03Z","snapshot_observed_at":"2026-08-12T01:15:56.490911Z","submitted_at":"2024-09-13T08:33:03Z","title":"Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08628","snapshot_observed_at":"2026-08-11T11:38:08.285520Z","title":"Rhythmic foley: A framework for seamless audio-visual alignment in video-to-audio synthe- sis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.285520Z"},"links":{"cited_paper":"/paper/2409.08628","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3fb6c47db23beb18232122620e751514e35c460876f7c07110c6e5464a8f0ba5","observation_id":"1ccb6364-d46c-4181-a344-f7ef90054b3e","resolution":{"observed_at":"2026-08-11T11:38:08.285520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.291415Z","title":"Epic-sounds: A large- scale dataset of actions that sound","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.291415Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:963c3941a2b4f7b31be925fcafba76cdecce0c1a668939305a3cef23b1d2066c","observation_id":"fe63b53a-86be-461c-b420-be6531c6fe01","resolution":{"observed_at":"2026-08-11T11:38:08.291415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.297020Z","title":"Taming visually guided sound generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.297020Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:60b9a57f57656cd9314c11652396b0dee809b2ee7051f961eed8f8126db5fefb","observation_id":"7c33fc9b-ae33-4f4f-ab48-15a4240349d6","resolution":{"observed_at":"2026-08-11T11:38:08.297020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-12T01:16:03.936992Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-11T11:38:08.302374Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.302374Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:e0f0465c4deafd8afefce48090a220559563e48a6d1e82a0269601b1195bb41e","observation_id":"3f26d0e5-5a5e-488e-8b79-6cf965eb5261","resolution":{"observed_at":"2026-08-11T11:38:08.302374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.308086Z","title":"The power of sound (tpos): Audio reactive video generation with stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.308086Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:9b0e9b03f2211d36cf2679892b31eeeafe12903ce56e465a7c5b29227fc2b271","observation_id":"0c023b92-9c29-49ac-8357-c674e1a97113","resolution":{"observed_at":"2026-08-11T11:38:08.308086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.313681Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.313681Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:15eb53ab9301ee2f26f05b512b6961953bc7b40e60959f4186472d27c0697ec3","observation_id":"fdb49b99-ba46-41c2-b18e-c2843704a41d","resolution":{"observed_at":"2026-08-11T11:38:08.313681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.320944Z","title":"Re- purposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.320944Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3c67b87224ff6ded0c5b9a61b48edd02b4aa51be3a9ca25b8e398ecec710879a","observation_id":"81065381-d8b1-453a-acf5-eb516161f96e","resolution":{"observed_at":"2026-08-11T11:38:08.320944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13762","last_updated":"2024-05-22T15:47:14Z","snapshot_observed_at":"2026-08-12T01:15:31.660402Z","submitted_at":"2024-05-22T15:47:14Z","title":"A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation","version":1},"cited_work":{"arxiv_id":"2405.13762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13762","snapshot_observed_at":"2026-08-11T11:38:09.430052Z","title":"A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation","venue":"cs.CV","work_id":"c4417d20-95c8-4634-8e6d-aaab000de28f","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.327784Z"},"links":{"cited_paper":"/paper/2405.13762","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3e0d7183fd7e25b777a116c43a69b8903d2357ba0edba2bd9b239d6a9678d8f6","observation_id":"eb732a7a-d8e7-4279-98ef-4b1b9af7299d","resolution":{"observed_at":"2026-08-11T11:38:09.436342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.537909Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis","venue":null,"work_id":"ca95fe0e-cb0a-4a09-b01c-897555e67f19","year":2020},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.333818Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:6817f1f3fa114ef463993f80c4e34d06a4a229c36dce78fa664483e6d27fabab","observation_id":"aee831d3-0c03-4500-8a2b-4639b39f53d8","resolution":{"observed_at":"2026-08-11T11:38:10.543955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T11:39:44.218526Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10768","snapshot_observed_at":"2026-08-11T11:38:08.339998Z","title":"Vintage: Joint video and text conditioning for holistic audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.339998Z"},"links":{"cited_paper":"/paper/2412.10768","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:c752700675794768344810e85fe609e1134313473c213b5d7fb6c2d7114232ab","observation_id":"52d52cb8-48a5-4be9-989e-07211047f4bf","resolution":{"observed_at":"2026-08-11T11:38:08.339998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.520323Z","title":"Mandel, Mert Bay, and J","venue":null,"work_id":"5ee7be71-5199-4e4b-afe3-fcf96ee972c6","year":2009},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.345676Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d0f733c07c3f0d1b5891a52b3cda19aaa59349dfe8aa0c93964744789fac6e15","observation_id":"1da30b39-53eb-4a0e-b4a0-803257faffb9","resolution":{"observed_at":"2026-08-11T11:38:10.525705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.350927Z","title":"Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.350927Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:97ef3e80be7efc40dd84683c42ae135a1882362921c8d81375406ec13f05fa3b","observation_id":"a492f3c0-dc1a-4e96-b4ae-85b486274e10","resolution":{"observed_at":"2026-08-11T11:38:08.350927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04001","last_updated":"2023-05-23T06:59:30Z","snapshot_observed_at":"2026-08-12T01:15:58.956782Z","submitted_at":"2023-05-06T10:26:56Z","title":"AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04001","snapshot_observed_at":"2026-08-11T11:38:08.356490Z","title":"Aadiff: Audio-aligned video synthesis with text-to- image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.356490Z"},"links":{"cited_paper":"/paper/2305.04001","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:4e759bb438bd76ca902cf3ffe6a5087d8026942ba2bbb9651878b2fe5fb04c6c","observation_id":"08fb4f88-1400-45e6-9001-162a68cd3ee4","resolution":{"observed_at":"2026-08-11T11:38:08.356490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.502783Z","title":"Sound-guided semantic video generation","venue":null,"work_id":"95680489-333a-4d17-88f5-a96e517bbfd3","year":2022},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.362619Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:ad5b5ad2ab3a5d443b870aa3e5b30648ea3e75f512b51ace69162908516d48ea","observation_id":"3f2d74c1-4fc9-4855-a314-b5d48a2cad39","resolution":{"observed_at":"2026-08-11T11:38:10.508429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:08.368474Z","title":"T2v-turbo-v2: Enhancing video generation model post- training through data, reward, and conditional guidance de- sign","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.368474Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:7e3b8954678493df99271987815e657e31cb8efb67f76c75495717932e207882","observation_id":"cc3d2874-6914-43b0-8606-63c48b05cbaa","resolution":{"observed_at":"2026-08-11T11:38:08.368474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.485106Z","title":"Ross, and Angjoo Kanazawa","venue":null,"work_id":"d19076bd-5018-4bbc-acd6-4fca9c4ed9e0","year":2021},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.373866Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:aa0f6edaf15f74fa242dce6bd62b42f517d3dfaf67af2d7f07924822e8ca7d76","observation_id":"8665cc07-3bd3-474d-a636-d1a4e135c064","resolution":{"observed_at":"2026-08-11T11:38:10.490694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-08-12T14:34:52.338104Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-11T11:38:08.379292Z","title":"Muvi: Video-to-music gener- ation with semantic alignment and rhythmic synchroniza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.379292Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:98681b66529e805d6142b381c4f392ed6da2ebe2ecc97e0649f795f1dd952926","observation_id":"ccc2f29f-7925-4ba2-853c-5c31c45ebc5a","resolution":{"observed_at":"2026-08-11T11:38:08.379292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.467062Z","title":"Language-guided joint audio-visual editing via one-shot adaptation","venue":null,"work_id":"d01c7601-b44a-4fdc-8e67-065a4536fe29","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.385173Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:91de0f1ee672b46ba9770840dd559d58b72f5bed5bcf10b2a2b2620a724ae03d","observation_id":"d6f3e263-0aaf-4035-863e-03ade21e1c34","resolution":{"observed_at":"2026-08-11T11:38:10.473442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07450","last_updated":"2024-09-11T17:56:48Z","snapshot_observed_at":"2026-08-12T01:15:55.403098Z","submitted_at":"2024-09-11T17:56:48Z","title":"VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07450","snapshot_observed_at":"2026-08-11T11:38:08.390974Z","title":"Vmas: Video-to-music generation via se- mantic alignment in web music videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.390974Z"},"links":{"cited_paper":"/paper/2409.07450","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:7b023055466905b92d2d4ebe1766c7c213994e48be52772a81de39a826a64ba8","observation_id":"5508d397-fdaa-414c-baa7-b7cd7b5b4e4f","resolution":{"observed_at":"2026-08-11T11:38:08.390974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T11:38:08.396773Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.396773Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:6d4c6d0e00a8f5c16e1a329169acbae00af1e6a01c1b3a85621a4210ebf9d758","observation_id":"81ff63fc-d68d-44a5-83c0-2d634979c4c9","resolution":{"observed_at":"2026-08-11T11:38:08.396773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.449432Z","title":"Plumbley","venue":null,"work_id":"fca6f238-fea9-454c-a83c-e27239b054a7","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.402890Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:eb07d6d2d9f367954cfe858c920958c224c1569d7bf0cb6a8d6ec2e83e9da570","observation_id":"db5a51b4-dbb8-45b3-8626-b30f21889909","resolution":{"observed_at":"2026-08-11T11:38:10.454690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-10T02:51:47.132283Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-11T11:38:08.409162Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.409162Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:593a3358a87a7234e4386042123c38d6774a871ce639ee5fc7c4e168d442f94e","observation_id":"836db613-10af-4d07-8f33-c24fcf3f0009","resolution":{"observed_at":"2026-08-11T11:38:08.409162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T11:38:08.415238Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.415238Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:adc89dec9246d856470a889a823691c37d50a976cb2a7a9a2eb628427ac719ee","observation_id":"5d26fc6e-5f18-41e0-a3c4-a39b3e6bfd48","resolution":{"observed_at":"2026-08-11T11:38:08.415238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.432208Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspon- dence","venue":null,"work_id":"dde1b340-bdc3-49f2-91db-fdb933ab9b97","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.421089Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:7c0a2bf996aa3633aaf97bc0941cb9edb4edfcc2dbcca28854bba8d9ac4f7f12","observation_id":"91f568f4-b8df-452d-91e9-eccbf1446a63","resolution":{"observed_at":"2026-08-11T11:38:10.437844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.412979Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models","venue":null,"work_id":"ac8e645f-6388-47af-82c7-54e4ec639122","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.426561Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:f8ceea13e0c67b73a3d00ebae94c493f22e305f41c86200fed10915ef3b1085f","observation_id":"ce2c0459-1686-4549-b415-966e4ad8bdab","resolution":{"observed_at":"2026-08-11T11:38:10.419482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.395386Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"c3e30293-ed8e-489d-bf11-12750085228d","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.433111Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:a23996ce69efdf684911ca8882a1b2eaf646c9983752ed931ce3f0bf744f662f","observation_id":"4b19e8e2-9ce0-423b-a4dd-e5f6488c3d19","resolution":{"observed_at":"2026-08-11T11:38:10.400805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.377213Z","title":"Tango 2: Aligning diffusion-based text-to-audio genera- tions through direct preference optimization","venue":null,"work_id":"ae7d90b6-f30b-4b97-b205-c4336f75809d","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.439491Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:b9a87eb572d5461870524b4797890aa4dd6dd76e770d21b317684632d462cf94","observation_id":"ff0f5ce3-fe6e-47e0-821d-f298dac1f104","resolution":{"observed_at":"2026-08-11T11:38:10.383183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.359406Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation","venue":null,"work_id":"3160fe17-445d-4568-a798-88d79c6f0a71","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.446429Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:868dba0cef71a631b926d62c2295852aa0aa86ee9fc0046000f5fd4474e6be43","observation_id":"bd0a535c-367d-49a1-ac21-060fd96d3ee0","resolution":{"observed_at":"2026-08-11T11:38:10.365419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.341590Z","title":"Tavg- bench: Benchmarking text to audible-video generation","venue":null,"work_id":"66a66c54-da29-4cc3-bf40-6a3d1a25d45a","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.452352Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:f04967a55699343594c6d094f385ed4f0140377495cce08d2b321544543df2d9","observation_id":"7f424f3d-e7c0-4b7b-9820-3c008dab700f","resolution":{"observed_at":"2026-08-11T11:38:10.347200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.324032Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":"9d40a365-6428-4a60-9f62-e3fc8657b3e3","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.457875Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:10d045ef6f4eba2f8ded9479fa91dd3aec0d7b8dc57aa41521a42015d4701259","observation_id":"1a3e5ef6-de52-4a2d-8a91-fd88d807b80d","resolution":{"observed_at":"2026-08-11T11:38:10.329416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.306555Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":"ce513e54-923b-47f3-88e7-a05691f34dbc","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.464141Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d953d4010f4b02a9ef13a3993b66e8f92f757fb23345b4b8aaa000b0b02495ec","observation_id":"e5b67b7a-156f-43d6-80cc-b52c39f9095a","resolution":{"observed_at":"2026-08-11T11:38:10.312133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.289263Z","title":"Adelson, and William T","venue":null,"work_id":"2f423eda-572f-4731-bd99-e30a299d1af8","year":2016},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.470248Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:c37d34d6812647436497747f64e1b1bf3a8d6cab9992d80d48039877b75b4258","observation_id":"ee4a89d5-0dee-40fc-9b10-165b1395ad71","resolution":{"observed_at":"2026-08-11T11:38:10.294048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.271540Z","title":"Masked generative video-to-audio transform- ers with enhanced synchronicity","venue":null,"work_id":"2139d757-85bc-4796-ad5d-1491ecd6da05","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.475796Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:09e4d4eda91b0ded065d7a94c74c97015376099ac8530b6c9121401e91dc7279","observation_id":"2628a2a9-614f-473b-81b7-8e7698f9d5db","resolution":{"observed_at":"2026-08-11T11:38:10.277308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.251948Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"bc6b2f40-b237-4534-ba6c-abfb5cc00528","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.481823Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:e90468d8bdea44b7aaf935eee74a4eafa22d1a58dee87984c71c30f94d06adc9","observation_id":"d968493c-f847-4c0d-b704-3601b99c10e2","resolution":{"observed_at":"2026-08-11T11:38:10.258618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.233408Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"0dff1dc2-86ca-445e-a1b8-8427a664b5e8","year":2018},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.487574Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:491849bf3116d9ad7e22d535ca082997148c62a95ac6d0618f96f0bf1b2c0deb","observation_id":"be76b20f-bdc0-4cde-a924-2e3f00be19e0","resolution":{"observed_at":"2026-08-11T11:38:10.239310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.215320Z","title":"Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- 11 vic, and Yuming Du","venue":null,"work_id":"4da7fba5-ab03-418c-9dee-6cbf662f3ebb","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.493634Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:95ed36548283e906103bebf098612607108e033a75ca8b7518f1abaf8159b1cd","observation_id":"9398dfab-a169-448d-92ea-f0287750c2da","resolution":{"observed_at":"2026-08-11T11:38:10.221373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.196283Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"0000cafa-793d-452e-9301-b286969637dd","year":2021},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.503540Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:04ea616fcf46b8cf4c5e713433e0ac643408bfdbc66d80a50737e399ff212d63","observation_id":"27931671-cd45-4082-9b04-9390c66f625d","resolution":{"observed_at":"2026-08-11T11:38:10.201811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.177778Z","title":null,"venue":null,"work_id":"9acb9025-fa68-43a6-b91f-316169fe7538","year":2022},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.510584Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:63976de325cf96986a68138c540176eb7bbe4e1189542594a7ab16349d3564df","observation_id":"b941f193-824a-429a-920d-a8ae3afb5702","resolution":{"observed_at":"2026-08-11T11:38:10.183657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20592","last_updated":"2024-12-14T06:15:40Z","snapshot_observed_at":"2026-08-12T01:17:10.618778Z","submitted_at":"2024-07-30T06:57:00Z","title":"EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos","version":2},"cited_work":{"arxiv_id":"2407.20592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20592","snapshot_observed_at":"2026-08-11T11:38:09.077313Z","title":"EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos","venue":"cs.CV","work_id":"93acc1df-f9d8-446d-a73c-0904475fac2c","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.518540Z"},"links":{"cited_paper":"/paper/2407.20592","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:ab2d51cfdbe011823018b4ea37d8caf553ee185f41010147b5a8f39e81a44021","observation_id":"33d81531-961a-4009-a078-e41a8cbac970","resolution":{"observed_at":"2026-08-11T11:38:09.083253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-10T16:47:10.110480Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-11T11:38:08.524846Z","title":"Sta-v2a: Video-to-audio genera- tion with semantic and temporal alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.524846Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0aaa0a5499ba3833abc72a1d42756e827de0b6c7cbecba8421c26dae2e41171a","observation_id":"6572317c-31b1-4bd6-847d-e69010d1a213","resolution":{"observed_at":"2026-08-11T11:38:08.524846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.156945Z","title":"Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation","venue":null,"work_id":"6ca36d9f-5a4f-4f0e-9426-1e7ffcd2b87c","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.531668Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:3a18f99ae04b2ca4e89218d9f93b53581cb34377dfa43577fce415897f5745e9","observation_id":"3855bbe9-cde8-4ab7-8d19-ebf778934d1b","resolution":{"observed_at":"2026-08-11T11:38:10.163099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.139176Z","title":"Improved techniques for training gans","venue":null,"work_id":"58ea066f-9b08-4f85-b60f-453fae65a529","year":2016},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.540913Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:df955ae9a2747d7330209fcd508d989cf025e28e3a644f6f440dfa0af89a6ab2","observation_id":"e7452dcc-fe0c-43b7-9871-f9dded336bbd","resolution":{"observed_at":"2026-08-11T11:38:10.144732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.121020Z","title":"I hear your true colors: Im- age guided audio generation","venue":null,"work_id":"a38dbfee-123e-4634-ba61-dae555c27926","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.548592Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:6d7a263aee567488b56c0b9ce8b642a84d2b7b10bfb9f3b24a841fbf5c3a54b9","observation_id":"c31ed0eb-ce9a-4e14-91ab-119022731ec6","resolution":{"observed_at":"2026-08-11T11:38:10.126600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.101847Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"c48bbb45-5d53-4864-a8ea-389d79fb9add","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.558828Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:32156036bca21760406914fac1b286fd7f09d0c51c0bbb8376c2d25761fe8db7","observation_id":"e339fad5-3435-45f4-8b7a-bfba2c375d31","resolution":{"observed_at":"2026-08-11T11:38:10.107386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.083350Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"be40f912-971b-4797-b306-17da6d19fb01","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.569671Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:8bc9326f8f615bf8153b4159e946792528adad98be124cae69c7173933538d06","observation_id":"5f42b313-b954-406b-a07b-baf800e90425","resolution":{"observed_at":"2026-08-11T11:38:10.089073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19132","last_updated":"2024-09-27T20:26:34Z","snapshot_observed_at":"2026-08-12T08:48:15.388524Z","submitted_at":"2024-09-27T20:26:34Z","title":"From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19132","snapshot_observed_at":"2026-08-11T11:38:08.575530Z","title":"From vision to audio and beyond: A unified model for audio-visual repre- sentation and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.575530Z"},"links":{"cited_paper":"/paper/2409.19132","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:a186ecd03a15a632242b4d34e01812dcf6e1d3fa8ca72a6820cd97c58fff6f6c","observation_id":"5b295371-2952-460f-a006-c9e040a762ad","resolution":{"observed_at":"2026-08-11T11:38:08.575530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.064649Z","title":"Mm-ldm: Multi-modal latent diffusion model for sounding video generation","venue":null,"work_id":"36373354-1d4d-4ca5-a2e5-036ab7bdf411","year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.582040Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:bddf22d845dd4ab17db0f083623b47662f43b4f72a0a3d18c749f22606d33669","observation_id":"c42c4b43-a187-4170-9b72-4d57bcdfa1a8","resolution":{"observed_at":"2026-08-11T11:38:10.070770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.045967Z","title":"Motion to dance music generation using latent dif- fusion model","venue":null,"work_id":"8bc2fe68-5cc7-4146-b12b-25247f94eac1","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.590042Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:6da9bb9d302dd45117b5176281f0f860b7f57a489eb75b5f9f7e15429b46a497","observation_id":"e6436e64-3cc4-4283-a367-9968b2297196","resolution":{"observed_at":"2026-08-11T11:38:10.051501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05782","last_updated":"2025-03-16T13:36:14Z","snapshot_observed_at":"2026-08-12T01:16:02.870314Z","submitted_at":"2024-07-08T09:45:20Z","title":"Sequential Contrastive Audio-Visual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05782","snapshot_observed_at":"2026-08-11T11:38:08.595780Z","title":"Sequential contrastive audio-visual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.595780Z"},"links":{"cited_paper":"/paper/2407.05782","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:63a3ccbdb82e542efa61c109b0d653b0574fd0934cb0be0bafe03cc582094bb6","observation_id":"17f509ef-8cf4-48bf-be47-94fe8379f1bd","resolution":{"observed_at":"2026-08-11T11:38:08.595780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T11:38:08.601784Z","title":"Towards accurate generative models of video: A new met- ric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.601784Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:b645e004b58ffdf88702c1ba555dc9b53b08a9d9b3ddbc47c1c0fe30bd33acf4","observation_id":"d39e8293-8224-4efd-ac56-17fe3c3e9265","resolution":{"observed_at":"2026-08-11T11:38:08.601784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-12T01:16:40.473604Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-11T11:38:08.607273Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.607273Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:b5772d45a21ef62de09c4d77695cba2de89642a11dcfaba1c841321cb19d7fdb","observation_id":"17c6a2ae-05ee-4646-b9bd-c3365752c2e5","resolution":{"observed_at":"2026-08-11T11:38:08.607273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.029143Z","title":"Phenaki: Variable length video generation from open do- main textual descriptions","venue":null,"work_id":"3fce8daf-4734-4309-8ff3-4195878d41e2","year":2022},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.613662Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:cb8f2d903db70dc181a8f609d1e9825a77c592680660f6b71b0faefa9d6f4178","observation_id":"9d616061-eb7f-4e5d-8b83-f30196b59afc","resolution":{"observed_at":"2026-08-11T11:38:10.034407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T11:38:08.619152Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.619152Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:10ef9a0189b55e9640ab5d421c3f905c1af148b93cb55e92812beb9561f342c2","observation_id":"c5402d15-6c29-4779-b6de-572cb59c2fc0","resolution":{"observed_at":"2026-08-11T11:38:08.619152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:10.011689Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models","venue":null,"work_id":"1d6d6b7a-c116-43d8-aa81-c12894cd7820","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.624308Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0021b61dabc1f9befe4342882ee565b952adef020622a0be162fde09a76d7545","observation_id":"8cd47d0e-1072-475e-8ec1-2822c3882e28","resolution":{"observed_at":"2026-08-11T11:38:10.017107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-08-07T10:32:51.835613Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-08-11T11:38:08.629162Z","title":"Av-dit: Efficient audio-visual diffusion transformer for joint audio and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.629162Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:464b3eb488779039b89e700326922ab115751b1bbf00b06e7905374b931604e6","observation_id":"c64c4b3a-1444-4aef-ae97-ee09b416cf1c","resolution":{"observed_at":"2026-08-11T11:38:08.629162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.994118Z","title":"Tiva: Time-aligned video-to-audio generation","venue":null,"work_id":"b9b10f98-0af1-4d1f-a8c1-2f87f5815e3f","year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.634755Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:4ab40b56967d5f4706a27f4a709a7133160db3359957e793c1ef9093e7d7ad8f","observation_id":"1f09b0b5-3138-49b2-98a6-1bd920b09879","resolution":{"observed_at":"2026-08-11T11:38:09.999647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.976445Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":"b96cdc94-2d9b-49ad-8c74-73cbc1bfd4a9","year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.640818Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:e996d10bf27d21f24acfb37ee468d2865f63ad70e01d88c9ad9fded9d4268e19","observation_id":"0fe7c216-2d3c-46c7-baea-8628c70b65f4","resolution":{"observed_at":"2026-08-11T11:38:09.982198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.958731Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"a7d4c673-80cc-4510-b60c-23f15930c790","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.647043Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:46871055d0d28726b2c9d5b3159b02d38bf0d607f71d52509e08a515d82c5a9a","observation_id":"40c0b88e-52a7-4f86-bc78-9d057a59e20b","resolution":{"observed_at":"2026-08-11T11:38:09.964317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.941240Z","title":"Son- icvisionlm: Playing sound with vision language models","venue":null,"work_id":"1e5755cb-9fca-4790-8ddc-bd4764e38307","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.653170Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:db9fbe0576801314e3e29303a7513646b7ca396fa64a231c9955c397d61c7648","observation_id":"f8b5c5dd-6edd-467d-9a8f-f05b3403ba3d","resolution":{"observed_at":"2026-08-11T11:38:09.946643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.921567Z","title":"Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners","venue":null,"work_id":"25b23571-980e-429b-bf37-773c0736e053","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.659002Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:6a0e69311aff2d70d24663497011e339745b0a8f442c89ab8906a4258c46e02a","observation_id":"2aeb31dd-8372-4365-9f8a-27fef25138a5","resolution":{"observed_at":"2026-08-11T11:38:09.928177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-11T11:38:08.665706Z","title":"Demysti- fying clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.665706Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:e889514c12f83749bf4052577d1c20a1bf9ee9ea4698f5c264b3cd7a5160cd6f","observation_id":"9ba67d64-8a39-4605-988a-adb3d59d14a2","resolution":{"observed_at":"2026-08-11T11:38:08.665706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.903701Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"6809bed4-8773-40ae-8d16-721a2b54c3a7","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.671346Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:46380586152f122f0f56e981bee7aacbfb53491f0e38a335614b4adcc1c4a8ad","observation_id":"783d744a-e4aa-40e3-9e06-2d623bf2308c","resolution":{"observed_at":"2026-08-11T11:38:09.909152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.884688Z","title":"Auf- fusion: Leveraging the power of diffusion and large lan- guage models for text-to-audio generation","venue":null,"work_id":"98f7811b-b900-4fc5-850e-e7d32df8e84d","year":null},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.676975Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d3d02c2e250f7c6371712f2083e55363cf11d9dde22303cacb6f13283edca32a","observation_id":"be5f2385-ce48-4bff-a520-1b547a610d1d","resolution":{"observed_at":"2026-08-11T11:38:09.890544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06135","last_updated":"2024-09-10T01:07:20Z","snapshot_observed_at":"2026-08-12T13:49:26.602826Z","submitted_at":"2024-09-10T01:07:20Z","title":"Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06135","snapshot_observed_at":"2026-08-11T11:38:08.683531Z","title":"Draw an audio: Leveraging multi-instruction for video-to- audio synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.683531Z"},"links":{"cited_paper":"/paper/2409.06135","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:a6a2430fdede3e3cc70d32b595b95a998a303a4fe8c69967d45c36db61062004","observation_id":"e8c34cb8-e5e7-49d9-b3fb-412f0dd77e56","resolution":{"observed_at":"2026-08-11T11:38:08.683531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05412","last_updated":"2024-10-09T16:49:58Z","snapshot_observed_at":"2026-08-12T01:15:14.927277Z","submitted_at":"2023-12-08T23:55:19Z","title":"CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling","version":2},"cited_work":{"arxiv_id":"2312.05412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.05412","snapshot_observed_at":"2026-08-11T11:38:08.871066Z","title":"CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling","venue":"cs.LG","work_id":"3972451c-53fd-40ec-a81c-da086d052726","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.689777Z"},"links":{"cited_paper":"/paper/2312.05412","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:d3145f336e0c501045348b781f5a0f0c71b96d39ee32703cd3adbcfef79a7a4b","observation_id":"9f0a9c24-7b86-49fb-b758-a0fa974a616a","resolution":{"observed_at":"2026-08-11T11:38:08.883104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.864285Z","title":"Diffusion model as rep- resentation learner","venue":null,"work_id":"1651adf3-6e62-498f-bda0-89a0c4325f7e","year":2023},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.695444Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:f183fb5d0dff1b3fe9868da3636528f0fa85c09c2e16d89beefab434e1e8c980","observation_id":"a9d01660-7b03-48bc-982f-d3b2aa92b682","resolution":{"observed_at":"2026-08-11T11:38:09.870310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T11:38:08.701528Z","title":"Cogvideox: Text-to- video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.701528Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:409d2c0f4fb6f3778056ff09bbb32bbcdce702aa6aaa9507307d7e9b608fb162","observation_id":"90778f86-5f84-465a-b49b-884719eee09f","resolution":{"observed_at":"2026-08-11T11:38:08.701528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.847144Z","title":"Diverse and aligned audio-to- video generation via text-to-video model adaptation","venue":null,"work_id":"a647a428-aed6-40b8-8a4a-016b574f5b15","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.708100Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:0b52f6680c6bb8385313f31506df79f3297eaaa62b38fe81c4a8ccd0b6c821dc","observation_id":"2d3b3dbf-0b50-495d-8127-ac13507d7c48","resolution":{"observed_at":"2026-08-11T11:38:09.852365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:09.829845Z","title":"Momu-diffusion: On learning long-term motion-music synchronization and cor- respondence","venue":null,"work_id":"5075296f-9e48-45a7-84ce-d976bc8b88bc","year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.713130Z"},"links":{"citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:ebcca64ff1057d21e40cde53eef9035774e9208cc15314c681e85fcdb822b99b","observation_id":"59f13910-172e-40cf-b89e-3d0a29552419","resolution":{"observed_at":"2026-08-11T11:38:09.835231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T01:16:41.969157Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":39},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 1 inbound Pith citation observation for arXiv:2412.15191."}