{"as_of":"2026-08-16T20:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ad0ac7bd181738a8a95c47f7393cd4aa242b6279a45f89213ccbbc186119f48","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:58.262045Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T08:20:02.986562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T08:21:06.814521Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"cited_work":{"arxiv_id":"2505.16195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16195","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specmaskfoley: Steering pretrained spectral masked generative transformer toward synchronized video- to-audio synthesis via controlnet","venue":null,"work_id":"ad004825-ef4b-4be2-8c76-2cb8780f5260","year":2025},"citing_paper":{"arxiv_id":"2510.09065","last_updated":"2026-04-17T15:00:46Z","snapshot_observed_at":"2026-08-15T13:40:23.269397Z","submitted_at":"2025-10-10T07:13:06Z","title":"MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T08:20:02.986562Z"},"links":{"cited_paper":"/paper/2505.16195","citing_paper":"/paper/2510.09065"},"observation_digest":"sha256:5572295be98051d308977c0be63adae4bf8971b7f6f2f89c7adccc42ddaef400","observation_id":"2678bf73-aeaa-4275-b270-963fb3ea0938","resolution":{"observed_at":"2026-05-18T08:21:06.817478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16195/citation-record","integrity":"/paper/2505.16195/integrity","json":"/paper/2505.16195/citation-record.json","paper":"/paper/2505.16195"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:09:54.545341Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.545341Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:dd19b19217fb37b1ae04456a22240c094efb9a264b5a09ce7094b45a415b8471","observation_id":"abc09efc-c13d-4be5-8260-8f0b94acdb03","resolution":{"observed_at":"2026-08-07T15:09:54.545341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-16T15:28:43.775568Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-07T15:09:54.619538Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.619538Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:3b46034621d287e46594b8316676a1d854cb7af6e06b5c1677cd56caf4cd6939","observation_id":"7953642e-47fc-455d-a2b1-c9fc8739fcc3","resolution":{"observed_at":"2026-08-07T15:09:54.619538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17672","last_updated":"2024-06-26T08:15:24Z","snapshot_observed_at":"2026-08-16T13:39:43.236317Z","submitted_at":"2024-06-25T16:02:59Z","title":"SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17672","snapshot_observed_at":"2026-08-07T15:09:54.712485Z","title":"Specmaskgit: Masked generative modeling of audio spectrograms for efficient audio synthesis and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.712485Z"},"links":{"cited_paper":"/paper/2406.17672","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:0d45909a6377f1a5488f00f7ce913b20d4b07590ee927be7500ccebb9ec8111c","observation_id":"10e5f49b-3c03-4f1f-b5df-9f047e5e0bfd","resolution":{"observed_at":"2026-08-07T15:09:54.712485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18503","last_updated":"2025-03-10T15:51:47Z","snapshot_observed_at":"2026-08-16T13:48:29.127872Z","submitted_at":"2024-05-28T18:14:52Z","title":"SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18503","snapshot_observed_at":"2026-08-07T15:09:54.810995Z","title":"Soundctm: Uniting score-based and consistency models for text-to-sound generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.810995Z"},"links":{"cited_paper":"/paper/2405.18503","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:79c409e8f80121da7f7b0d0d5e04851727b1114e997736c27e1014ac7c07b278","observation_id":"66c067d3-bdd2-4644-98ba-2b6fbf9c6141","resolution":{"observed_at":"2026-08-07T15:09:54.810995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.736030Z","title":"Stable audio open,","venue":null,"work_id":"f069c9f5-6d1a-4108-b3d0-bf129248a68c","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.911275Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:ee7d3dec5ca7a881c09c965fbf4fe97efdc3e014f030a542b808dd46fa87e16e","observation_id":"fe976c38-6e02-4d78-a072-a320e56aaf45","resolution":{"observed_at":"2026-08-07T15:10:02.801403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-13T15:37:50.191308Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T15:09:54.999597Z","title":"Taming multimodal joint training for high-quality video- to-audio synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.999597Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:a490cd0cfc7d1c40321999034d80cc8815bee91f37fed750c870474d284688b7","observation_id":"4ba353cf-9ed8-4907-825a-6f6705aa76b4","resolution":{"observed_at":"2026-08-07T15:09:54.999597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.580812Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,","venue":null,"work_id":"b88a1f24-4f77-42cd-9bef-c04307d1dc2a","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.139356Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f177e567b92f944d22ff3a3a0a0f8d02e562f9e3671fe361bae81077adc0895b","observation_id":"9b22797a-76b4-46ae-886b-f4261d8e063c","resolution":{"observed_at":"2026-08-07T15:10:02.647919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14598","last_updated":"2024-05-24T15:21:13Z","snapshot_observed_at":"2026-08-16T13:50:11.322635Z","submitted_at":"2024-05-23T14:13:16Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14598","snapshot_observed_at":"2026-08-07T15:09:55.278233Z","title":"Visual echoes: A simple unified transformer for audio- visual generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.278233Z"},"links":{"cited_paper":"/paper/2405.14598","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:a4d516e7da04f329443953be328aa9f1e342d8b6d6cad8e492122ecaef10165b","observation_id":"23d57b05-ab77-49f4-88f7-9f99a863cba2","resolution":{"observed_at":"2026-08-07T15:09:55.278233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.430540Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"f16a934d-89b7-44e6-9436-c2a0a79410af","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.387681Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:bdfaa04b861527d93c41afcaadbd8579e4b856b297711bdec09a69d30a66199b","observation_id":"e8818c41-138b-4f53-ab6e-af61e8b28b03","resolution":{"observed_at":"2026-08-07T15:10:02.496790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.282473Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,","venue":null,"work_id":"afef7ee5-4cec-447f-b388-f56f7d1256d9","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.487341Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:bbdd9c801c6ce8a967727c9b1aa4749c945fc21917c0ffdde461828b860b813a","observation_id":"cfd683ff-f0a3-4a25-baab-cead609353e7","resolution":{"observed_at":"2026-08-07T15:10:02.352055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T15:09:55.547205Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.547205Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f0aac916bb5805f64b74e9c30cae5debf9975c7468f266206ef3f6e04a5f499a","observation_id":"9fef9217-ca06-447b-8cd2-15c042f266c9","resolution":{"observed_at":"2026-08-07T15:09:55.547205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:02.132173Z","title":"Synchformer: Efficient synchronization from sparse cues,","venue":null,"work_id":"99e5c247-512d-42d7-93ac-ae9ce9ec2c3f","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.606504Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6f156fed1e94d658917224f122772669454d80a524ed3f5e024d034e516c7e38","observation_id":"0ddf2160-429f-49b1-b0ad-bcdd0b423e1f","resolution":{"observed_at":"2026-08-07T15:10:02.207841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.945731Z","title":"Adding conditional control to text- to-image diffusion models,","venue":null,"work_id":"9b775a95-abe7-4a71-ba9e-8ea9649d5b18","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.683396Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:0c81501b6e67d0b94d58e88c96d2073ffe0d00b1f95fbb5279dce64ff6b43239","observation_id":"8994e6ca-0abb-4e83-b1c4-652cdca8e598","resolution":{"observed_at":"2026-08-07T15:10:02.020964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.772989Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"f38cc7e3-d72f-48c9-a20f-ece9fa261035","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.753711Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:244e58ec09bce4b28892b9f0ec2abd05c5e73ca0752a857d4faabfb5abba144b","observation_id":"3cc6f8c6-e56a-4b03-b059-a741ae33fc09","resolution":{"observed_at":"2026-08-07T15:10:01.857838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-08-16T13:36:21.193520Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-07T15:09:55.831770Z","title":"Read, watch and scream! sound generation from text and video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.831770Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:d3e345b32ed7f3903121fa783964903c7371d6549128bf2492601da1d8d2a866","observation_id":"110c6b42-6d76-4411-a425-12ee6748e1f7","resolution":{"observed_at":"2026-08-07T15:09:55.831770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-16T13:38:02.108888Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T15:09:55.910310Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.910310Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:21bafbbf87e3190d7e133ce603b04e87b8d1560876609e449b27b3922a2faabd","observation_id":"72a83755-a8c4-4920-b509-daf337c91156","resolution":{"observed_at":"2026-08-07T15:09:55.910310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05679","last_updated":"2025-04-04T21:50:29Z","snapshot_observed_at":"2026-08-16T13:01:42.748007Z","submitted_at":"2024-11-08T16:29:07Z","title":"Tell What You Hear From What You See -- Video to Audio Generation Through Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05679","snapshot_observed_at":"2026-08-07T15:09:55.988743Z","title":"Tell what you hear from what you see– video to audio generation through text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.988743Z"},"links":{"cited_paper":"/paper/2411.05679","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:3fbb77387c256f27837cb39c7e08f558ac955d956e0bdbdeca4b48bbbbc93c94","observation_id":"0dd4b443-d5f0-4fa6-a51c-394681685a84","resolution":{"observed_at":"2026-08-07T15:09:55.988743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.513171Z","title":"Temporally aligned audio for video with autoregression,","venue":null,"work_id":"a167ff6e-f273-45af-a411-bd68b7aff3c8","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.045325Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:e497d34c5ac44de7d0f37a17928848f19daae9bdfe60f86dd41dccfe4c378400","observation_id":"6278bfb9-8f1b-4e1a-8085-cc24982c664e","resolution":{"observed_at":"2026-08-07T15:10:01.708710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.352394Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching,","venue":null,"work_id":"d306ac87-2aa8-40e7-9229-3b5638c5ef20","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.119327Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:7f030830b083e28b153de27350fb893fdb07e464ec50c17fbdb38eb484b2c59b","observation_id":"f2a7234f-eedb-4911-a3eb-28b36912076e","resolution":{"observed_at":"2026-08-07T15:10:01.422859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.185840Z","title":"Mavil: Masked audio-video learners,","venue":null,"work_id":"3d8eb3d8-6ddc-4da2-a004-10ee30764dde","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.195962Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c0764546d119ec1af7933daeac6b5e33a0738ea213c7532b175c57426217b440","observation_id":"e6501fb0-d017-4ff1-9d9d-438c83298075","resolution":{"observed_at":"2026-08-07T15:10:01.261287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:01.020209Z","title":"Diff-foley: Synchronized video- to-audio synthesis with latent diffusion models,","venue":null,"work_id":"73ae40f1-27da-45b3-a28f-86eeee3a5f7d","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.264683Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:92d5dfd24249eef2265477b108ae5b773d105ccd4bd61884b4ad83d8c17e5bb2","observation_id":"3cc382ef-08bf-40c2-a2e7-7cbbe25e8cc4","resolution":{"observed_at":"2026-08-07T15:10:01.089076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15023","last_updated":"2025-05-05T16:55:53Z","snapshot_observed_at":"2026-08-15T01:38:35.648532Z","submitted_at":"2024-12-19T16:37:19Z","title":"FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15023","snapshot_observed_at":"2026-08-07T15:09:56.308460Z","title":"Stable-v2a: Synthesis of synchronized sound effects with temporal and semantic controls,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.308460Z"},"links":{"cited_paper":"/paper/2412.15023","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:b03fdf2dcc4165ec75ad0146bfcae305210773be6ce78a34507cb025473b1475","observation_id":"6cb4d445-1e69-4e49-ba26-f9ebff2361a3","resolution":{"observed_at":"2026-08-07T15:09:56.308460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.854659Z","title":"Smooth-foley: Creating continuous sound for video-to-audio generation under semantic guidance,","venue":null,"work_id":"84fce43d-7573-489c-8537-a450cffe3da6","year":null},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.376868Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:cf91082c3ca3013c3b319d7e4a3c574e96376c54e6a2e158ebb6ff3fdb0ef1d7","observation_id":"1153f749-b0bd-4fd4-b5e1-da4c0392e7da","resolution":{"observed_at":"2026-08-07T15:10:00.923321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.681939Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"39bf8341-e070-4a5e-bf30-b820af29d4ee","year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.424504Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:0e41d76a4260eedfe7ea5019cc5cc6197dc7bfb3ac0ef232f3b35f2fd798b6d8","observation_id":"18b0951f-4fe7-4acb-a6e8-fc7fc4972a5f","resolution":{"observed_at":"2026-08-07T15:10:00.765043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.537391Z","title":"Maskgit: Masked generative image transformer,","venue":null,"work_id":"52136409-5d58-44a2-a92c-b48037f5c284","year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.497923Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:cfd6d14bbcbcfc1c6044a46096034acd790ae1efa4ed394fd5c83bd5ad6a81d5","observation_id":"34ad2f69-31e0-421e-aa52-a94edb43a1cc","resolution":{"observed_at":"2026-08-07T15:10:00.596551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T15:09:56.595415Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.595415Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:72ab06be64e6cc0cf07cd2f9bc742281febdf7928b0fadc1533b911c90a41a9b","observation_id":"389e82fd-b576-42d8-b9dc-c7eb68d08266","resolution":{"observed_at":"2026-08-07T15:09:56.595415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01135","last_updated":"2025-05-27T08:58:45Z","snapshot_observed_at":"2026-08-16T13:03:37.846874Z","submitted_at":"2024-11-02T04:44:27Z","title":"Music Foundation Model as Generic Booster for Music Downstream Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01135","snapshot_observed_at":"2026-08-07T15:09:56.680530Z","title":"Music foundation model as generic booster for music downstream tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.680530Z"},"links":{"cited_paper":"/paper/2411.01135","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:699e2b50c4a39ffde41579fe17748ba872d53b62de7743d75a9282ea12174e6d","observation_id":"1648a738-ef21-43fe-8484-e30a2be13b05","resolution":{"observed_at":"2026-08-07T15:09:56.680530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:09:56.761212Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.761212Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:e925de9e0f5df1dcb017b0e18c3dd2b07a09e7a409a458b3a209dcb6f3e83bf1","observation_id":"4ba595d1-8f83-41b5-b393-85b15143268d","resolution":{"observed_at":"2026-08-07T15:09:56.761212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.417041Z","title":"High- fidelity audio compression with improved rvqgan,","venue":null,"work_id":"cdc270c5-4915-4175-b0e7-c8dd60316ffd","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.840072Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:2e5d12578c724e065e16a816ce8c27661fdfae37ce436f97ce692c2d41c5432b","observation_id":"bc0b6b04-276c-4456-8638-737ada8b65fd","resolution":{"observed_at":"2026-08-07T15:10:00.473120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-16T17:48:41.711685Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-07T15:09:56.889056Z","title":"Taming visually guided sound generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.889056Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:93079a834587b86c5d0713d4ee98389b7305de35ee5246946d85b02920ed02d8","observation_id":"52abba22-8b04-45dd-aacc-3e6d083918f9","resolution":{"observed_at":"2026-08-07T15:09:56.889056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.312361Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"9ee91eec-82db-4469-ac38-ec053ab978fd","year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.939962Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:db5b48d5b5034c9b9a4a95f1fe0c4bb5b06f5ff5f8abd07a96e6dc7603d07127","observation_id":"ea1a425d-b872-4299-bf93-254e01388d49","resolution":{"observed_at":"2026-08-07T15:10:00.382535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:00.143283Z","title":"Extending audio masked autoencoders toward audio restoration,","venue":null,"work_id":"af13a740-e93c-4bf6-8290-335ae2984d70","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.006139Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:2398c05af5c9f28782f2850a32a0a5d1e15be149ac2c729fc5e654c2ce0f62df","observation_id":"3e56c4ab-42ed-407a-8092-60bd86077502","resolution":{"observed_at":"2026-08-07T15:10:00.237928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.912805Z","title":"Mage: Masked generative encoder to unify representation learning and image synthesis,","venue":null,"work_id":"6cd7bf08-fe61-48da-9385-f95a8ac65094","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.058562Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6230a541c21db03ccd7c0acf64623d197b15a2700e8c6136928e0ef19feffe13","observation_id":"87d13178-79e3-43d7-b824-dede84d37966","resolution":{"observed_at":"2026-08-07T15:10:00.021600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T15:09:57.138047Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.138047Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:389b8ca56c99a1a1b4f21ca78af32ca3a615b3427bcd716d8f96435b7b183123","observation_id":"ead1e612-6841-4a2b-817b-ab9faebc6d7d","resolution":{"observed_at":"2026-08-07T15:09:57.138047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-16T14:28:28.987831Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-07T15:09:57.179030Z","title":"Pixart- {\\delta}: Fast and controllable image generation with latent consistency models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.179030Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:e9a1d80be3750c300321784604b729795544557b6cf1da601d39f152cf520b8a","observation_id":"158aff55-058b-43f9-a4a9-4fc26dd9b46b","resolution":{"observed_at":"2026-08-07T15:09:57.179030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16969","last_updated":"2025-01-09T11:42:21Z","snapshot_observed_at":"2026-08-16T13:57:45.698346Z","submitted_at":"2024-04-25T18:42:25Z","title":"COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations","version":4},"cited_work":{"arxiv_id":"2404.16969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.16969","snapshot_observed_at":"2026-08-07T15:09:58.377545Z","title":"COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations","venue":"cs.SD","work_id":"625d8fa9-1e97-427a-b048-aa15f228f409","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.248961Z"},"links":{"cited_paper":"/paper/2404.16969","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:4138e077f866753d0a6671c564195e97af04ad81d243572e40e8f6daad993a82","observation_id":"c4db9e3c-35ea-45c6-aa2f-f3f918488ffb","resolution":{"observed_at":"2026-08-07T15:09:58.450395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.702460Z","title":"Editing music with melody and text: Using controlnet for diffusion transformer,","venue":null,"work_id":"e9d9114a-9f13-4955-b131-92165641f34e","year":2025},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.354123Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:3e6a2f4dcc95978b47e56202ad969aa6964fe328c2312892a5a697a231556d23","observation_id":"d64c8f29-6bdc-49fe-a011-3afb21821ef2","resolution":{"observed_at":"2026-08-07T15:09:59.778127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T15:09:57.420079Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.420079Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:a63505c715a59b0dc34e678d0d433d379a25d1b72b417529699d229e27a3a499","observation_id":"5e669fe6-ece2-4d8e-88cf-6ced1feec5be","resolution":{"observed_at":"2026-08-07T15:09:57.420079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-16T16:04:52.013149Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:09:57.486525Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.486525Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:c423336f7025f056e3550ddf741bccd00d0edeb2169b86fb68cd27af2ce83caa","observation_id":"e77c68c5-45da-461b-aeba-416f1234010b","resolution":{"observed_at":"2026-08-07T15:09:57.486525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.533827Z","title":"Stemgen: A music generation model that listens,","venue":null,"work_id":"b67cf1c2-22d8-4582-bc5a-35219ee683ea","year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.567373Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:603a4ed113bf98d19da61fd05a2dd9900f50bfb1c7bbc60e5363df4b37b64703","observation_id":"b1ce6187-a2e0-41d4-842d-2858f15c4994","resolution":{"observed_at":"2026-08-07T15:09:59.611073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.372356Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"ab30474f-7aef-4fb4-97b0-7a347c8b87df","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.668416Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6e01e7d2ddd2e891d117f7008cfd8c1471188ece6dc349828cc2c9b31c13e593","observation_id":"1c375ab3-c629-4e01-8ec7-e5d4b76227e4","resolution":{"observed_at":"2026-08-07T15:09:59.447837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.239922Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"f91a8b6a-c179-4db1-a047-8b01f5f2204c","year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.772268Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f86b8bc675efda38bbd24a3e63d11fe5bc0055866c489117eba99a077577f892","observation_id":"899ae236-eb3b-43c4-83cd-44ea45f0aa47","resolution":{"observed_at":"2026-08-07T15:09:59.318967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.203592Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"db04a248-55d2-4948-989b-437326d96781","year":2017},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.862288Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:6414e8e175b320c7211196c9f2749142e13c6fbbdd750d463adaaade1464e150","observation_id":"f6054d9e-adc8-4eb1-aca5-4fb921a2b459","resolution":{"observed_at":"2026-08-07T15:09:59.207305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-16T17:50:24.547828Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T15:09:57.929534Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.929534Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:11ed5b80d47b218b71d7c5b979bd4817be67c32b4b51a6215a5d02f84c285358","observation_id":"a066d024-477c-4e68-9145-818d1990d3b7","resolution":{"observed_at":"2026-08-07T15:09:57.929534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.084511Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"f3046432-c8ae-4c07-9666-ed0614178cbe","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.028545Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:fcae82c14607de6e3e665b25a71060b0e07688a3af466c897442d3efbae2628d","observation_id":"9d1e8033-5093-4836-8fc2-544e8816659a","resolution":{"observed_at":"2026-08-07T15:09:59.139077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.946013Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"a70eb40e-7565-4808-8d2b-b6eb7e6f6bce","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.119664Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:b499edbfed12ec1d2257dea03418353f5cfb158a2c0e9a6a5a638a28f5e36a5e","observation_id":"330a7253-e81a-4013-98aa-49fd7a4ff704","resolution":{"observed_at":"2026-08-07T15:09:59.019857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.802861Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"e509e1ca-2cf2-4142-9306-6e46a194a696","year":2017},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.194238Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:3c5b33919ad934fad1d74f7dd651f186ec583615c7ea181c7f5b51497144e30e","observation_id":"ecda695c-59e4-4d15-b432-4efb0dcb829f","resolution":{"observed_at":"2026-08-07T15:09:58.866089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.708625Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"6cea203c-3757-41f4-9b36-40f73fc94f96","year":2020},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:58.262045Z"},"links":{"citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:90950c594a575e317f53d93f296a01fb8df2acb1176f83f26116b287c0964fe4","observation_id":"9efe0af6-4ce8-454b-8bf9-b24274ca4411","resolution":{"observed_at":"2026-08-07T15:09:58.751950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T09:25:12.637742Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2505.16195."}