{"as_of":"2026-08-23T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86c4298d1d611792ac22334a18d3381afb7c70d657c667eca0d3c3e9171a31bb","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:01:38.747896Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18157/citation-record","integrity":"/paper/2412.18157/integrity","json":"/paper/2412.18157/citation-record.json","paper":"/paper/2412.18157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.311369Z","title":"Generating visually aligned sound from videos,","venue":null,"work_id":"50d34295-bbf8-4901-b6db-aa0e32d7085b","year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.603327Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:09c94308ccccfe189a29d54db6bf63ff0230509e043fda99199cc0e26d8c9ea0","observation_id":"5dfb7121-e594-4dc0-93c3-7e824b842549","resolution":{"observed_at":"2026-08-11T05:01:39.315954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.296527Z","title":"Taming visually guided sound generation,","venue":null,"work_id":"eb5e248d-6507-423b-87d3-6040ece3b19f","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.608027Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:4500d03ad87c7d6cc7679e5d6436cdf29151c3e236c089cf3090b3cef93b58b3","observation_id":"7f37af99-e3dc-4270-8fd2-c3016a9657a5","resolution":{"observed_at":"2026-08-11T05:01:39.301234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.612589Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.612589Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c77fd444a41b8dd1ac85d251a36172f1f9417647c97a82be13797e2382e16306","observation_id":"c4581f99-f988-4b81-9220-c5044e0f6b6a","resolution":{"observed_at":"2026-08-11T05:01:38.612589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.618248Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.618248Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a695178949ff52212fe4fda69b5bf85aba6f73bf432e29b3451e4b79e8d0630c","observation_id":"46a1da61-e450-446f-8cfc-a394399df2be","resolution":{"observed_at":"2026-08-11T05:01:38.618248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.623065Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.623065Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:f793983b19f74b679cc4f06d5819d88db91c3aae053f691c1006975328bda39a","observation_id":"a744e841-2c08-404c-8b66-45e555bc176e","resolution":{"observed_at":"2026-08-11T05:01:38.623065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.628058Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.628058Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:8434e03c75a24a3128a482f8f3dfeee2994a7ab0d3182b186f3ce310e4703526","observation_id":"c8e4a828-487c-4ba8-a2c2-779ae22072e6","resolution":{"observed_at":"2026-08-11T05:01:38.628058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.245072Z","title":"Conditional generation of audio from video via foley analogies,","venue":null,"work_id":"e6595e8d-62db-412f-a5e1-7bbf003db4c8","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.633488Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:bd07d3b4454304ab5f81dd1bb4f4559d4e0f1f25643a542c2f5cdf1b110a9b58","observation_id":"f99302b1-5d3d-4c06-ab10-26ca27acd214","resolution":{"observed_at":"2026-08-11T05:01:39.249712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.231062Z","title":"Varietysound: Timbre-controllable video to sound generation via unsupervised information disentanglement,","venue":null,"work_id":"19827b53-4623-453d-baba-b4232feb149e","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.637922Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:5f8423202e91d2e14a663ab09c008c4fb05804c58ecd922d751fbea9d3474997","observation_id":"0de05aa5-1667-4472-bad8-014d5c258bf7","resolution":{"observed_at":"2026-08-11T05:01:39.235676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.216167Z","title":"Diff-foley: Synchronized video- to-audio synthesis with latent diffusion models,","venue":null,"work_id":"9b33e0fc-4f9e-4521-ac6a-c2212eb5a359","year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.642369Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:f1b7a30d3b5b39c3b8f347a8e95846449b4a2314a853d865ecf559834a61b13c","observation_id":"bb71c8fd-1a60-497d-bd44-2f50c84b26e6","resolution":{"observed_at":"2026-08-11T05:01:39.221071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.202050Z","title":"I hear your true colors: Image guided audio generation,","venue":null,"work_id":"7cce3207-0fb4-4a73-9c0c-f2aa28bd7018","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.647528Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:544e71a9580fce52d99e2c0ed2f5551cbd1a7b4e55ef37587b9307ed58d24652","observation_id":"b0baf4ea-d77a-4717-8936-db8d6dda74ef","resolution":{"observed_at":"2026-08-11T05:01:39.206553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-19T13:11:56.801120Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-11T05:01:38.651937Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.651937Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:bb9136cca914c2ceac54b138d78ae3477081f08b03fe53d78b8022b3cfc71d97","observation_id":"82f2665c-0c2a-40d2-aeef-9889bc041184","resolution":{"observed_at":"2026-08-11T05:01:38.651937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-18T04:36:40.182437Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-11T05:01:38.656647Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.656647Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:28f3ee910077254c96e8011a1668197bf4d546e57f833b68628830b1e3535c63","observation_id":"5b036e71-af05-4ca9-8827-5dfeebc4e2ea","resolution":{"observed_at":"2026-08-11T05:01:38.656647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T05:01:38.661167Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.661167Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:1de548bc6d451c8e4f7f2314acbc1c45ab3d84bdfec0201121541fd5eb0de03f","observation_id":"ebc93496-4ccc-4660-8eb4-33adb2f3926e","resolution":{"observed_at":"2026-08-11T05:01:38.661167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.667045Z","title":"Pseudo-label: The simple and efficient semi-supervised learning method for deep neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.667045Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:fa2d493deb0e7542457e95c3241c8fd3759c258afc87fa15a6b9a8ed259d636b","observation_id":"66576f66-c5e7-4e9b-ae71-754e911cb725","resolution":{"observed_at":"2026-08-11T05:01:38.667045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.178665Z","title":"Predicting deep zero-shot con- volutional neural networks using textual descriptions,","venue":null,"work_id":"eec097b1-6aba-4dd1-8074-86eb21593da2","year":2015},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.671276Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c05f254f4c2987193236967201864a661b6ada52d11c600f156f91a84a561a34","observation_id":"dc1c3c51-5603-4238-89e0-28dd1de65d9c","resolution":{"observed_at":"2026-08-11T05:01:39.183592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.164135Z","title":"Integrating language guidance into vision-based deep metric learning,","venue":null,"work_id":"441ab3e0-feb0-4184-800c-587a578da0d5","year":2022},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.675614Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:13454baaf14dbf121c9b0f290bf544802f8771b38af1d78eb24d695b756d7aea","observation_id":"7f9402c1-e700-4568-98b8-c32d1ff27321","resolution":{"observed_at":"2026-08-11T05:01:39.168740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-11T05:01:38.679692Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.679692Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c8e77c9cd71360bd5f1e0ebdfd5ecfbbfe0005af276e09a4b3e2fb28de080258","observation_id":"9f53574b-4bc0-45cc-9953-91bb9bf5360b","resolution":{"observed_at":"2026-08-11T05:01:38.679692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.684397Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.684397Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:48cfc49362315c6bd9f55f798477145fbbea815dad8d75f9d38697ba57f90593","observation_id":"ec336e35-c0ad-496c-ac41-f1363c5c8ddb","resolution":{"observed_at":"2026-08-11T05:01:38.684397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.140666Z","title":"The benefit of temporally-strong labels in audio event classification,","venue":null,"work_id":"1b18b426-2bd0-46d6-85b1-37918382bba8","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.688822Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c44f5a52ae26ac2cf45448386031d403998e0559053b93d2e0935053a7f0bad8","observation_id":"5c52080e-0a92-40c9-9e0b-7bfaf9c2c1e2","resolution":{"observed_at":"2026-08-11T05:01:39.145445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.125924Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"b066e9a9-8925-4f6a-a349-378cb4dac161","year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.693180Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:3b741e111b8467866b81a0a31921ee308d53b0fb7f1c882c5d6e4d43cc369339","observation_id":"828f7af1-5619-4181-8f10-f5d78f21b61c","resolution":{"observed_at":"2026-08-11T05:01:39.130794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.111499Z","title":"Text-to-audio grounding: Build- ing correspondence between captions and sound events,","venue":null,"work_id":"17e504ef-bfba-4c96-8dc2-0cdf578b3a8d","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.697764Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:4dca31d84b9882477fddab5f8b85a869627471b084f6f3ee073d587f508ba30f","observation_id":"daa08241-334d-499d-8abf-6c34faf50bf4","resolution":{"observed_at":"2026-08-11T05:01:39.116072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02584","last_updated":"2024-07-17T06:11:43Z","snapshot_observed_at":"2026-08-21T12:51:48.943019Z","submitted_at":"2024-01-05T00:27:32Z","title":"Towards Weakly Supervised Text-to-Audio Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02584","snapshot_observed_at":"2026-08-11T05:01:38.702238Z","title":"Towards weakly supervised text-to- audio grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.702238Z"},"links":{"cited_paper":"/paper/2401.02584","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:bad9bd5a43fbceb7d171aa3074cd908ca1b4f0af49577aabb7574cd69f34066e","observation_id":"7d0daffe-6166-48ba-a9fb-836f29a9d52f","resolution":{"observed_at":"2026-08-11T05:01:38.702238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-11T05:01:38.707509Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.707509Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:6576e3e4cc5720db1f0c16f835391f6ece5211b1093e4629bdc811300fd67053","observation_id":"a8e132c8-e7ce-42df-8f5e-1e48c1b3d1a3","resolution":{"observed_at":"2026-08-11T05:01:38.707509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17508","last_updated":"2024-03-26T09:09:59Z","snapshot_observed_at":"2026-08-21T12:50:58.969643Z","submitted_at":"2024-03-26T09:09:59Z","title":"Correlation of Fr\\'echet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17508","snapshot_observed_at":"2026-08-11T05:01:38.712224Z","title":"Correlation of fr \\’echet audio distance with human perception of environmental audio is embedding dependant,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.712224Z"},"links":{"cited_paper":"/paper/2403.17508","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:09a2617d09ffe964d304cc752d862030d95842e5661272c7b59749444b7bccd3","observation_id":"52cf62e5-1d30-42d6-8671-3b9ea584e164","resolution":{"observed_at":"2026-08-11T05:01:38.712224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.716900Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.716900Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:d2e6d00ca5625ecf24e8734c7652cd3fcb53ffea31d3622e502adc17571049ef","observation_id":"51b0d9ab-a0c1-456f-aa1c-75de199c2702","resolution":{"observed_at":"2026-08-11T05:01:38.716900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.086332Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"d1b3d260-1b33-4401-a2f9-20ede06055d5","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.721295Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:530635921a2d0247b1dde1cdf1e7f844abc8496e48cc5fc53d8fed96b28404f6","observation_id":"dd755cc4-22e3-4c89-81ff-0e3ab5c6b53d","resolution":{"observed_at":"2026-08-11T05:01:39.091317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.071477Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"7fae705f-a42f-4bc5-99e5-ba63d2c96732","year":2017},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.725435Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:9405571188ace725157d090bb10eb2157f5562f2453b6cf44746b0fb091ac3cd","observation_id":"1e89bd65-4bed-4f43-b4ec-6e44e35a5939","resolution":{"observed_at":"2026-08-11T05:01:39.076628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.057057Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"14e76012-c7b3-4326-acca-8df2e4b6313c","year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.729633Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a12b6a98932185e3c03d2653d7ebc5976d20100d152dd7bef9f8c8ec0b3b6263","observation_id":"13e56c13-8629-482d-85ad-4487522ced56","resolution":{"observed_at":"2026-08-11T05:01:39.061764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-19T20:13:28.395800Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-11T05:01:38.734637Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.734637Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:b798595fa51acca9e0a5b8782f352933b3616881da0e5c4eeb93244432853fa7","observation_id":"abc35f88-6c8d-4329-ac81-183c089e950c","resolution":{"observed_at":"2026-08-11T05:01:38.734637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.739388Z","title":"Video-foley: Two-stage video-to- sound generation via temporal event condition for foley sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.739388Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:08f6f1508af776ce9a380234c814fafa6cb1fd4eef295189a75170ff4111e977","observation_id":"4df78d47-57ae-4bef-acd9-d64e21b250ed","resolution":{"observed_at":"2026-08-11T05:01:38.739388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.042378Z","title":"Wav2clip: Learning robust audio representations from clip,","venue":null,"work_id":"b6fa339d-0c52-403e-bad4-b2927bbcc879","year":2022},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.743732Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c1e3490b789519cacbdc8e4b2cdda8255577c6bd77750357a465b9cea5a4a81a","observation_id":"78d8003f-9395-4bc1-90d8-f339f896c700","resolution":{"observed_at":"2026-08-11T05:01:39.047018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.025085Z","title":"Fr ´echet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":"4d4b9052-96e4-4156-a72f-6e881c11301e","year":2019},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.747896Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:b75e17391f5c260a0454c639aede6de5ecf88d579de202cd865d0af71eb8e226","observation_id":"fb97627d-ccf9-465d-8054-401f6636873f","resolution":{"observed_at":"2026-08-11T05:01:39.031776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2412.18157."}