{"as_of":"2026-08-14T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c61f3a2ab921c7917b6e24036034574f710ad2c64bd9a7b2266ce3bbefbd484","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:50:17.733574Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04957/citation-record","integrity":"/paper/2509.04957/integrity","json":"/paper/2509.04957/citation-record.json","paper":"/paper/2509.04957"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.14441","last_updated":"2024-08-26T17:33:47Z","snapshot_observed_at":"2026-08-13T12:33:53.222797Z","submitted_at":"2024-08-26T17:33:47Z","title":"Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification","version":1},"cited_work":{"arxiv_id":"2408.14441","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14441","snapshot_observed_at":"2026-08-05T05:50:18.130457Z","title":"Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification","venue":"cs.CV","work_id":"a2c24c06-76b1-45df-9541-3f440796c588","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.519723Z"},"links":{"cited_paper":"/paper/2408.14441","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:6555b5aad1838fd64edf9943e3796438873342820699e6377ccbd57037d510e7","observation_id":"f842bb75-a603-4117-9da5-2b066087a606","resolution":{"observed_at":"2026-08-05T05:50:18.135702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.601614Z","title":null,"venue":null,"work_id":"a5a94616-ac61-4aff-bc83-5ce64a8347f8","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.524856Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ebc5afa020957025ffc45e0e9b4d3f83168deb7de4286fb1dcdc34f459570863","observation_id":"d92612f5-0f85-4dc3-8993-f96e18ac2a2f","resolution":{"observed_at":"2026-08-05T05:50:18.606540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.586835Z","title":null,"venue":null,"work_id":"bbd5be1b-da22-4f04-8b76-a412f3351ad7","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.529177Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:72e6e8f271c6cdecfc97d03cbfcb1d5c7769522aa1860d096c3fc51d2f77a2a3","observation_id":"64b80587-6110-4140-a7e1-9e808d6a1dfe","resolution":{"observed_at":"2026-08-05T05:50:18.591054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T05:50:17.533640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.533640Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:015ad637482d29c57da5633c9161450debfd290d319cde2d333122d966fcac79","observation_id":"b083d87c-44e8-4c1f-b798-83715b8af64d","resolution":{"observed_at":"2026-08-05T05:50:17.533640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.572023Z","title":null,"venue":null,"work_id":"e1930de3-7603-4794-9117-c1b64d58bce2","year":2025},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.538704Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:73662efa8fe77a774a87416f2f38f133746ad52e1a672e00005a941c03054e03","observation_id":"0a4974b8-f164-4803-9450-e0320ed4036e","resolution":{"observed_at":"2026-08-05T05:50:18.576690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T05:50:17.543238Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.543238Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b2410ad299dd2913bd1c46332ddb1163ff5f02063a44ee2284395d17cfc16fca","observation_id":"8f7afa3b-c735-43ec-b80b-1d9279f0be44","resolution":{"observed_at":"2026-08-05T05:50:17.543238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T05:50:17.548517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.548517Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:b269b08d6a266403ceb32ce416c3c59410fec814884f62b7a83bb1369dd9a304","observation_id":"920e750c-87cb-44a9-90a8-487cc2e9d6d9","resolution":{"observed_at":"2026-08-05T05:50:17.548517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.557977Z","title":null,"venue":null,"work_id":"dfa8e494-49e9-4c9b-b4a0-fc26fb1c0995","year":2021},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.553217Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:1538859882a049d2d7d2c0956036c90e3f3121bf22b3f20ba7d531dc3d221e7c","observation_id":"2477458d-f157-461f-a77c-3dec81e27925","resolution":{"observed_at":"2026-08-05T05:50:18.562436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.543039Z","title":null,"venue":null,"work_id":"431bc4a7-fab1-474a-ad4f-d33491b85c14","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.557627Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:1d6ef3c0f06f2e1e93288c4acf555fd760aa54eca26da657608707731c69fc87","observation_id":"8b65355f-770c-42a0-9601-7638765eca5f","resolution":{"observed_at":"2026-08-05T05:50:18.547989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.528600Z","title":null,"venue":null,"work_id":"6a3cf09d-4c1f-448f-b15e-b6792317eccf","year":2017},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.562046Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c58662a8fd88cb7d4de5befd028801c8791af3ace2fc969a85e25a1f3590d68b","observation_id":"01ee2aa1-7ee7-4fd0-95d3-481ff5b6f6b9","resolution":{"observed_at":"2026-08-05T05:50:18.533267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.566407Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.566407Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:c4f423260e3a50b730e165225bf221e084c679bb47e01974f007027075c141de","observation_id":"ccad6bb4-a840-49e3-8c12-ce157375b9ed","resolution":{"observed_at":"2026-08-05T05:50:17.566407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.570895Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.570895Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:9f6b4a6e2314c47c4c0f067b66da17a844e578805f874f5e903439a3dbc85814","observation_id":"f2c81e68-5173-487d-a076-ae32126e42b7","resolution":{"observed_at":"2026-08-05T05:50:17.570895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T05:50:17.575495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.575495Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:06b13baa12a19276054500e9ff80502e250a73b5e9f06e64b66ee6c66f8e2bb7","observation_id":"2daa0361-24c5-4086-8f2b-9dbb3aa95cba","resolution":{"observed_at":"2026-08-05T05:50:17.575495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.494930Z","title":null,"venue":null,"work_id":"d47f63d9-9ab5-44b3-a2a0-fd3f29d97fa2","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.580136Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:6766f85ef01b2991aefbddcef7ebc528639987b30def1c114d9016aa56109ad6","observation_id":"adad0761-b7c1-48a1-868f-c62c50dd4d3e","resolution":{"observed_at":"2026-08-05T05:50:18.499605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.480071Z","title":null,"venue":null,"work_id":"5e438ac9-58be-4390-a9f7-fa0f41bb1aa1","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.584412Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7fc8f7921f1e63ede95543d23fef41ad4ba3995f45dd020714bb25dc1b19ea0c","observation_id":"99e9fa52-c8de-4799-bf42-bdf00c1033ba","resolution":{"observed_at":"2026-08-05T05:50:18.484811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.465705Z","title":null,"venue":null,"work_id":"19e7eba3-48cc-4e52-ba55-2334d1351799","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.588724Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5732f2eb6bb8b6430aee00738328f50e6920ebcbd4c8f05baf22813b73ccfa3e","observation_id":"18893818-3c1a-4f82-b771-ea52e6e531cf","resolution":{"observed_at":"2026-08-05T05:50:18.469860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.451533Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"28c554e5-7552-46d5-94d9-2c60dd0f808c","year":2015},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.593020Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:cccdc782fdf551c58d80bcdf3193f152b695de11db2bfbf77b1af4f726a2343e","observation_id":"b7ccc4d3-bb00-44a2-a790-a168969d09b1","resolution":{"observed_at":"2026-08-05T05:50:18.456063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.436950Z","title":null,"venue":null,"work_id":"82458efc-2b78-48e5-985b-56fa708c730a","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.597490Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:f25c36ddb8f1ed7ba3aca4c5f2a48f802fcf8ae225166741070278d2deebf0cc","observation_id":"17df4267-1f6d-436d-96a8-c81db972266b","resolution":{"observed_at":"2026-08-05T05:50:18.441960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.421737Z","title":null,"venue":null,"work_id":"c8553fe3-7c2b-478e-89ab-30b2c2b076b0","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.601835Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:0f99cb22927c02389aad6233c681c5966983e186d45317a527f18cc60f913c42","observation_id":"1108955e-afe4-412a-af83-d5f6f9f2b367","resolution":{"observed_at":"2026-08-05T05:50:18.426643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.606300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.606300Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:bb922f77aefbfce7ab435dfd74474e5c1ebb0de4cb428e91bb07661d6ffd64f0","observation_id":"f37833bb-2ede-4a41-a0f5-d21a26a422e8","resolution":{"observed_at":"2026-08-05T05:50:17.606300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.407450Z","title":null,"venue":null,"work_id":"ad6907ab-6ff6-4b22-99f2-72869f15106e","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.610788Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:121af7c2205193f88a48d2f75a8b955c824914cc9d768f78e8fa97b4c6f8fd7e","observation_id":"1bf7075f-6193-42a6-bd20-d612f08a4319","resolution":{"observed_at":"2026-08-05T05:50:18.411781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T05:50:17.614967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.614967Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:98cdb7b7f1cfb8a0a6de01cee67ac63fb1bb0c1ccbe0ec693dea95593503084c","observation_id":"975cc498-caf8-4376-b9ce-d025e0bd1d04","resolution":{"observed_at":"2026-08-05T05:50:17.614967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T05:50:17.619399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.619399Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:ce2e79d434f7c60764adb7ec8c8e6f08ee2dea2b20e25ce59f4d146031904623","observation_id":"66111a53-d5f5-48bc-9bb2-83037c25e61c","resolution":{"observed_at":"2026-08-05T05:50:17.619399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.392707Z","title":null,"venue":null,"work_id":"b6ca300e-bd6e-474c-a45b-4e1234eee67a","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.623593Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5867923ff95e753e74c206d61f7102b7db00dfe6659cf6003e480264fbd4e51c","observation_id":"0d32f6cb-e52f-4189-9917-074c376419be","resolution":{"observed_at":"2026-08-05T05:50:18.397292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33996","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:17.938126Z","title":"Plumbley","venue":null,"work_id":"00fa6bac-67c2-4fbc-bf19-e37c29cd8e35","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.627972Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:2d88dc612f580713ee742f04b4fbe18201ca19b37be530a7ed6e91bd70d77af7","observation_id":"d382af3b-d5a5-497c-b424-bca310888960","resolution":{"observed_at":"2026-08-05T05:50:17.945212Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.378672Z","title":null,"venue":null,"work_id":"bda39ba9-d6b1-4bf9-90cc-0435d6ebd11c","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.632277Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:f9f716d0a77a19950b25bdadb376bcc33e05537c11d9c0814cbace43e975a899","observation_id":"67980384-74a7-4b10-a69f-40e82ae3e346","resolution":{"observed_at":"2026-08-05T05:50:18.383059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.364494Z","title":null,"venue":null,"work_id":"0433b89b-2693-4b27-bbc9-cde0a167bba2","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.636526Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7d298d45bac527d79f9ff2d79435ac3385cfd37dc43ab906fddc9c1de9989f63","observation_id":"2004328e-cec0-4701-ad35-823601a41df6","resolution":{"observed_at":"2026-08-05T05:50:18.368955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.349803Z","title":null,"venue":null,"work_id":"b8223669-7fb1-4fb1-be4e-8fe04ac3b148","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.640702Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7271cbbc943ea9ee5261f0de57e287d66bf646c63926b437f80fe77a61889bfb","observation_id":"52cdf0cd-88c2-47ff-8f27-7cf897e9e091","resolution":{"observed_at":"2026-08-05T05:50:18.354042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.335219Z","title":null,"venue":null,"work_id":"5c4db931-59bc-4d1f-b7b1-b917a2a65bff","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.645138Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:2eed087defb26e873e80b09fb63e78f4adf76d59d7a36e1b90685410d01f8392","observation_id":"31785116-109a-4ac6-a46d-f4f50b0ebf38","resolution":{"observed_at":"2026-08-05T05:50:18.339848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10537","last_updated":"2023-09-19T11:33:43Z","snapshot_observed_at":"2026-08-13T10:10:04.020922Z","submitted_at":"2023-09-19T11:33:43Z","title":"FoleyGen: Visually-Guided Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10537","snapshot_observed_at":"2026-08-05T05:50:17.649506Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.649506Z"},"links":{"cited_paper":"/paper/2309.10537","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:e3c8ae7b6af4bdad7a2a487e7d97d018f2cf99ea79eea535a33fc383e9bb9313","observation_id":"e9fa5e75-9146-4be3-b3ce-2a4d7c1b470c","resolution":{"observed_at":"2026-08-05T05:50:17.649506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.321009Z","title":null,"venue":null,"work_id":"e273351e-c3df-40a6-ae97-cd17806728a6","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.654064Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:6cd8423080f2e94954f4411237c33f412508252f1cb3131170551c7f628901c7","observation_id":"319ee91f-0d9e-4a29-a079-c133b1f3be5e","resolution":{"observed_at":"2026-08-05T05:50:18.325583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T05:50:17.658718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.658718Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:105336688ffd262ea8c4987fe434f72cff516930d491e1000f6e4afd9be3067d","observation_id":"4b766f44-b95b-4d07-87df-f4552eaff303","resolution":{"observed_at":"2026-08-05T05:50:17.658718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.307137Z","title":null,"venue":null,"work_id":"d6bff203-7167-41e1-83cc-d69c2086c4d4","year":2021},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.664093Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:0c5fd005fef9c34b60d212dce2f14694834a3e8c4b08c872c9ac2dbbcf0feb89","observation_id":"17ed6f0b-e814-4182-b78b-2bb016ad8d92","resolution":{"observed_at":"2026-08-05T05:50:18.311338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.293120Z","title":null,"venue":null,"work_id":"19d5a55c-75a6-4efb-8e80-81567f649300","year":2019},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.668943Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:8bb71998cb15cbf52ee0879a93a959e62ba73156a7fedb9ec303d7def61c85c6","observation_id":"24abc524-30d2-4a93-b5fd-f162697875f6","resolution":{"observed_at":"2026-08-05T05:50:18.297367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.277944Z","title":null,"venue":null,"work_id":"ee9669cf-ffaf-456f-b452-07fd8f6b4435","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.673895Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:467eef074e150bffdbdf5955179f6a3bded4713fa0afb1640d362aa4efa328e4","observation_id":"b7494c12-2a84-418d-92fb-3603cd230f03","resolution":{"observed_at":"2026-08-05T05:50:18.283544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-05T05:50:17.678651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.678651Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:1c078dcf650f77e8fca36a4c3080da4e189e86a3b482c71185f32f8fbb57e0f5","observation_id":"18a912f6-1e23-49fe-8f26-677563723251","resolution":{"observed_at":"2026-08-05T05:50:17.678651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.264301Z","title":null,"venue":null,"work_id":"39619b08-bc4c-4b9c-91da-bf434abb0c22","year":2022},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.684187Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:cd11d76170f35f877dc4805332c58e87629918535d7ca1949dc5e9768b5fc767","observation_id":"7da1f194-15b0-4b70-b537-2d88fe5436de","resolution":{"observed_at":"2026-08-05T05:50:18.268582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.250297Z","title":null,"venue":null,"work_id":"00e1a9a4-21d1-4b7d-a4f0-74510eb9b28a","year":2020},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.688905Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:a56ebd26a835ed650b32d2efee0ad26773b6f5f2c9c7258ea0dcf2c0f54ed8e4","observation_id":"104718a5-30aa-4099-98b6-1dcbbc970e99","resolution":{"observed_at":"2026-08-05T05:50:18.254648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.235722Z","title":"Stilwell","venue":null,"work_id":"dd897256-980c-4028-b250-5eb87e6b8503","year":2007},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.693279Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:7a0bf6139ce6c4163fcf3070f4956fc0bc036166ea32473e0d8562148ef8ad9a","observation_id":"99e60a90-e50d-4f49-8c2b-09ca4e1d6b7e","resolution":{"observed_at":"2026-08-05T05:50:18.240302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.221488Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"455aa702-99bd-4a51-a635-a245b3649cff","year":2017},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.697683Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:95ca3cc51c403b7f24912b258fc4c02c06f6b4c30999d12bb48e0e71ae2e2b34","observation_id":"105322e9-47c3-4fe6-a387-86a7f29ce25e","resolution":{"observed_at":"2026-08-05T05:50:18.226263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-12T22:40:48.038088Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":"2409.13689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-05T05:50:17.804576Z","title":"Temporally Aligned Audio for Video with Autoregression","venue":"cs.CV","work_id":"77f792bd-3ccf-4add-93d8-381a810ac0bf","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.701833Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:92f353d25597cb80b05a298d0916cae29e1c1e9cc05121c3844cbe175696a8f3","observation_id":"0fdf94d3-d15b-4f2c-90d6-0d5ded89b42b","resolution":{"observed_at":"2026-08-05T05:50:17.811973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.205685Z","title":null,"venue":null,"work_id":"af08d388-9b34-4e18-abf7-3a456090f566","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.706257Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5bfdd216d283a1bf45145364ed119c77fccd348b3b204d8858959a4f669bfadd","observation_id":"a01090d7-0673-45c0-9e59-9b88d94a7785","resolution":{"observed_at":"2026-08-05T05:50:18.210766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.190696Z","title":null,"venue":null,"work_id":"c31f0f07-b8e7-47a0-bc20-1ee83f6e201c","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.710751Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:3cb28486b6ac5dcfb5a14c450604123f7704bae6e96c0817b6176ac11459b201","observation_id":"91c118c5-e7c3-42f4-b2af-1d7d9026b95d","resolution":{"observed_at":"2026-08-05T05:50:18.195399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.175749Z","title":null,"venue":null,"work_id":"c128e823-e4e5-4245-83d9-eaee5778f53b","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.715111Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:9965da73f3772f90652a6f1b6f0612cb0bdea21ea7cafd29dbdf2da40d44c5c2","observation_id":"9719fa83-b505-4803-b709-146fe5f4a38a","resolution":{"observed_at":"2026-08-05T05:50:18.180556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.160715Z","title":null,"venue":null,"work_id":"8c4c8a79-a058-4098-acb1-76bc21e31019","year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.720146Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:315752c431061501f8399397f8a4a0b06a9d262ea1daa56545b9b04df23df6e6","observation_id":"f64d7a23-799d-4b28-95d8-91d5f431c613","resolution":{"observed_at":"2026-08-05T05:50:18.165361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:50:18.145744Z","title":null,"venue":null,"work_id":"6632d242-52d5-458f-a6c6-6ec5f09cc57d","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.724549Z"},"links":{"citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:adae4a4dc63395e893baec6f583a63185c302f19561b24241eafd1fc64eb8bd1","observation_id":"27c7109f-22b1-4a40-9825-173789221db5","resolution":{"observed_at":"2026-08-05T05:50:18.150775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-05T05:50:17.728841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.728841Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:3195eeac24a673ed5d0bdd93bad207bddd6388b5b4a11ad7c8c53a981f1f2425","observation_id":"74f1ff39-134b-41a1-b0fa-820359ac3e42","resolution":{"observed_at":"2026-08-05T05:50:17.728841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T05:50:17.733574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.733574Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:3e43ae2efb6071fd2c1fd10c6a7edaa5e4fb342b8191d4ff3aa8cf3767abd67b","observation_id":"a6f882af-01b9-441a-9d80-225faee1280e","resolution":{"observed_at":"2026-08-05T05:50:17.733574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2509.04957."}