{"as_of":"2026-08-15T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87304d0a5032f34ad1ff35a802bba84809d3e049c57dce890b5dce69ee388ab9","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:05:35.917596Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03955/citation-record","integrity":"/paper/2508.03955/integrity","json":"/paper/2508.03955/citation-record.json","paper":"/paper/2508.03955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.136615Z","title":"https://github.com/christophschuhmann/ improved-aesthetic-predictor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.136615Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:39bef9e4ab2551f82bbcb2916ad973f739e03237663f11269086f08cf879f44f","observation_id":"5d719a9f-9e62-48ad-97de-b8b6cd1a26b8","resolution":{"observed_at":"2026-08-06T01:05:27.136615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.225858Z","title":"https://support.apple.com/en-us/106375","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.225858Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:0ab5d474b2d16dc089710e85f241b22aef99342d0830384b9861b9b6be3c7513","observation_id":"d63fd00c-4707-4692-8e33-3122bd07ac21","resolution":{"observed_at":"2026-08-06T01:05:27.225858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.384081Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.384081Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f6516cbce414bcadc1172f0e72ab334d09aca2187102f446ace8a00f7a3f1cea","observation_id":"abb331fb-0168-4e4d-9ff8-dbb35b650f8a","resolution":{"observed_at":"2026-08-06T01:05:27.384081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.520336Z","title":"In: Advances in Neural Information Processing Systems (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.520336Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:b9114e649a03820f42ae827c5eaa668b284822628c055e150fa43da7223fdafa","observation_id":"7415328c-f63f-4b67-bc93-90706d52241d","resolution":{"observed_at":"2026-08-06T01:05:27.520336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.666667Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.666667Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:4588a64879090319c4e73babcf3975db6fb28d4f3b0be8fd8ff0944be1f65ca8","observation_id":"7b59ad32-4243-4bad-aade-e27050a56810","resolution":{"observed_at":"2026-08-06T01:05:27.666667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:27.836304Z","title":"In: IEEE International Conference on Computer Vision (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:27.836304Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:ccd594b8ca57d9e1a0fb0a743d7201f3238d9d4b58b63fa391ca0b22eab38db1","observation_id":"6b433556-13f5-44c8-b738-58e47f1b948b","resolution":{"observed_at":"2026-08-06T01:05:27.836304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.02249","last_updated":"2019-10-23T18:47:34Z","snapshot_observed_at":"2026-08-15T05:14:44.745295Z","submitted_at":"2019-05-06T19:56:03Z","title":"MixMatch: A Holistic Approach to Semi-Supervised Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.02249","snapshot_observed_at":"2026-08-06T01:05:28.029354Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.029354Z"},"links":{"cited_paper":"/paper/1905.02249","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:187d6885fe509c14a1b930a36615d2bc8aaf2a2eac1e9462475f9dbb2a1983b2","observation_id":"15cdbc39-b648-465a-a5b7-728130517de9","resolution":{"observed_at":"2026-08-06T01:05:28.029354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:28.149320Z","title":"https://www.scenedetect.com/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.149320Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:93ce21e9db9d5abf44ec8caf05b082acff3e5f4ac67ced16b467a31072b78651","observation_id":"97f15368-f12c-4c36-881c-2f588552a03c","resolution":{"observed_at":"2026-08-06T01:05:28.149320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:44.681995Z","title":null,"venue":null,"work_id":"0cd2ed27-bc1f-4513-9978-ae9131d17816","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.281083Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:b1fe8f591123d8f12e507c498a86a1b277dbde8a4b851b75c09819a9d2416349","observation_id":"fa9dd895-aeca-4097-8f11-1367aa0cda28","resolution":{"observed_at":"2026-08-06T01:05:44.775834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:44.490403Z","title":"In: Proceedings of the British Machine Vision Conference (BMVC) (2021)","venue":null,"work_id":"88838208-1258-4211-a94c-406f985f8326","year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.434683Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:1f9925be9008269b59d12bd0daec1c3cc4a2cfd0f3864547c1d091b8e0a7e8a5","observation_id":"2867cffa-fd8d-404a-8d82-f10a816f9e71","resolution":{"observed_at":"2026-08-06T01:05:44.579625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:44.307478Z","title":"In: ICASSP (2020)","venue":null,"work_id":"1e8ad0ab-ea33-480f-af75-fd15e9361308","year":2020},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.595648Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:0eb151350381d5f5458baa7d2401495027381c4b204a58d152fc5ed5954d5eba","observation_id":"1a5e8814-5f41-43ff-a17c-6926657f9a5b","resolution":{"observed_at":"2026-08-06T01:05:44.392710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:44.182744Z","title":"In: ICML (2023)","venue":null,"work_id":"084ef326-3bb7-4a51-8b6b-7f57959dfc2c","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.669434Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:a2b0d9e9c90d1798c4563dc5aacfdac965dc007008135f4ad77931bcc328738d","observation_id":"0baf7188-124c-4234-b5b5-fc254d514c84","resolution":{"observed_at":"2026-08-06T01:05:44.239266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-06T01:05:28.752385Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.752385Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f2cf3515dfac86979334665542c719d04ba44257c86b7365f940bb22dc8e8285","observation_id":"b54c2c89-f2fb-4e31-b912-ed097dea21a2","resolution":{"observed_at":"2026-08-06T01:05:28.752385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:44.022169Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"041a5f0c-c636-48bc-86d6-4a63d39b63fb","year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.832802Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:bae7f529b67faba86ad2b205e835b51aa04c0a696644b56a2669aaba4629b45f","observation_id":"4fe65e5c-7ba2-4f4d-af55-249980496220","resolution":{"observed_at":"2026-08-06T01:05:44.122724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-06T01:05:28.889837Z","title":"arXiv preprint arXiv:2003.04297 (2020)","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.889837Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:30817a9a6f2cfd4207fe61c3227885222794f3d47a57de861f61107d61ff5e5a","observation_id":"880ea0ba-4704-4af5-aae6-02681bfc4e57","resolution":{"observed_at":"2026-08-06T01:05:28.889837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:43.894126Z","title":null,"venue":null,"work_id":"98640829-57db-4612-afde-3e5f7785022d","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.927333Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:3ceccef3fba98b1b95a189cf997ba571c7e247477f6f24618eb15a8ff4eeb2da","observation_id":"b707ee55-9314-49b0-9fe0-24cdd0ded9af","resolution":{"observed_at":"2026-08-06T01:05:43.958779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:43.720829Z","title":"In: ACCV (2016)","venue":null,"work_id":"182991c9-d3ea-425b-9d9b-5505bd4149c8","year":2016},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.931187Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:7f5f011cfaf094c64dbf7f1da8f51745cb027df90682fc43b9fde8a2ff58c015","observation_id":"fd0b378c-8e1d-4f58-bc06-e097b7906e85","resolution":{"observed_at":"2026-08-06T01:05:43.811940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:43.558407Z","title":"In: ACCV Workshop (2016)","venue":null,"work_id":"14f543cc-5c08-4034-8a1a-8d7c8fc051be","year":2016},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:28.966918Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:3a79a818349d14372af84db4b52937063dbe3d90220cb5af6cbc7225634ab7bd","observation_id":"eae01fa8-8be9-4797-a350-fca5ae074cb4","resolution":{"observed_at":"2026-08-06T01:05:43.632205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:43.326733Z","title":"In: ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (2019)","venue":null,"work_id":"21eff6d3-442c-4075-8624-21807b6bf0f3","year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.051806Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:60d482ae8b71a0b94559be02674eb0997940767cb756b97fd992913dd2b3aa9b","observation_id":"55695a18-4a23-427b-9192-a840c41bf9f5","resolution":{"observed_at":"2026-08-06T01:05:43.439046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:29.119898Z","title":"org/abs/2401.11605","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.119898Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:2bdd637c3d8dd08586b07d9d3eb94f0df435829a39f34571d17bd22dcf093bb0","observation_id":"dc3a83e5-4e1a-4175-ba90-12ebafed7505","resolution":{"observed_at":"2026-08-06T01:05:29.119898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:43.143985Z","title":"In: ICASSP (2021)","venue":null,"work_id":"7aafdaf2-137d-438f-bb89-347024758eab","year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.189175Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:efbb5cef6e814bd28118acbd26109c647709e0ff17a13708e148e2a18da1728d","observation_id":"d2793f24-97a1-449a-aca2-8929c6a63a7f","resolution":{"observed_at":"2026-08-06T01:05:43.226562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:42.935858Z","title":"In: Proc","venue":null,"work_id":"4affe67e-d0bb-42f6-9c09-7b0af3e80a8e","year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.269749Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:7650ec21cdd96cd27a720f84b73e25fb281b3a6c160e6a8ed03c81bd3d4797e4","observation_id":"752d54c9-5c05-4584-9aca-dd7db0d859c7","resolution":{"observed_at":"2026-08-06T01:05:43.038644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:42.713449Z","title":"In: CVPR (2023) 10","venue":null,"work_id":"23b0799d-5ed8-45de-932f-dfaf96efad4d","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.335351Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:419d8998ccfcf7ad61d0fbf272e38b56ec46dd69e1755043550d9d9972fb10d6","observation_id":"b6399ec6-d1a6-4d48-b7c7-85c2ee1de34c","resolution":{"observed_at":"2026-08-06T01:05:42.834261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:42.466004Z","title":"In: Saul, L., Weiss, Y ., Bottou, L","venue":null,"work_id":"95065f3a-91d3-4ab2-833f-7fb567c0de9b","year":2004},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.438448Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:9d8232daab9a6de345938a3823d9ebb725cfadf181193b8c1e0ba65cb6075736","observation_id":"9a6f0dc9-6a9a-4167-b7a6-a6d0cb5a8f8b","resolution":{"observed_at":"2026-08-06T01:05:42.573930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T01:05:29.551747Z","title":"arXiv preprint arXiv:2501.00103 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.551747Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:b1e5f2cf5378132870a8b81f042d7c34fb981f4d0f3f42f87efbcae9348450f6","observation_id":"32d22cf5-47ed-417e-9619-6b77662b4085","resolution":{"observed_at":"2026-08-06T01:05:29.551747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-12T16:27:34.120981Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-06T01:05:29.710817Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.710817Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:ba6f22320bbdbf8618d15855adf5ad9605f2f0f72f0b4676f44e1c014fddbea1","observation_id":"58f3c006-d0f8-4c1e-b4b8-0120fde34584","resolution":{"observed_at":"2026-08-06T01:05:29.710817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-06T01:05:29.788077Z","title":"arXiv preprint arXiv:1911.05722 (2019)","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.788077Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:0c9c075d6db474ebe59771bc79a9cd14e26d67fc2c85598d2f7623e494cb3012","observation_id":"14ae10b5-f916-475f-94d6-4dfb6f048fef","resolution":{"observed_at":"2026-08-06T01:05:29.788077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:29.872863Z","title":"In: NeurIPS (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.872863Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:8a9ccebd6aca306e87ebe94e93967f975b5cff4dd2af058f0679da4658e28cc3","observation_id":"fef7ef36-ecbc-4d11-94c0-8c0b8d5849e9","resolution":{"observed_at":"2026-08-06T01:05:29.872863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T01:05:29.973287Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:29.973287Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:d123f7ff2ff0d0fadc012a8e61b3a49c80f56c607eeaa0de5d363126b0434d38","observation_id":"2bd68bc7-b4de-4ad1-a5cb-b662b0c502c2","resolution":{"observed_at":"2026-08-06T01:05:29.973287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:42.236953Z","title":"In: NeurIPS (2022)","venue":null,"work_id":"cf114b76-5599-4952-85aa-7ff334969e79","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.047742Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:a9111123399ccfce37d99492fdddf5a3de61b212d5a7d747c026fbe162c3c45c","observation_id":"ad2659b9-5b35-44a7-995c-2be4b049acf5","resolution":{"observed_at":"2026-08-06T01:05:42.343856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:41.905704Z","title":"In: British Machine Vision Conference (BMVC) (2022)","venue":null,"work_id":"84e23fa4-4acf-4a9a-b027-99eeb090026a","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.124308Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:9b528a500024290b37b0866d28fcb2ee95ee7210837402a6e64d665909e7d9de","observation_id":"8b18af95-29ea-4636-9dbb-d9c7963377aa","resolution":{"observed_at":"2026-08-06T01:05:42.070519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:41.609878Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"0c4cd15d-9f64-47d4-9e18-acde9c368060","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.235600Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:4450121c457d0d4d7a14f659f4bb06e5ee74e843b78cf91b8c96a1b8175ce376","observation_id":"3949828e-6c9d-46a2-a4a9-b83930d6693b","resolution":{"observed_at":"2026-08-06T01:05:41.733003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:41.325368Z","title":"In: ICCV (2023)","venue":null,"work_id":"3c9959eb-341b-4e0b-8544-3e24e9cf1ce6","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.351954Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:4760e0a0e6faaa7ab7f05ff517821cf66fc1c4f6f4c0e93cfddba01d7453e7a7","observation_id":"7726af29-70f1-43a6-925e-3c00be2c2341","resolution":{"observed_at":"2026-08-06T01:05:41.460861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:41.047896Z","title":"In: NAACL-HLT (2019)","venue":null,"work_id":"b6140f88-13f6-4aaa-b678-92ef86f82601","year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.467929Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:060b123bcdf6677aea9931ffb9011c3976ba8da1d6a78f6a3c71d9349b9c258a","observation_id":"da26e924-57a1-4be0-81ff-071ad41c0fc5","resolution":{"observed_at":"2026-08-06T01:05:41.135831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T01:05:30.547825Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.547825Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:0aafea8f746f8def4e7d2ca8ec469f141ee69ca582d9ccd58570d37f58ee64bf","observation_id":"ee2c53fd-2563-4904-b9a7-4bcde5fe32be","resolution":{"observed_at":"2026-08-06T01:05:30.547825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:40.896041Z","title":"semanticscholar.org/CorpusID:13874643","venue":null,"work_id":"73b549df-ad3e-469a-821f-a3aa7aac0466","year":2015},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.632579Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:e009ef5528dc4597ce113557f78b5f4c49b23c8f6456917b178c08b395bbf7a7","observation_id":"86a9e5c3-593d-42c2-b017-261cdfe346e5","resolution":{"observed_at":"2026-08-06T01:05:40.956168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T01:05:30.719678Z","title":"arXiv preprint arXiv:2412.03603 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.719678Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:202826ae2789fa47f5f8d347d65c464abdb43271e12d1f115ffe659d40183326","observation_id":"0f80e600-3f5d-4a22-829e-a1e6fe256ee4","resolution":{"observed_at":"2026-08-06T01:05:30.719678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:40.622901Z","title":"In: Advances in Neural Information Processing Systems (2018)","venue":null,"work_id":"51db2d63-d9f9-4d7a-bc4b-6132beda9a02","year":2018},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.810921Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:429d534e95f1b92e35d2e2fc3041aa461efa70563f33358516b14641fa45e8fc","observation_id":"d70f8052-6d93-4369-8641-3f6aecd0d3dd","resolution":{"observed_at":"2026-08-06T01:05:40.768895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02242","last_updated":"2017-03-15T14:22:41Z","snapshot_observed_at":"2026-08-14T21:36:15.005969Z","submitted_at":"2016-10-07T12:15:42Z","title":"Temporal Ensembling for Semi-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02242","snapshot_observed_at":"2026-08-06T01:05:30.875272Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.875272Z"},"links":{"cited_paper":"/paper/1610.02242","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:9fd1fee2ebc4111f0f802425b0f7498e06196fd1616690a011bff0adc38efcd0","observation_id":"9d12483f-c4f6-4693-bc2b-5cf02b5135d6","resolution":{"observed_at":"2026-08-06T01:05:30.875272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:40.442026Z","title":"In: ECCV (2022)","venue":null,"work_id":"6f325f66-8dd0-4824-bcc5-8f1f5bf5dfda","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:30.971992Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:6cef8384bee6833595df628fb41572983656d5eb32c7a97ef1be28ff52578764","observation_id":"4bde5aa6-a04e-4286-8580-c5037df2f09c","resolution":{"observed_at":"2026-08-06T01:05:40.538178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:40.066248Z","title":"In: CVPR Workshop on Content Generation (2023)","venue":null,"work_id":"4bf992e6-a27a-4b2e-82cb-6721658a1238","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.092701Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:51ef9ef4c672f14863fb82bdb23de8338751c14490e4574d534dba8a39b7245e","observation_id":"1b3b4366-35d6-4777-b5a9-b5ad2026dee3","resolution":{"observed_at":"2026-08-06T01:05:40.265136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.873779Z","title":"In: Proceedings of the 17th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval","venue":null,"work_id":"bb037da6-d9df-44a9-bf64-b8e7c13df3f0","year":1994},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.189229Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:3fd6268978ddd38ea9556065dc52557be3f8ff9471cb9bfe7b655ccaf5efe1a3","observation_id":"d0360d3e-7b4f-414d-9cee-23791d3c68dd","resolution":{"observed_at":"2026-08-06T01:05:39.971014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.759468Z","title":"In: ICCV (2021)","venue":null,"work_id":"ed9d4d59-9acb-4689-8881-3ac1513f76b8","year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.286093Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:feba056845c9acc2065b8fe71c1125e5508bd0c94f6cc8fab1a7488f125c5d48","observation_id":"b3d00f55-0645-411b-88ff-97c1318f0255","resolution":{"observed_at":"2026-08-06T01:05:39.812419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.669866Z","title":"In: CVPR (2023) 11","venue":null,"work_id":"327c7c47-4c5d-41e6-be56-35ff7f46c527","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.384770Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:19af70c5cb232cf4716e6b4dc31d59441459c1d780632e95154c82b563fee094","observation_id":"b9a11daf-d776-4d56-8697-e5c501071cde","resolution":{"observed_at":"2026-08-06T01:05:39.753488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.505361Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"f7e13e4c-dbbb-490e-ac90-6560f98654d9","year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.497182Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f84c78cb7b9675816683e460490242f02e144590e6f4abd401c15e2521365d6d","observation_id":"6fe99a49-a1f4-4711-aaa6-bb45122191a4","resolution":{"observed_at":"2026-08-06T01:05:39.565880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.320604Z","title":"In: NeurIPS (2023)","venue":null,"work_id":"2480722f-f144-42f1-b2b2-3e7e138bea42","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.630757Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f943f095ee3ccef22dfd21a5fadc2050e92bf5379fbba9ee4e7899a84bf25375","observation_id":"3567580b-ed0c-4356-8ab1-4a423fe7fe62","resolution":{"observed_at":"2026-08-06T01:05:39.407223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.149339Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing pp","venue":null,"work_id":"6c26f116-c3f4-4371-9385-1adf3c06970b","year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.722205Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:2b7d7f20a560b37ea9ebe4db8eccac131a8f1d7647faf935f6de1133b0a558be","observation_id":"6ef1650e-1432-4914-9a2b-87ce13ee4b86","resolution":{"observed_at":"2026-08-06T01:05:39.242389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-08-13T05:43:28.614772Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-06T01:05:31.824498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.824498Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:b3781acebb6316af9eca75d4a12cae7e4382085936b12c7528c00e7cb013cf0f","observation_id":"04185cf4-7215-41f2-b59d-041af852dd2b","resolution":{"observed_at":"2026-08-06T01:05:31.824498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:39.005956Z","title":"In: ArXiv (2024)","venue":null,"work_id":"a7462152-b031-454e-8f30-510f9eeb255e","year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.911508Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f485d16a5e4c6be900caec6a819ed6b1b11edffc30116c93a0a6b09189b3fee0","observation_id":"0a46f1b0-1ac1-4141-bcc8-74f74fe75731","resolution":{"observed_at":"2026-08-06T01:05:39.085713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:31.983486Z","title":"In: CVPR (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:31.983486Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:d5b8642a883d2b59514df37d993631ff2a2c042a6cc829927030cd1881272949","observation_id":"e524a815-0fd4-455d-bf5b-6600d00ef07d","resolution":{"observed_at":"2026-08-06T01:05:31.983486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:38.884169Z","title":"In: AAAI Conference on Artificial Intelligence (AAAI) (2022)","venue":null,"work_id":"3fd8b4f8-6213-401e-b71e-1e02a0460ee9","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.081645Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:9121d19f5ac6129b48a9c81946f62f2de5497dae0aab01a3712b75d527b8399e","observation_id":"ef5418d4-f000-46e9-b6b4-56a03def1f1a","resolution":{"observed_at":"2026-08-06T01:05:38.938424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T01:05:32.217703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.217703Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f66b57113e85d12edc973a9130cb1f275d2ee4e89f800942a523d5f3d20dce21","observation_id":"cb12e912-727d-402a-bdf0-3da2ef9a2a5e","resolution":{"observed_at":"2026-08-06T01:05:32.217703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:32.409118Z","title":"In: ICML (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.409118Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:93e078b398a968d964a3ea4727a86fdc1074c7c5eeed11f80dd9695645ea1568","observation_id":"31c87fc1-6a6a-4212-b144-e97fffe089a5","resolution":{"observed_at":"2026-08-06T01:05:32.409118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:32.566783Z","title":"In: CVPR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.566783Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:03727decfb54a2407a0359024576254bc9d86affe500d3c25bbcc74749d77a73","observation_id":"1b1e62c8-7ceb-483d-bd42-8ae278e52ab1","resolution":{"observed_at":"2026-08-06T01:05:32.566783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00489","last_updated":"2018-06-01T10:17:23Z","snapshot_observed_at":"2026-08-14T20:43:50.669164Z","submitted_at":"2017-08-01T19:50:53Z","title":"Active Learning for Convolutional Neural Networks: A Core-Set Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00489","snapshot_observed_at":"2026-08-06T01:05:32.703821Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.703821Z"},"links":{"cited_paper":"/paper/1708.00489","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:8b734d4c10ddc5185109832ce8a100741fcaa2c568617b0f4f2b517fc7fbf81b","observation_id":"36043aa5-1f98-4250-878f-9653866edc49","resolution":{"observed_at":"2026-08-06T01:05:32.703821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0385.13041","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:36.344075Z","title":"In: Proceedings of the Fifth Annual Workshop on Computational Learning Theory","venue":null,"work_id":"3c92b27c-3cd2-47ee-9e60-0b5c75ef6ee9","year":1992},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.911357Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:359623a58137d2df9d47bb7adebda2e5b820acdbda52635968a8c5dbd340ae04","observation_id":"58645583-4057-4df0-ae90-7ad715c995d5","resolution":{"observed_at":"2026-08-06T01:05:36.436588Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:38.678392Z","title":null,"venue":null,"work_id":"3b8d1048-9861-4e76-9da7-a60960d1ead3","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.056048Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:1743565e13a20a4e02af173cccb3d80292c5d94ab5be3f3bef065326fe43fb13","observation_id":"56a91ba8-7d80-4b65-a72a-a714611179dd","resolution":{"observed_at":"2026-08-06T01:05:38.791997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.05175","last_updated":"2017-06-19T22:48:54Z","snapshot_observed_at":"2026-08-14T21:11:45.359754Z","submitted_at":"2017-03-15T14:31:55Z","title":"Prototypical Networks for Few-shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.05175","snapshot_observed_at":"2026-08-06T01:05:33.157462Z","title":"org/abs/1703.05175","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.157462Z"},"links":{"cited_paper":"/paper/1703.05175","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:ef5a2f2b24c889cd4b88f902c0260c14998346bcbb207701ced25565ba8b1c73","observation_id":"a4b95e47-6a7d-4890-90e2-a1552574079b","resolution":{"observed_at":"2026-08-06T01:05:33.157462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07685","last_updated":"2020-11-25T17:22:06Z","snapshot_observed_at":"2026-08-14T21:14:19.444948Z","submitted_at":"2020-01-21T18:32:27Z","title":"FixMatch: Simplifying Semi-Supervised Learning with Consistency and Confidence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07685","snapshot_observed_at":"2026-08-06T01:05:33.259087Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.259087Z"},"links":{"cited_paper":"/paper/2001.07685","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:e4f01bb6c7c058a1a16e0e1b36fdf5fca16a37763b47845209b8b9ab75324a77","observation_id":"b1636644-22d8-4e04-89b3-013072baaced","resolution":{"observed_at":"2026-08-06T01:05:33.259087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:33.351617Z","title":"In: ICLR (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.351617Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:61f658353f0d1015b615995c59969b065ae5367e5d8effb8a48dda7d4c4d850a","observation_id":"a245b7e5-3072-461a-8a09-b2de84d8ce1e","resolution":{"observed_at":"2026-08-06T01:05:33.351617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06025","last_updated":"2018-03-27T10:55:50Z","snapshot_observed_at":"2026-08-14T20:13:02.450623Z","submitted_at":"2017-11-16T11:01:51Z","title":"Learning to Compare: Relation Network for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06025","snapshot_observed_at":"2026-08-06T01:05:33.421342Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.421342Z"},"links":{"cited_paper":"/paper/1711.06025","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:65c3801beb8fa5e4319075d0fe0d90e6e18f7badae9d0eca58fe860ee69bc08e","observation_id":"8272a54e-7cf3-4a3c-b509-3c7578aa1c9c","resolution":{"observed_at":"2026-08-06T01:05:33.421342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-12T17:19:10.028618Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-06T01:05:33.489220Z","title":"arXiv preprint arXiv:2411.15098 (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.489220Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:674b67f3688dfeb7ae6e634a865617ef38dc198cbafa310ccbc2a148cbd52fc4","observation_id":"3b447e74-cbfc-46be-8183-0fa277bee6e7","resolution":{"observed_at":"2026-08-06T01:05:33.489220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08280","last_updated":"2025-03-11T10:50:14Z","snapshot_observed_at":"2026-08-07T17:13:28.752920Z","submitted_at":"2025-03-11T10:50:14Z","title":"OminiControl2: Efficient Conditioning for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08280","snapshot_observed_at":"2026-08-06T01:05:33.601788Z","title":"arXiv preprint arXiv:2503.08280 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.601788Z"},"links":{"cited_paper":"/paper/2503.08280","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:72bc406d7dac354ead16e151d7d1658afed4aab1a790cf3a9952d6aadef7743c","observation_id":"7a7b561a-15ac-4e75-a4e5-585a75951f2e","resolution":{"observed_at":"2026-08-06T01:05:33.601788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:38.502925Z","title":"In: Thirty-seventh Conference on Neural Information Processing Systems (2023), https://openreview","venue":null,"work_id":"b0438ed3-73ab-49a9-b955-53489cffed64","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.696428Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:92a352001d10c0e3e099cf5af244e346fedc31cd5a665c0f6dc4c73de2c2cabd","observation_id":"72d9adb3-da96-4bed-9600-9b617f17ad7e","resolution":{"observed_at":"2026-08-06T01:05:38.562239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01780","last_updated":"2018-04-16T10:39:11Z","snapshot_observed_at":"2026-08-14T21:13:23.906801Z","submitted_at":"2017-03-06T09:34:56Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01780","snapshot_observed_at":"2026-08-06T01:05:33.793921Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.793921Z"},"links":{"cited_paper":"/paper/1703.01780","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:d41fc4bcfc13f7913e3ea0ff2999264773fe67afaae8fa06079723a180bcac3a","observation_id":"9c403138-6fc6-45d7-831b-24922f71a077","resolution":{"observed_at":"2026-08-06T01:05:33.793921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12039","last_updated":"2020-08-25T15:49:48Z","snapshot_observed_at":"2026-08-11T03:37:43.630214Z","submitted_at":"2020-03-26T17:12:42Z","title":"RAFT: Recurrent All-Pairs Field Transforms for Optical Flow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12039","snapshot_observed_at":"2026-08-06T01:05:33.915397Z","title":"org/abs/2003.12039","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:33.915397Z"},"links":{"cited_paper":"/paper/2003.12039","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:376a5290be7e0633f887c4b03703b4085bf36f3c67fd189b05218943e1157fa1","observation_id":"6bfabe26-9008-4931-8e1f-47593ba5fb8d","resolution":{"observed_at":"2026-08-06T01:05:33.915397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:38.359193Z","title":"In: Proceedings of the 20th International Society for Music Information Retrieval Conference, ISMIR 2019","venue":null,"work_id":"86eb5a53-c406-4f90-9200-2a4a9ff59482","year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.015855Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:766883ed3b4a9ec7ffd4eb20b6d2f8c1a26408b0061bfd84e51446f0b6d6077e","observation_id":"40b32384-3450-4442-895f-3a682810f488","resolution":{"observed_at":"2026-08-06T01:05:38.414209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:38.154743Z","title":"In: arXiv (2019)","venue":null,"work_id":"89ae8735-af5d-43ff-829a-a61feead2762","year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.109750Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:d5cd55d7da7a5cac33bab7e48e028aa8df0701816f1bcb0aaf7f9da0ade08b78","observation_id":"800ecd0c-e694-456a-89eb-8f102c630dab","resolution":{"observed_at":"2026-08-06T01:05:38.239129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.971427Z","title":"In: NeurIPS (2017)","venue":null,"work_id":"8a5c0d02-32d1-448c-bdd2-0753eea6ed1e","year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.184446Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:ea81064cb5819f40245f5e27c52a26a7b99d352a8427e6124cdce538a69262cd","observation_id":"b36e8119-1a12-4fba-ae37-32e82480345c","resolution":{"observed_at":"2026-08-06T01:05:38.066319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04080","last_updated":"2017-12-29T17:45:19Z","snapshot_observed_at":"2026-08-14T21:52:57.616273Z","submitted_at":"2016-06-13T19:34:22Z","title":"Matching Networks for One Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04080","snapshot_observed_at":"2026-08-06T01:05:34.279637Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.279637Z"},"links":{"cited_paper":"/paper/1606.04080","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:920691cb058c419ecfdd9de8014bcdabcdcee2a458ada83da8838fc9442654ec","observation_id":"10da2d4d-95b4-49a0-9bb9-2cc66058e1a6","resolution":{"observed_at":"2026-08-06T01:05:34.279637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T01:05:34.362680Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.362680Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:5b44a61191f087d851dd462fa398697dbc7a68d42a9d9ec17a439fc2a3f807cd","observation_id":"5413603a-a702-4966-a8ea-8f507feb3cc5","resolution":{"observed_at":"2026-08-06T01:05:34.362680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.802098Z","title":null,"venue":null,"work_id":"88e45f2d-4ebc-43a1-879d-7593f88fa9a9","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.461657Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:a4c981e776bc3cbdb51336593f80fb87f32f79722e532c909ed25abadfeb8cc6","observation_id":"4eb03d73-8e05-4477-b464-8b06c6ae25de","resolution":{"observed_at":"2026-08-06T01:05:37.901796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17599","last_updated":"2024-01-04T01:30:50Z","snapshot_observed_at":"2026-08-14T18:34:50.250668Z","submitted_at":"2023-03-30T17:59:25Z","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17599","snapshot_observed_at":"2026-08-06T01:05:34.552920Z","title":"arXiv preprint arXiv:2303.17599 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.552920Z"},"links":{"cited_paper":"/paper/2303.17599","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:0272c138591038e1895c4d99f0cfe6c007b83a3136f39e933c120d636b288232","observation_id":"13e3cecf-2b3d-4bbb-a5cc-ac70fab7e675","resolution":{"observed_at":"2026-08-06T01:05:34.552920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:34.635526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.635526Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:46bdb30feac380939e15f8933b19fa5460543488b2387eea8da37855f98525c7","observation_id":"d767d1ae-a772-4c14-8096-10abb39a4461","resolution":{"observed_at":"2026-08-06T01:05:34.635526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T01:05:34.727296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.727296Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:7796e734c9cbd909c7daf301f8ff7e854b2e36976307a3dd54e0167d8e06d7e3","observation_id":"e61e9f2e-3702-4292-8b84-2a4633fad0de","resolution":{"observed_at":"2026-08-06T01:05:34.727296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10769","last_updated":"2023-10-16T19:03:19Z","snapshot_observed_at":"2026-08-13T05:48:07.659985Z","submitted_at":"2023-10-16T19:03:19Z","title":"LAMP: Learn A Motion Pattern for Few-Shot-Based Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10769","snapshot_observed_at":"2026-08-06T01:05:34.794756Z","title":"arXiv preprint arXiv:2310.10769 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.794756Z"},"links":{"cited_paper":"/paper/2310.10769","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:bf90a4cd448dda2e7470f10b78fe67767eb2198bef080c445f8a80a7c921e750","observation_id":"72e33d7d-7413-4bdb-8ff7-98e850789fd6","resolution":{"observed_at":"2026-08-06T01:05:34.794756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-13T17:31:47.153109Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-06T01:05:34.862848Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.862848Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:8e36b8857c33e11ded26a356c49fe54bf8411a2240e1b60d302982eff0447bd0","observation_id":"6f119842-b305-4082-a2a1-3b1d854aeec2","resolution":{"observed_at":"2026-08-06T01:05:34.862848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-15T08:52:00.376969Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-06T01:05:34.947645Z","title":"arXiv preprint arXiv:2310.12190 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.947645Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:03320f13f9a529b158d084f8d89b2798b2f97d6d496bb220679838b24bf40bc2","observation_id":"728dd224-40ef-484d-8078-a15bc2e41a01","resolution":{"observed_at":"2026-08-06T01:05:34.947645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.653249Z","title":"In: International Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":null,"work_id":"bd16cb2a-58fa-442e-8dfa-4c8e74682098","year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.036742Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f43d28d1170debceda5c128e6c7d14e2ef22883ae5e091755a33c6e4a25bfd7a","observation_id":"3c999cdc-f876-4770-9c35-97fce7d4fdf2","resolution":{"observed_at":"2026-08-06T01:05:37.741020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.502432Z","title":null,"venue":null,"work_id":"669991d7-7007-4088-83f4-342579d0868d","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.130556Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:c3410788526157f0e4a726d56beb0805328505f886c8d3475ee3e4a833feb212","observation_id":"4f6a45bd-fbb4-431d-91f3-c4af9810a730","resolution":{"observed_at":"2026-08-06T01:05:37.565481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.310426Z","title":"In: ICLR (2023)","venue":null,"work_id":"cb55f58d-6836-4412-9406-2bc773c578f6","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.243508Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f0a8135e834a4ac5db8fb534e50fb62a18709dc85c3c5704cccd54ed28d3a5fc","observation_id":"f5c43f5d-c6eb-45c9-9a4f-712898ee1de3","resolution":{"observed_at":"2026-08-06T01:05:37.396653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:37.124168Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV) (2024) 13","venue":null,"work_id":"a9ae4708-c9e7-4dc0-b563-c74e327192db","year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.326441Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:9d1316fe79bd0091871e7eb56cc0efa0b5cb9f318c34eff01b440c71017c061e","observation_id":"39ee8d67-7239-4d91-8a57-e06a9acfe28e","resolution":{"observed_at":"2026-08-06T01:05:37.218150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:36.954845Z","title":"In: IEEE International Conference on Computer Vision (ICCV) (2023)","venue":null,"work_id":"0a7c85a3-403a-4b4c-a2b6-8d0a9f8ef94a","year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.446574Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:195a67bb7342e9ef16d15c4906a853b6264614ca786a298dc220ad2f144b8bce","observation_id":"214502c9-84f1-4544-ac4f-0fa375a89aa4","resolution":{"observed_at":"2026-08-06T01:05:37.061492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08465","last_updated":"2023-10-12T16:26:18Z","snapshot_observed_at":"2026-08-13T05:50:32.186302Z","submitted_at":"2023-10-12T16:26:18Z","title":"MotionDirector: Motion Customization of Text-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08465","snapshot_observed_at":"2026-08-06T01:05:35.593976Z","title":"arXiv preprint arXiv:2310.08465 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.593976Z"},"links":{"cited_paper":"/paper/2310.08465","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:e9f19c1d050996c44e817807fde52f49d1d1bf64064249b733d662f9cd1141f9","observation_id":"5e125525-d6ca-4c5c-86d6-2f5c5c13d20d","resolution":{"observed_at":"2026-08-06T01:05:35.593976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:36.825881Z","title":"In: AAAI Conference on Artificial Intelligence (AAAI) (2019)","venue":null,"work_id":"b79c6399-2060-4ef5-a5a5-5e6bcb97973a","year":2019},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.710531Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:76593ed8073e893c711ca3a4b8955a3ff48adaed4d8d8d3df945c9ed698b5dd6","observation_id":"94c144a5-5f6c-4011-9120-8084b4e50829","resolution":{"observed_at":"2026-08-06T01:05:36.889102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T01:05:36.694492Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","venue":null,"work_id":"5593a640-ab09-4b83-ac75-1fa54114c87a","year":2021},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.805882Z"},"links":{"citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:f1842c0e4db3767afd79f31a8180040c38084f87967e8654e4abc905947ae6b3","observation_id":"0170c676-226a-4648-8ce7-dd88d0c0b6d5","resolution":{"observed_at":"2026-08-06T01:05:36.754212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T01:05:35.917596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:35.917596Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:6163f92390d1433d1e85159d552f8e2cb993501039edccd3a953c8bcf64a71c0","observation_id":"144686f3-f196-490a-8d93-01c6f68b33e9","resolution":{"observed_at":"2026-08-06T01:05:35.917596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2508.03955."}