{"as_of":"2026-08-10T16:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4af1573459c41c7302c5165edb308d89e041be51b08298fdb065e73ea4ed246f","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:31:15.877382Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20627/citation-record","integrity":"/paper/2507.20627/integrity","json":"/paper/2507.20627/citation-record.json","paper":"/paper/2507.20627"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-06T13:31:09.594836Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.594836Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:9383e68c8309ad4c1d98ef2bb34bca8054828f0ebd562961bd8d9d7e91c9032f","observation_id":"50a8ccca-ab7d-4a8e-b595-35754c1a399f","resolution":{"observed_at":"2026-08-06T13:31:09.594836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T13:31:09.644755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.644755Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:cc5c8b31f43e9e7b0aca70297c389d6b0c2f109769b59377723562c8053350ec","observation_id":"0d64c2eb-cee3-43b4-a8af-a56e5325446f","resolution":{"observed_at":"2026-08-06T13:31:09.644755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.971140Z","title":null,"venue":null,"work_id":"ab41b17f-2007-4654-a643-4aa3dea8e88e","year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.682524Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1a4d8c7625243b7377106c3fde302d76f698e2b2e98fe1068c69ff93bcacdd6b","observation_id":"cf21a038-aa49-4002-858a-ec21d7fa3562","resolution":{"observed_at":"2026-08-06T13:31:29.103936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.724751Z","title":null,"venue":null,"work_id":"c4e5b29f-d308-44e2-8962-c52ebf073259","year":2016},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.734742Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:ea7f88ba8adc9ab6fef7528487af7792d37447f629e15cbe622e66c0aa822312","observation_id":"adaaca03-ad53-4b3b-9d52-2334bada7476","resolution":{"observed_at":"2026-08-06T13:31:28.771472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.464763Z","title":null,"venue":null,"work_id":"2d1eca6c-ed05-45cb-9b8b-467dcce53529","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.784830Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:0697b93134742176d277006c465e889499a726853092890b16de14e7e2a15fec","observation_id":"e1ea48b7-d993-44db-9214-e9c8120ed55d","resolution":{"observed_at":"2026-08-06T13:31:28.561902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:28.214843Z","title":null,"venue":null,"work_id":"a9f8fff1-46ed-46e9-b2a6-0cc4157ccb4d","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.824745Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1009f48336701daad11c13e14fac406dff2052ed0a587fe9318b99e9180d8ee6","observation_id":"42b5f16a-e52c-4f1b-8559-19e4bf028450","resolution":{"observed_at":"2026-08-06T13:31:28.277866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.984748Z","title":null,"venue":null,"work_id":"0dea0e54-dcf2-4bf4-a487-23962da0b12c","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.884851Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:94023d68874ccf1ff625928be6ba2aae608bd15e9e3b9c5a8e0899f2f64e1ac6","observation_id":"59d179fc-1983-443a-b2fd-82bb0b6aa8e8","resolution":{"observed_at":"2026-08-06T13:31:28.134534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.712651Z","title":null,"venue":null,"work_id":"a63534fe-356d-4319-aaaa-dd84a9eb6903","year":2019},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.944740Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:2376ef726d8c2d55ec50ef03ed0af8eab4380e2596a58d97790db16e26ee04e5","observation_id":"bc688ee9-ee26-4633-af41-1ef2619a0985","resolution":{"observed_at":"2026-08-06T13:31:27.805295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:27.319329Z","title":null,"venue":null,"work_id":"e626e93f-b44e-4eec-a5e5-917deda33577","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:09.995041Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:f8db73e4bf9db0194c4e5c771093b5676c0ad87dd711edc87a9c2ff1effd5182","observation_id":"25393314-7b92-4192-9c71-555b8b57b618","resolution":{"observed_at":"2026-08-06T13:31:27.495146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.954841Z","title":null,"venue":null,"work_id":"4590f7c4-ae08-42fe-ab00-824ba5bbcb57","year":2009},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.044753Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:2976d012a10c6df5d5c3f3aa6006401fea3da373d9140abd351f558d21e07b78","observation_id":"36d708d8-fc83-4d8b-8a8a-aac212e81931","resolution":{"observed_at":"2026-08-06T13:31:27.059741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T13:31:10.094748Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.094748Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:ebdcd89f3ce0298784f1b7dcfae576d31a4356cbd17bca4d7718a6c167934c6d","observation_id":"9e36dfe1-2ebc-4765-ae8d-0e9e4c5c7bc0","resolution":{"observed_at":"2026-08-06T13:31:10.094748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.644747Z","title":null,"venue":null,"work_id":"c3288610-985a-4e8d-820b-ace177f5f4e0","year":2021},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.144749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6861a084f9fbaaa59a5e575ed65b46c31a80ef4d7f98a1807c1cfdce0c11ed36","observation_id":"fc20ac14-8671-42bb-8e3f-b80d611dbfce","resolution":{"observed_at":"2026-08-06T13:31:26.764745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:26.264913Z","title":null,"venue":null,"work_id":"c8edea44-5212-4a42-83cc-288d7de615bd","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.194749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:01a08620d360618f1dff4410f28b3b8f82247793018a2d3ca926136c23b8e901","observation_id":"eca0b752-2071-432d-a5e6-f9086a21055d","resolution":{"observed_at":"2026-08-06T13:31:26.430944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.919494Z","title":null,"venue":null,"work_id":"e0ab7507-be89-4427-bef0-9accc71a9926","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.254758Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b33ae6f8ad6608e867851a0eb0d80100c989e3ca3f1253902bc675a1aa196317","observation_id":"41237e2c-c97e-4480-b283-fc5b1657f422","resolution":{"observed_at":"2026-08-06T13:31:26.075802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.304754Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.304754Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:999931ba9b73279756888adce8599b58f1c5cf3830cb678933bba0f2622fa511","observation_id":"4f4d9030-6339-4f37-a94d-dcf583f7e0ae","resolution":{"observed_at":"2026-08-06T13:31:10.304754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.604680Z","title":null,"venue":null,"work_id":"4c026759-27ad-4b71-807d-e9132945cc97","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.343135Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:f002201227d451c0ad46c2c23a4b1361048a35eb5d8e0b6752577f94baffa0d2","observation_id":"0fd85f8e-8465-4e2f-97be-fd03bc26c7c6","resolution":{"observed_at":"2026-08-06T13:31:25.686144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.349095Z","title":null,"venue":null,"work_id":"1a2e33e1-29fa-4e0c-b366-1ccf1103b6f1","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.414752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:0d68c4bb55831348631c5c44ba56a27b65c125676676bb7d732d2280329834f3","observation_id":"08bb5222-5302-4189-83ad-c54a676d110b","resolution":{"observed_at":"2026-08-06T13:31:25.454749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:25.114774Z","title":null,"venue":null,"work_id":"075c4cb9-d907-4c26-8530-96566345f609","year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.464837Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:35f23b1e7a44d1f8dd18ab62fd0d20b599b0db51e93ef8617e9589797bee88b1","observation_id":"20daa7b9-6d47-4c8f-8e30-c534cdc8ab20","resolution":{"observed_at":"2026-08-06T13:31:25.193454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.524754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.524754Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:1360ed1b74a25e7da652b7a795f2a9537b13db7ab24d61d02eeafe9f68d8332c","observation_id":"9c81f4d7-ae80-4c22-b572-84c06cbf8a0e","resolution":{"observed_at":"2026-08-06T13:31:10.524754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.884756Z","title":null,"venue":null,"work_id":"0f73314b-1fc9-44d0-be66-f707fb81a71d","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.574747Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:cf03fddc48bff6a16fd76a150994192782cabe754e8c23030e5025f843b81274","observation_id":"411b26f5-8943-457c-877b-10dfc4cfc111","resolution":{"observed_at":"2026-08-06T13:31:25.013940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T13:31:10.654753Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.654753Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:c27450c0bd9bf7d38d90df350520254951eabb2cd721b2bf21bd9bddbb25c60c","observation_id":"7321d4b3-ac83-4834-860b-9831bd6725e7","resolution":{"observed_at":"2026-08-06T13:31:10.654753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:10.714769Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.714769Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:eea7d6974fce101a23b14cdee59338c8848ae1d16a6fc414b8ac3f8d21ce505c","observation_id":"b2f42de8-e8a2-4ea4-9f61-669641f4f390","resolution":{"observed_at":"2026-08-06T13:31:10.714769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.424770Z","title":null,"venue":null,"work_id":"6eb12ef5-f337-4ba2-993e-08727c17edaf","year":2015},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.763908Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:83d210b545900119ee8e52218315083803b457980424e015c5a78b178b5a3f34","observation_id":"cedab653-cea7-4ad5-abb0-8dbe1fcaf414","resolution":{"observed_at":"2026-08-06T13:31:24.510267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15060","last_updated":"2024-07-21T05:27:53Z","snapshot_observed_at":"2026-08-10T14:08:58.378463Z","submitted_at":"2024-07-21T05:27:53Z","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15060","snapshot_observed_at":"2026-08-06T13:31:10.834751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.834751Z"},"links":{"cited_paper":"/paper/2407.15060","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:299b5ea6189b418d53de4e12f399f9299d4f29a5d029a13d1d1931fbc9731702","observation_id":"09781b71-b120-4f52-8a6a-e45d94bd576c","resolution":{"observed_at":"2026-08-06T13:31:10.834751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07674","last_updated":"2025-03-10T03:30:55Z","snapshot_observed_at":"2026-08-07T17:18:07.972907Z","submitted_at":"2025-03-10T03:30:55Z","title":"TVNet: A Novel Time Series Analysis Method Based on Dynamic Convolution and 3D-Variation","version":1},"cited_work":{"arxiv_id":"2503.07674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07674","snapshot_observed_at":"2026-08-06T13:31:17.505096Z","title":"TVNet: A Novel Time Series Analysis Method Based on Dynamic Convolution and 3D-Variation","venue":"cs.LG","work_id":"fd302602-0944-4d27-a959-6f448a0b32ac","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:10.964752Z"},"links":{"cited_paper":"/paper/2503.07674","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:c7361e9d23c9503c5ecac99c2b7b5e7499138cba05716188617ca27eaaf8848a","observation_id":"4666f6b3-0360-41cb-97c8-cc5004d07115","resolution":{"observed_at":"2026-08-06T13:31:17.676029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:24.025765Z","title":null,"venue":null,"work_id":"cfbaf8b8-eb96-4c9f-b0ff-2c8f851dceca","year":null},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.164763Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:24857e82b51524e9096bcc9165b502692d91903878cc1e5b559bdbdf64115cc4","observation_id":"cf37bb44-a4e5-4807-a087-2789161cf54b","resolution":{"observed_at":"2026-08-06T13:31:24.184748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.810110Z","title":null,"venue":null,"work_id":"29049890-8aaf-4ebf-a0cf-3b0bc4620298","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.548557Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:317450e61b726c7b9ed1ecf46bf5b87747cf05cddb10ba66900bb832e8a6054d","observation_id":"fada53b0-1ac8-463c-88ef-a5e836b19338","resolution":{"observed_at":"2026-08-06T13:31:23.884754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06296","last_updated":"2024-12-09T08:40:10Z","snapshot_observed_at":"2026-08-01T15:37:54.932804Z","submitted_at":"2024-12-09T08:40:10Z","title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","version":1},"cited_work":{"arxiv_id":"2412.06296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06296","snapshot_observed_at":"2026-08-06T13:31:17.167933Z","title":"VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features","venue":"cs.SD","work_id":"abed0374-2b20-4e2d-b74c-96992a9a2fa0","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.694752Z"},"links":{"cited_paper":"/paper/2412.06296","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:03378692151bace13b2b036a468bb0c3c16d64b16ca39851d1842b82284fb41f","observation_id":"307c7773-b5bc-4cc0-9a3b-d2cb44054f48","resolution":{"observed_at":"2026-08-06T13:31:17.313299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.583068Z","title":null,"venue":null,"work_id":"b170180c-d1bb-40e0-8336-8c6d7fa89c61","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.824752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:bb6188ec50fe1e0e4389621378fe0c6c99ccb03d81425d85cbc68b3c0188e9fd","observation_id":"e368d43f-6a09-47b8-b896-ffda2e51463f","resolution":{"observed_at":"2026-08-06T13:31:23.663726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07450","last_updated":"2024-09-11T17:56:48Z","snapshot_observed_at":"2026-07-06T19:13:55.363649Z","submitted_at":"2024-09-11T17:56:48Z","title":"VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07450","snapshot_observed_at":"2026-08-06T13:31:11.984761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.984761Z"},"links":{"cited_paper":"/paper/2409.07450","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:a3757189d6c318603d2611700283c102eeb2e254d604ca8825fac0c6a51eb16d","observation_id":"a9a6679b-1c10-40a5-951a-300cf4e957b5","resolution":{"observed_at":"2026-08-06T13:31:11.984761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-07-06T16:49:33.776407Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-06T13:31:12.134837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.134837Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6e590dd712cf40dd33328658c87c6ac60feb22fc88ae6040fd49ee86dd3193ca","observation_id":"1f26ac52-abd5-4bb1-9adc-3a21d04b7115","resolution":{"observed_at":"2026-08-06T13:31:12.134837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.291014Z","title":null,"venue":null,"work_id":"5559680b-39d0-4428-9930-215b0a4e5d84","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.254746Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:879bcff1eb3d6946099beea17abbc52e0d57621fb23868eadd6cfa52f6ffff10","observation_id":"7bc6798d-0256-4778-81a6-16bb1ac55eb9","resolution":{"observed_at":"2026-08-06T13:31:23.460845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-06T13:31:12.444751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.444751Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:8f3741291c3fd0a37871e90f0f4f79f32a3967abecf8a2a8ed6e58a6cd8b21bd","observation_id":"96a2debe-1a19-49b5-b9b0-f38a10d7574e","resolution":{"observed_at":"2026-08-06T13:31:12.444751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:23.055726Z","title":null,"venue":null,"work_id":"df9ecca3-0523-46b9-86c3-89eaa5308772","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.584749Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:d6a37840f1ec175163775ea7cce0d21e9815ce5a55b946f8d511fb529c3f45c0","observation_id":"bdbbdedb-aa69-4eea-a382-764b21ae2964","resolution":{"observed_at":"2026-08-06T13:31:23.181364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:12.714746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.714746Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:279aa6c8d337f59efeac9e4e6c53bfde016c18bfecdd65050a6a6b7712445832","observation_id":"1163c1bf-85d0-4b3b-8c86-af8826b7f75f","resolution":{"observed_at":"2026-08-06T13:31:12.714746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:22.544172Z","title":null,"venue":null,"work_id":"82040616-66db-451f-98aa-a0fe6b67d188","year":2014},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.804394Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:c3e27420a6b32ad7d9e08b07a13e04d867e7349a9437e6e78aaecc157df22e54","observation_id":"098dadb1-c5ce-4a30-954e-2b2793cab6a6","resolution":{"observed_at":"2026-08-06T13:31:22.734752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12563","last_updated":"2024-07-30T09:44:09Z","snapshot_observed_at":"2026-08-06T07:00:18.363594Z","submitted_at":"2024-07-17T13:47:17Z","title":"Audio Conditioning for Music Generation via Discrete Bottleneck Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12563","snapshot_observed_at":"2026-08-06T13:31:12.936145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:12.936145Z"},"links":{"cited_paper":"/paper/2407.12563","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:03b5d41f3545f7302949053bafba81ff65ae441b47b3c363a80e195b4a502a3b","observation_id":"0b578196-a503-4a14-9c5f-9cea4eb10f9e","resolution":{"observed_at":"2026-08-06T13:31:12.936145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:22.237024Z","title":null,"venue":null,"work_id":"70f3e9f3-33ec-4b1d-a6ed-c2e6022e5f47","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.043146Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:c775cb3b7f50315bcdfcc12bd3697e2d7ae723a89e110554753864b86be046b0","observation_id":"f2b9779e-e847-401d-b822-88c8bfa616b5","resolution":{"observed_at":"2026-08-06T13:31:22.324750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:13.204743Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.204743Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:37d3f2f18b7043ae18c4690f48e21445d21165556ca13561e3a62670166567f1","observation_id":"5847cef5-d2f6-41c8-8bc1-45a2ae556c1e","resolution":{"observed_at":"2026-08-06T13:31:13.204743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.814647Z","title":null,"venue":null,"work_id":"b809b2fc-3dc8-4b19-bbd9-9d5ab0809988","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.315774Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:d0fd852c197a5b6eaa0580a33e94cdf06c18781327466f3a5972f6aad672562b","observation_id":"d7f0e449-40ea-4cfb-9429-c25d112d2dc2","resolution":{"observed_at":"2026-08-06T13:31:21.975006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03478","last_updated":"2020-12-07T06:54:10Z","snapshot_observed_at":"2026-08-08T13:30:15.026405Z","submitted_at":"2020-12-07T06:54:10Z","title":"Multi-Instrumentalist Net: Unsupervised Generation of Music from Body Movements","version":1},"cited_work":{"arxiv_id":"2012.03478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03478","snapshot_observed_at":"2026-08-06T13:31:16.334863Z","title":"Multi-Instrumentalist Net: Unsupervised Generation of Music from Body Movements","venue":"cs.SD","work_id":"8af94fba-b73f-4235-8c68-1bf3a9269957","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.454309Z"},"links":{"cited_paper":"/paper/2012.03478","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:e2f65f8df940c7419305976b73e115d6c4d172edba7231e2754c72684ca9174e","observation_id":"b312366f-bc89-470a-b2fe-9179c8ed0cfe","resolution":{"observed_at":"2026-08-06T13:31:16.476702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04321","last_updated":"2025-05-07T15:59:51Z","snapshot_observed_at":"2026-08-08T22:58:13.365481Z","submitted_at":"2024-06-06T17:58:11Z","title":"VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04321","snapshot_observed_at":"2026-08-06T13:31:13.546156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.546156Z"},"links":{"cited_paper":"/paper/2406.04321","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:47f6d2737a2e083a5cc3bdbb8fcfa7759cf9d55c6ec280b257494d545bdd4ab4","observation_id":"7ddbb19c-5d4a-4b51-af85-9cd9dbd4a62e","resolution":{"observed_at":"2026-08-06T13:31:13.546156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:13.683006Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.683006Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:565fd56e78e0ac2a677f5416bdad291302e155eddefb9a2146f6b247f07e006a","observation_id":"765d0d1f-a737-4c32-9fb7-c8f9a579cf9b","resolution":{"observed_at":"2026-08-06T13:31:13.683006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.394766Z","title":null,"venue":null,"work_id":"eea82c64-3763-437b-8df6-403ca15f0ef3","year":2020},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:13.976066Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:75631cc3170428e0d16095c98bd2449d2de90e06c9a66d3673c23bb70be2aaf4","observation_id":"4350494e-071a-4d12-9830-ae1370eb45bf","resolution":{"observed_at":"2026-08-06T13:31:21.524443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:21.178647Z","title":null,"venue":null,"work_id":"971a2cb5-8994-40f6-a06e-bae2d967d0d9","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.101294Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:11826d81bd16d9fb97b2cf1137bbcb085ac92aed83221814ed50e5013b8a5a80","observation_id":"f5792cba-75b0-4f1a-8a0b-d42dbdd3dc68","resolution":{"observed_at":"2026-08-06T13:31:21.277512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.897788Z","title":null,"venue":null,"work_id":"d37c3edb-f86a-4fea-8582-9d076e082c89","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.262983Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:dae32796a856948c70bc5d5b92a904e514357412ca118395cc1b3b2261926e7b","observation_id":"24e46f06-4091-4fe9-a704-691d0f600eb7","resolution":{"observed_at":"2026-08-06T13:31:21.064754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.554750Z","title":null,"venue":null,"work_id":"79014024-58ff-445c-b2ca-a1729c8c214b","year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.384752Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:933999fddcec81ae9a827dbb6e50944d340302004c17101a8a6eaa2ff25d9968","observation_id":"6d12b699-e03b-428c-b768-1935218270f4","resolution":{"observed_at":"2026-08-06T13:31:20.667105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.304742Z","title":null,"venue":null,"work_id":"d71f2142-3732-465a-b3f2-bdf30804b398","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.484865Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:f98c1f2dc8c39161b0c099ff404cc39bf7072841f2c1ebbcc275545dd3ec2d55","observation_id":"923dc8ce-bde2-42aa-b084-b425dead1057","resolution":{"observed_at":"2026-08-06T13:31:20.417611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:20.076226Z","title":null,"venue":null,"work_id":"94d16e61-c4f4-4dc5-8e7d-452e65fee2f4","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.674753Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:ebd5af5fe425e24423fdce157c05c250255fc037223e513a17cc13671595bb3e","observation_id":"64c2885d-a07c-4c86-9e42-163d706026ed","resolution":{"observed_at":"2026-08-06T13:31:20.134807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.788533Z","title":null,"venue":null,"work_id":"14443f8d-134c-412b-a2f8-511e72f5b677","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:14.872875Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:f6a9640980365e7af518094ae48ed546ed8d3595a3479ad4d4066fe0ccf20f39","observation_id":"abfd928d-26b0-4b57-9ad5-318dbf747c82","resolution":{"observed_at":"2026-08-06T13:31:19.931114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.392928Z","title":null,"venue":null,"work_id":"5af6c112-a684-4382-8de7-5b4410aac446","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.064107Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:228e800c1253eec76257bc40cc2390e3a85e49778572e0e1f412b37a60165c1e","observation_id":"da89b970-7cfe-4a4d-997a-decb600d8280","resolution":{"observed_at":"2026-08-06T13:31:19.586700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:15.267845Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.267845Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6f3ebffc8e2df2d3741433f46fb1f8e5c3b4b4ce2004916fcf8ff8e68fbba510","observation_id":"c35b3feb-0e55-4a8c-9fec-1e2535dbaa1a","resolution":{"observed_at":"2026-08-06T13:31:15.267845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:19.035836Z","title":null,"venue":null,"work_id":"08515fe2-058c-442d-9150-4bacda242bb2","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.479723Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:43580f2e631545b9d1ed66c8b13ae20d4fa1a8457d506221f0b3b30b2c072e62","observation_id":"76fe97e4-5fa1-4b50-9cd3-422060b6ae5c","resolution":{"observed_at":"2026-08-06T13:31:19.177842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.784774Z","title":null,"venue":null,"work_id":"61165dec-d87c-40bc-aa8f-2660136ac7b8","year":2022},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.591214Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:b19f7894acc0341a4b9bee07ad31f28bdb3514ec22613ef364995dfdc083a2d7","observation_id":"f80f374f-554f-46db-b81c-bd6c7f992cb6","resolution":{"observed_at":"2026-08-06T13:31:18.875328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.559141Z","title":null,"venue":null,"work_id":"69db734a-4a28-4b9b-ad1d-51e92f26736a","year":2023},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.749347Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:183a1aa2b545c22ec9b3ef138be1d257c516f41adb40ad5b5265e530ca28ec65","observation_id":"49a9a8de-dafa-48c4-9402-eabe254b2b5f","resolution":{"observed_at":"2026-08-06T13:31:18.626356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:31:18.394787Z","title":"rhythm presets","venue":null,"work_id":"248123c5-5075-4fc2-8b3d-f779aba24132","year":2025},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:15.877382Z"},"links":{"citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:6397936d96ccdaa3481849f4ec4095464b080a8f0a05586874c3e8bd6d160649","observation_id":"53de3b0b-5939-4cbd-8a45-f297a4f41c9d","resolution":{"observed_at":"2026-08-06T13:31:18.494815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-06T13:31:11.375359Z","title":"arXiv preprint arXiv:2410.12957 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T13:31:11.375359Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2507.20627"},"observation_digest":"sha256:26150fb222a56f3409e5f9470b6ac74845d00d0b3ad5f993bf8eb3f43451a4b0","observation_id":"b1c89c59-1a2a-4c02-bf83-afc3c1a059e2","resolution":{"observed_at":"2026-08-06T13:31:11.375359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20627","last_updated":"2025-07-28T08:41:20Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T01:32:06.155782Z","submitted_at":"2025-07-28T08:41:20Z","title":"Controllable Video-to-Music Generation with Multiple Time-Varying Conditions"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.20627."}