{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e588639a5131b8d1bf9c749dfb7e9405f50de659c47c3ef329c00063538b5269","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:05:12.150659Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20038/citation-record","integrity":"/paper/2505.20038/integrity","json":"/paper/2505.20038/citation-record.json","paper":"/paper/2505.20038"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-07-31T09:11:09.636803Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17698","snapshot_observed_at":"2026-08-07T14:05:09.819840Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.819840Z"},"links":{"cited_paper":"/paper/2411.17698","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:c26c238630679009da60831ad704f3e7b02fdfe199acd9448546b9378a6a0b27","observation_id":"5001ff69-54ec-4cfe-8d99-1f5e3c17a8b5","resolution":{"observed_at":"2026-08-07T14:05:09.819840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-09T11:26:58.020744Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"cited_work":{"arxiv_id":"2412.09168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09168","snapshot_observed_at":"2026-08-07T14:05:12.689961Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","venue":"cs.SD","work_id":"5af1b514-b51b-46ba-b3a7-c958279d146b","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.874214Z"},"links":{"cited_paper":"/paper/2412.09168","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:d4bbe2bc8480c8828c3810a804303b5d423f2d61a04b7c9ff20415bce1749548","observation_id":"bade64f8-cec2-4ab2-ab56-2e7f85d2b730","resolution":{"observed_at":"2026-08-07T14:05:12.786853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T14:05:09.943750Z","title":"Tam- ing multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:09.943750Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:0f79e739e26d080fc42aa1aedfa24fc8c5562c0d58eee7d8951f9b41351fc27e","observation_id":"2309e642-f146-464a-a083-36fb2b903a66","resolution":{"observed_at":"2026-08-07T14:05:09.943750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:05:10.009315Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.009315Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:019202d6dad9c4eecfc0652820c052cb30da0b11be66e1685b1d85e0c0bf2a33","observation_id":"0d41f6e1-c5b0-4aba-8b10-537ae6f9645d","resolution":{"observed_at":"2026-08-07T14:05:10.009315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:10.132451Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.132451Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:f2fe1b874057bc445fae083cf502b0ef0424d2f1bf9dc5597b924b447b8d1b4e","observation_id":"26bf0cc3-e0af-410d-8e83-5b219d1d5a88","resolution":{"observed_at":"2026-08-07T14:05:10.132451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:14.405555Z","title":"Taming visually guided sound generation","venue":null,"work_id":"65ee2283-7ec6-4b78-a64d-a8996be772d3","year":2021},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.225285Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:a6852a4f556512b762976fe68ef3b10169f67c0e47c5ffa9a59182337b207441","observation_id":"be61c9ec-bfb7-4bdc-9141-01856861c8e0","resolution":{"observed_at":"2026-08-07T14:05:14.505860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:14.212468Z","title":"Sophia Koepke, Olivia Wiles, Yael Moses, and Andrew Zisserman","venue":null,"work_id":"b7904ded-0b40-43e0-907e-1decaf81d52e","year":2020},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.374623Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:bd13037637a0bc02c2deb5f2f9131fc93c88dcdd675ee63025b81a10f0196f59","observation_id":"0562a702-3591-42da-91a1-9f6291dbbe66","resolution":{"observed_at":"2026-08-07T14:05:14.327614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.965213Z","title":"Crandall, and Christopher Raphael","venue":null,"work_id":"fa376e28-3a21-40e0-ae6f-446471a9de56","year":2019},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.495877Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:d4193e953412c255367149612cc21029f340167b39cd54cb077c890c8fbd6630","observation_id":"84250236-4a2f-410b-8b7e-80c0110144ff","resolution":{"observed_at":"2026-08-07T14:05:14.101676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20378","last_updated":"2024-12-29T06:46:24Z","snapshot_observed_at":"2026-08-06T09:56:03.623451Z","submitted_at":"2024-12-29T06:46:24Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","version":1},"cited_work":{"arxiv_id":"2412.20378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20378","snapshot_observed_at":"2026-08-07T14:05:12.498296Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","venue":"cs.CV","work_id":"0e4cedca-3691-49e5-b480-0ee629216324","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.608172Z"},"links":{"cited_paper":"/paper/2412.20378","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:a4a671efa8ce5413db2e33cfb3c818dff291e3415888fc38f7a6d3245217a47d","observation_id":"8e7bcbcc-767a-40d2-ae68-369c5ecf4d75","resolution":{"observed_at":"2026-08-07T14:05:12.592926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.724190Z","title":"Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models, 2023","venue":null,"work_id":"479eed8f-0d48-4c88-85fd-5942799fc2a4","year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.693496Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:f12a731a123b6ff42db0205d4041ea9a7f351bfe554c30e057c38e63a647ddad","observation_id":"58c5112c-09e0-4fee-8b63-9ea593e6c88e","resolution":{"observed_at":"2026-08-07T14:05:13.840027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.470928Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":"67d83394-1be1-4953-a957-6aedee9f2343","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.818067Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:82291675044bbdb439ef95b2e180fc58363b511be72d981eba11e823a29310f0","observation_id":"142adb7a-b282-4e1f-b92e-0b5caa682562","resolution":{"observed_at":"2026-08-07T14:05:13.604068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.338648Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":"aa776937-a873-47a2-a397-82f7e53a4e38","year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:10.960063Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:1d11272ca52d065cabd5123a48d3f4d7d0c595156657449a9ccf8351d06f3fe5","observation_id":"5726a169-6270-466d-b1fa-5fbad09bc8d6","resolution":{"observed_at":"2026-08-07T14:05:13.403506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.035226Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.035226Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:cf16c432189354a7dea8b584d0400c11ac6b42e733315f883e96ad06576734c5","observation_id":"571820b7-73f0-4787-ac9a-5534892b862e","resolution":{"observed_at":"2026-08-07T14:05:11.035226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.152150Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.152150Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:30f32b5aefe74f82732a8345fb786c6c830e1040c275f646937a9f57e77349e8","observation_id":"0c40d3e8-45a1-4301-9083-8ca8d04573a2","resolution":{"observed_at":"2026-08-07T14:05:11.152150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14348","last_updated":"2020-06-23T00:58:59Z","snapshot_observed_at":"2026-07-06T09:32:42.212884Z","submitted_at":"2020-06-23T00:58:59Z","title":"Audeo: Audio Generation for a Silent Performance Video","version":1},"cited_work":{"arxiv_id":"2006.14348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.14348","snapshot_observed_at":"2026-08-07T14:05:12.329790Z","title":"Audeo: Audio Generation for a Silent Performance Video","venue":"cs.CV","work_id":"894ed98e-4bc7-4cb4-b104-2291d0f88221","year":2020},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.255279Z"},"links":{"cited_paper":"/paper/2006.14348","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:57d0a1a5cabe7e02a95cb3a15501458f6fc99861a49d2f6ffad5016a5be3376f","observation_id":"2fde6f11-e80f-45b7-9201-2879022d1fe5","resolution":{"observed_at":"2026-08-07T14:05:12.402036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-07T14:05:11.305127Z","title":"Audiox: Diffusion transformer for anything-to-audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.305127Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:d82470c381be3bd04b143780e5a8bf8ed89a3521725d2e779b3b50bcfeb1f9cf","observation_id":"bfde4dd2-da87-4953-a989-e1eb11484bd0","resolution":{"observed_at":"2026-08-07T14:05:11.305127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-04T07:34:16.448345Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-07T14:05:11.397850Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.397850Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:61c1c2ffae8bebe94eb8dac24e88f1a480d1fb9cbfad2182edb982b8411408eb","observation_id":"8aab714f-f38e-46bd-abbc-3c3d4a717b46","resolution":{"observed_at":"2026-08-07T14:05:11.397850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:13.082175Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models, 2023","venue":null,"work_id":"41cdb009-283d-485b-b66e-a1cc37b8514c","year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.478150Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:a6212a8a780b3fb7ebd608175e30111416b5180906f45f5e21304d53c9a8262b","observation_id":"4163fa1e-cbdb-4479-8a77-037d6e2d1217","resolution":{"observed_at":"2026-08-07T14:05:13.199507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-07-06T18:23:39.931536Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-07T14:05:11.602718Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.602718Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:7624312fbf7da9df0e9bc54ecd1b02f39ba17c27d965523c0ae7b94bd4674edb","observation_id":"c847c1af-9770-42ea-b268-32cd39ee6b86","resolution":{"observed_at":"2026-08-07T14:05:11.602718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.717744Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.717744Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:490b4879b0678d1f66ce760b859cc8e87a9cad5d836df2a96255b4ff2836fa15","observation_id":"d01e4aff-f9f4-49a1-abdd-c810a9e3ff68","resolution":{"observed_at":"2026-08-07T14:05:11.717744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:11.786319Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.786319Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:eceada7bf990d3aea5acf620d8be7a67058e435918fbe1add7fac70c0f658228","observation_id":"04a16f20-97f0-4ae9-ba51-3c4b66cfaf48","resolution":{"observed_at":"2026-08-07T14:05:11.786319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T14:05:11.869274Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.869274Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:aac8aa0160b4d091ae676c97cf733e7bf503ae355d0c31d612bd8df62dbbf566","observation_id":"c82a12f4-a32d-4160-8063-9d5fe817a8ea","resolution":{"observed_at":"2026-08-07T14:05:11.869274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:12.883583Z","title":"Diverse and aligned audio-to-video genera- tion via text-to-video model adaptation","venue":null,"work_id":"c92f59e7-035c-4968-880d-0dd54c0f2c26","year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.940525Z"},"links":{"citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:7e351439d62db7cbbae1a3b5727f545239f224136a41a75feac4e959118bf1e9","observation_id":"408206cd-881b-4eb6-be8a-b9c0006f1583","resolution":{"observed_at":"2026-08-07T14:05:12.973198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T14:05:12.046711Z","title":"Improve vision language model chain-of- thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:12.046711Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:1e4cf72a05b05f25cb49f150523aff763abf9eadf476dc04acc84e0273c571d7","observation_id":"10a5b411-b034-47a1-b8e3-b003ce232157","resolution":{"observed_at":"2026-08-07T14:05:12.046711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-07T14:05:12.150659Z","title":"Foley- crafter: Bring silent videos to life with lifelike and synchro- nized sounds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:12.150659Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:e4db71158158e19312c887debf39dc2666f80a8201f633be4d5734a5b1811ae4","observation_id":"e5935e36-2c37-445e-81ae-9d1e08b05f4c","resolution":{"observed_at":"2026-08-07T14:05:12.150659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T11:26:46.963069Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2505.20038."}