{"as_of":"2026-08-10T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07813f1dc0fbbd8f860cba426ada640dd3742c0ccc41ebcfd416d396b5dec995","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:40:06.423278Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:40:02.091028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:40:07.168991Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"cited_work":{"arxiv_id":"2507.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04955","snapshot_observed_at":"2026-08-06T19:40:07.168991Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","venue":"cs.SD","work_id":"713f90c0-4cb1-4085-8c16-c5fe351d9c38","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.091028Z"},"links":{"cited_paper":"/paper/2507.04955","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c3e6e7f57049cc9fd9dc47f3c9871f174ac7e95c2b9da7bea107ce9ca0a581c4","observation_id":"9e40e093-95c3-427f-b276-9e5220945e43","resolution":{"observed_at":"2026-08-06T19:40:07.236634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04955/citation-record","integrity":"/paper/2507.04955/integrity","json":"/paper/2507.04955/citation-record.json","paper":"/paper/2507.04955"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"cited_work":{"arxiv_id":"2507.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04955","snapshot_observed_at":"2026-08-06T19:40:07.168991Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","venue":"cs.SD","work_id":"713f90c0-4cb1-4085-8c16-c5fe351d9c38","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.091028Z"},"links":{"cited_paper":"/paper/2507.04955","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c3e6e7f57049cc9fd9dc47f3c9871f174ac7e95c2b9da7bea107ce9ca0a581c4","observation_id":"9e40e093-95c3-427f-b276-9e5220945e43","resolution":{"observed_at":"2026-08-06T19:40:07.236634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.494249Z","title":"Visual and Motion-Based Control Early interactive sys- tems mapped facial or bodily features directly to sound","venue":null,"work_id":"4b72bf34-d4c9-4493-ba98-e866da74cf61","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.126591Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6d35059eadccbc06ef10961cb752826269c467c364a8d9e413bb03c7a74dbabe","observation_id":"a5161bbe-ecc6-451f-9590-4f7a5a01a468","resolution":{"observed_at":"2026-08-06T19:40:13.582848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.395066Z","title":"We froze the parame- ters of the vanilla Musicgen during training to preserve its text understanding ability","venue":null,"work_id":"56b1e1fa-4ba3-4a63-baed-2c3bcb2840ca","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.174306Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:28318ce9167b076a6d23045702a5118b22bf6ab3f8ce541dd7c864ece74acbf4","observation_id":"f50d091c-f22a-40d2-8453-b09dcb9ae82a","resolution":{"observed_at":"2026-08-06T19:40:13.439452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.268495Z","title":"We recruited volunteers to record their facial expressions and upper body movements while listening to 30-second audio clips","venue":null,"work_id":"a93f7946-c0d8-418c-848a-147630a120b5","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.274703Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:8ba321a69d4eb04a082b7ae94a5f176d9d0921662066aa188e41451662f6fdfd","observation_id":"c1dde247-c637-4b46-943d-0d3213644c8a","resolution":{"observed_at":"2026-08-06T19:40:13.334019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:13.087642Z","title":null,"venue":null,"work_id":"6bc095f0-82d7-46d2-b41b-a5de6d76e13a","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.335175Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:e4f45463a2611b70aba996b1a4d76c2ee787dd9263320f14e90c0227379d78ad","observation_id":"28781a49-92c9-4ce2-9d9a-24267fca8f1c","resolution":{"observed_at":"2026-08-06T19:40:13.173796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.947351Z","title":null,"venue":null,"work_id":"b2a82d5f-2722-47f8-b76c-266a4e16b7d3","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.420427Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:2798a87fa7a77772031d8e37b4d080aafcce0124275408e341f4cba5013b462d","observation_id":"33c5a219-3486-401f-9e06-230fdbce7c2e","resolution":{"observed_at":"2026-08-06T19:40:13.017260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.845787Z","title":"Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthe- sis,","venue":null,"work_id":"1652a428-ac2c-43a0-bdd4-bd93191fc082","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.506180Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a415416e015ecdd9d438eb9fd470c6c19b7e5748cddb9246d3370ac42725f93a","observation_id":"5411faeb-ed22-49a3-b1a1-44ddb2381623","resolution":{"observed_at":"2026-08-06T19:40:12.895724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.717043Z","title":"Diff-Foley: Syn- chronized Video-to-Audio Synthesis with Latent Dif- fusion Models,","venue":null,"work_id":"933c561d-3999-4e70-a516-16190d441f05","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.572574Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0d73862fe6837953befb9cb6afeb356802a442bf5040d00af04af90efb138764","observation_id":"9edde2b6-174f-4fb3-9ae6-bb3ffff98c6f","resolution":{"observed_at":"2026-08-06T19:40:12.771095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.548778Z","title":"Temporally Aligned Audio for Video with Autoregression,","venue":null,"work_id":"a169798d-6b0f-418c-90c0-a321f7e61d58","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.639668Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:f3f7f87bf9780e1b57668a8d9c5436d00c5ac4ff008604c95c1e9a0a59be8c64","observation_id":"280c36b4-c927-457d-bcaa-f567ebd5a954","resolution":{"observed_at":"2026-08-06T19:40:12.623336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T19:40:02.722459Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.722459Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:4d04261783b2e3bbba50c9e4d6fce45950c173763667c2cc661b76e98fd8c158","observation_id":"6607a917-256c-4f2f-bd66-2a9b9f04c558","resolution":{"observed_at":"2026-08-06T19:40:02.722459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.432355Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching,","venue":null,"work_id":"a0ef1d1b-f173-49d8-88bf-4b8fa3828a8e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.784427Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:189864d2d00931ffad05ea46b58205ca8ac7cf893f3e9a3cfae1e7da389f207a","observation_id":"7ca01989-1023-4bec-a53f-64ee01474ca4","resolution":{"observed_at":"2026-08-06T19:40:12.493699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.309795Z","title":"MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation,","venue":null,"work_id":"b77a4988-4476-4fd7-aeff-d5e25a9efc20","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.871106Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:e118c4d7f9754f893a35ef418da1abb359359bebac1a012619a0f91b36278234","observation_id":"6d1a5a91-9a00-4e55-92d7-7bf31a0b806f","resolution":{"observed_at":"2026-08-06T19:40:12.370291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14598","last_updated":"2024-05-24T15:21:13Z","snapshot_observed_at":"2026-08-08T01:41:09.202426Z","submitted_at":"2024-05-23T14:13:16Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","version":2},"cited_work":{"arxiv_id":"2405.14598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14598","snapshot_observed_at":"2026-08-06T19:40:07.019654Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","venue":"cs.CV","work_id":"1cb08225-16da-4cf4-8ea4-4df274224c3e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.934968Z"},"links":{"cited_paper":"/paper/2405.14598","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:838a79063fdf56f3327e976d92ff7036f1ba1de59f1923968cbb72bf1bb10080","observation_id":"3591a8b3-2211-42de-a461-5c3226339e1f","resolution":{"observed_at":"2026-08-06T19:40:07.069029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:02.986485Z","title":"Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:02.986485Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a931b1d7b622eab0ae5b00bff420dcb2a55f5d1050ad3bb4e0e1b264e7e2e29a","observation_id":"347c438d-e88c-4438-a8f0-87b421fa314a","resolution":{"observed_at":"2026-08-06T19:40:02.986485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05937","last_updated":"2024-04-08T11:46:07Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-08T18:59:53Z","title":"InstaGen: Enhancing Object Detection by Training on Synthetic Dataset","version":3},"cited_work":{"arxiv_id":"2402.05937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05937","snapshot_observed_at":"2026-08-06T19:40:06.763444Z","title":"InstaGen: Enhancing Object Detection by Training on Synthetic Dataset","venue":"cs.CV","work_id":"b719ff9d-629c-48d6-a5d0-368b678352ef","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.033155Z"},"links":{"cited_paper":"/paper/2402.05937","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:da28a52151ce06e8892151faae4f37c167c935b2ce427c671b742d793c71af4f","observation_id":"98613fea-9f29-40f2-a7ed-af9861c212ed","resolution":{"observed_at":"2026-08-06T19:40:06.861777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07055","last_updated":"2024-06-20T02:24:34Z","snapshot_observed_at":"2026-07-06T17:42:53.395993Z","submitted_at":"2024-03-11T18:00:02Z","title":"Orbital angular momentum of Bloch electrons: equilibrium formulation, magneto-electric phenomena, and the orbital Hall effect","version":2},"cited_work":{"arxiv_id":"2403.07055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07055","snapshot_observed_at":"2026-08-06T19:40:06.660391Z","title":"Orbital angular momentum of Bloch electrons: equilibrium formulation, magneto-electric phenomena, and the orbital Hall effect","venue":"cond-mat.mes-hall","work_id":"a37bc8fd-f2b9-4449-883f-809296b2ba10","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.124928Z"},"links":{"cited_paper":"/paper/2403.07055","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:b87acf4d621bb3d06cf927ee7e0de8870f33d8e854e0bc718951bfb5c4cb1691","observation_id":"1914b229-406f-4b65-95f1-44bd64a2e926","resolution":{"observed_at":"2026-08-06T19:40:06.700771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.191594Z","title":"Conditional Generation of Audio from Video via Fo- ley Analogies,","venue":null,"work_id":"c6eedbb1-6c8f-4b51-abc4-29949739a36a","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.203009Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:f643443896e5ce403ffba61e075acd0ace39828e9a3b1f2d2b8028775305e86f","observation_id":"3268cad6-05c1-4629-991e-60b6452c29b3","resolution":{"observed_at":"2026-08-06T19:40:12.236091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12957","last_updated":"2024-10-16T18:44:56Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:44:56Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12957","snapshot_observed_at":"2026-08-06T19:40:03.310979Z","title":"MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.310979Z"},"links":{"cited_paper":"/paper/2410.12957","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:57e2cffce7cf894e9fdbe29b8366f5567e85bfe8163f9b0b1c0e5cda2d397b40","observation_id":"570ab3ab-09c6-4f44-a80b-eb1002082a44","resolution":{"observed_at":"2026-08-06T19:40:03.310979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:12.066202Z","title":"VMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos,","venue":null,"work_id":"6d90d234-65e2-4029-992c-359e16045036","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.401713Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c3eb84a4e524417294babc4cbddaadaba3d9d088694c5327c030877fbeb15a6d","observation_id":"5c4325b2-3013-4bf5-94e1-01675403956d","resolution":{"observed_at":"2026-08-06T19:40:12.123750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.931848Z","title":"Video2Music: Suitable Music Generation from Videos using an Affec- tive Multimodal Transformer model,","venue":null,"work_id":"37a4334f-d172-46b9-a437-28e70b8fb09f","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.480431Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3b51d9f1f5206e6624ff23b8071ff47a79c68ab44875dabf39bafb20b0fd40c5","observation_id":"ace31055-2ce3-4c57-9ada-33435a441f6d","resolution":{"observed_at":"2026-08-06T19:40:11.993773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.778215Z","title":"V2Meow: Meowing to the Visual Beat via Video-to-Music Generation,","venue":null,"work_id":"642f3a2c-2ac8-494f-ad98-c56ce18b3d3a","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.578377Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:9b3a12aac54dd60a74da5c898eda63647aeaaa0f68dea811b60087f812c44b99","observation_id":"272d2f30-f92d-4de2-88de-12a9bd7183b7","resolution":{"observed_at":"2026-08-06T19:40:11.847780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.624350Z","title":"DanceCom- poser: Dance-to-Music Generation Using a Progressive Conditional Music Generator,","venue":null,"work_id":"0064eff8-0376-4c83-9786-816a1297afc3","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.686152Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:95494a67da2f338e9bccac9e59318616a2d0ce0eaf1ed8073b656d5a72af6c38","observation_id":"df50cb85-48d6-4390-8928-3e959bdb753e","resolution":{"observed_at":"2026-08-06T19:40:11.704582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.443467Z","title":"Discrete Contrastive Diffusion for Cross- Modal Music and Image Generation,","venue":null,"work_id":"93830bf1-ccdb-4758-8f35-bef7134b44cf","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.792531Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:9d0853a4317e0868ba66f043e2df10b4028d3520b4ea4b395951ab88bf456f80","observation_id":"7e4af507-c12d-48d4-ad6b-2f3f28224bbe","resolution":{"observed_at":"2026-08-06T19:40:11.528547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.268030Z","title":"Long- Term Rhythmic Video Soundtracker,","venue":null,"work_id":"adc07e1b-8cb7-46ea-a491-a10cd7a1225c","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.912137Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:56f7cf29b0b846e982567452796a44dc00542358781d3bb20db31f8d49bd74bc","observation_id":"7c3a79c2-7f4f-4cd3-a3e4-95985327a9f3","resolution":{"observed_at":"2026-08-06T19:40:11.368600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:11.107349Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"6cc407b6-7a01-4612-8eef-a8700358c9a9","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:03.992590Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:289219853d4f20096ddd22148dfe6cbe3bca15fb356de111804e3d982956b53f","observation_id":"20b4b726-aaae-4943-aaff-ce82af8fc7c4","resolution":{"observed_at":"2026-08-06T19:40:11.195413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17162","last_updated":"2024-10-06T21:36:20Z","snapshot_observed_at":"2026-08-03T09:34:26.655168Z","submitted_at":"2023-10-26T05:24:38Z","title":"Content-based Controls For Music Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17162","snapshot_observed_at":"2026-08-06T19:40:04.068660Z","title":"Content-based controls for music large language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.068660Z"},"links":{"cited_paper":"/paper/2310.17162","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:97f1e8ca01aace21973066bfa31dbdd9d3d8d0a866af11246bbe0f655b48acdf","observation_id":"8f0bba4b-2550-4491-86ea-2112d40c1c49","resolution":{"observed_at":"2026-08-06T19:40:04.068660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13253","last_updated":"2024-12-10T20:19:18Z","snapshot_observed_at":"2026-08-09T21:39:42.103250Z","submitted_at":"2024-02-20T18:59:26Z","title":"BiMediX: Bilingual Medical Mixture of Experts LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13253","snapshot_observed_at":"2026-08-06T19:40:04.143427Z","title":"Sketch2sound: Controllable audio generation via time-varying signals and sonic imita- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.143427Z"},"links":{"cited_paper":"/paper/2402.13253","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:afec9c725bd214ed4ce2ab155522367317a4569a209589d59c93fc54c0128295","observation_id":"867e4e4d-3533-4f57-9782-533fc52b2236","resolution":{"observed_at":"2026-08-06T19:40:04.143427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.943376Z","title":"Audioclip: Extending clip to image, text and audio,","venue":null,"work_id":"18487be9-2999-4245-9c2c-58ffaa4f1fa5","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.196472Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:2a04858a6264a0eb1c707cd1da26770e63d18803638b4630b3ec450b20e06539","observation_id":"95569952-453b-4786-a063-b217798b55b4","resolution":{"observed_at":"2026-08-06T19:40:11.013911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:04.281404Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.281404Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:0f8f05ba62c2a2bae8f08d73cef6903ac6c8328218fca767b2b110e0e36bb309","observation_id":"660763c1-7f85-49a8-abe1-d7d88733bbf8","resolution":{"observed_at":"2026-08-06T19:40:04.281404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.749594Z","title":"Vidmuse: A simple video-to- music generation framework with long-short-term mod- eling,","venue":null,"work_id":"237ba6e0-0fd2-4fea-9e6b-b1db17613c99","year":2025},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.379020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:54bdef08ae19d9a20f8be83a82d5640baa4627a52e1c1d9122497f4384a36d38","observation_id":"1a77d445-28de-4259-85b5-7470c0e565af","resolution":{"observed_at":"2026-08-06T19:40:10.832849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.482150Z","title":"Sonify Your Face: Facial Expressions for Sound Generation,","venue":null,"work_id":"7ce516c4-bd4f-40e8-bf8f-6fbc3c6ce09c","year":2010},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.446437Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:138b3bed8f1ba9c14597ed9cd0a556961e9b7599492d0dfdb9dd97b973f4f6c8","observation_id":"b3655a34-319f-49d9-8e80-239d6fc3e059","resolution":{"observed_at":"2026-08-06T19:40:10.626318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.276655Z","title":"Movement to emotions to music: using whole body emotional expression as an interaction for electronic music genera- tion,","venue":null,"work_id":"a3c5f1bb-d135-46d4-ae2f-a6f1f7b346ae","year":2012},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.532491Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:514ff23c7a5d520e19ac98e9aac9ab5f7d86717eefc6d4800105fdd58cd9b7bc","observation_id":"213f40a7-211f-4da6-aeae-8ee1e726f045","resolution":{"observed_at":"2026-08-06T19:40:10.373609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:10.033632Z","title":"D2MNet for music generation jointly driven by facial expressions and dance movements,","venue":null,"work_id":"ca84bda9-eb71-4e51-9b8e-56bc806da1d5","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.603651Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:eab722cd080197bd7db0f7aa1ca055527c27d63c72e32a6d41587c4c2502528d","observation_id":"5a30467f-308d-41b2-b8e5-4398e4ffedfb","resolution":{"observed_at":"2026-08-06T19:40:10.145199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.853039Z","title":"Deep- Tunes: Music Generation based on Facial Emotions using Deep Learning,","venue":null,"work_id":"0bb24285-31fd-4507-b6e7-ac79515ab019","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.683328Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:47ecc8bbbf83cd0aff196274d0305ccac8c59bf67e3c421ec1e7efa2660fa349","observation_id":"8beac812-bcff-45fc-9d2a-dfb7b735dc7c","resolution":{"observed_at":"2026-08-06T19:40:09.946722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.727121Z","title":"A Contin- uous Emotional Music Generation System Based on Facial Expressions,","venue":null,"work_id":"570905b1-b900-46b9-85f5-a6617e757707","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.816135Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a8cb01c1bd504c740aa1d12b88ff0b77e75df99524eaf885ad658deee310b6b8","observation_id":"95e5e6ef-e7cd-4911-b0e4-dd7226c2d195","resolution":{"observed_at":"2026-08-06T19:40:09.797652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.595112Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":"d83dc688-101d-4c6f-870a-0578422910e1","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:04.908406Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:914223dfd2b8cfaa498e4965601af5e791aca6c7756ecaf9c507cc9bcb2a9572","observation_id":"290f3bdf-e9f3-492b-8641-be59b2b62b56","resolution":{"observed_at":"2026-08-06T19:40:09.655800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.435194Z","title":"Audio set: An on- tology and human-labeled dataset for audio events,","venue":null,"work_id":"ffd74edf-4a52-47cb-bc39-a216f3ce45f8","year":2017},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.007593Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:f39672be44c8e47c4cc4b231b5d03ff107a5f4d949b269b54a6ae1b717528acc","observation_id":"437cbddc-94b7-4e31-b553-70831a24277a","resolution":{"observed_at":"2026-08-06T19:40:09.502002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.282666Z","title":"Vg- gsound: A large-scale audio-visual dataset,","venue":null,"work_id":"1ba03db0-7978-41ea-8ed2-04df8bc51914","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.092253Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c4f6ff73398925344b60bce94d3b70950583a16ead33b152d9e14d4c10211c7d","observation_id":"8d4a48bf-9cba-4a3e-a001-b3488749bedb","resolution":{"observed_at":"2026-08-06T19:40:09.346892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:09.130916Z","title":"Arrange, inpaint, and refine: Steerable long-term music audio generation and editing via content-based controls,","venue":null,"work_id":"9963908e-2911-4a87-aef8-a8265432646a","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.158914Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:c88b621fdb0df7549e9154bad590911ae08c49c29dd76d2af0f4df3b4b4276b0","observation_id":"22542eab-239f-45f9-a1d1-3db28816f211","resolution":{"observed_at":"2026-08-06T19:40:09.182866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.980054Z","title":"Marlin: Masked autoencoder for facial video representation learning,","venue":null,"work_id":"c94c06cd-05de-4099-a6a7-c8146c796a77","year":2023},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.230502Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:9c419a430f634dfae6896c702cf5f4e838f5dc00a832647b6ab52d1ad1957082","observation_id":"c29f1b56-bd19-4960-bb1b-e28fac85f60b","resolution":{"observed_at":"2026-08-06T19:40:09.043876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.851107Z","title":"Synch- former: Efficient synchronization from sparse cues,","venue":null,"work_id":"1232425a-973e-4948-9810-018f1d21882e","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.317236Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:5e83439211d1fdd985f46796396bb1a2fab1489e06178fa1b9feeb120bb27d28","observation_id":"83659852-de37-4dcc-a2fc-0941b0e9eaea","resolution":{"observed_at":"2026-08-06T19:40:08.910894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.709608Z","title":"Raft: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":"54b72f33-8c57-4b80-8109-871444731f5c","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.387260Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:108effbd8440fa8ed1288b2d0ba8a266b4c34457292482933d1b2dd2a0a9a849","observation_id":"8ee1745e-fb97-48c2-8d7c-8b64bbcdc768","resolution":{"observed_at":"2026-08-06T19:40:08.790842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.588242Z","title":"Salmonn: Towards generic hear- ing abilities for large language models,","venue":null,"work_id":"2561053d-d309-4015-b5d3-45ddb2127d83","year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.475020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:a8b728fd872cb9fd6ac89dfb3a75d9c6048d3250c3d57d11f613c1430b67388c","observation_id":"30df38f1-ba3e-4b42-9166-3b4bc2c8f2e6","resolution":{"observed_at":"2026-08-06T19:40:08.638745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T19:40:05.562715Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.562715Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:8f1c02e74d2820d832cef31a61605736dd2dafb9fc84db2e539d6887037d30df","observation_id":"a906a825-ceb7-4767-a58c-469be428b1c0","resolution":{"observed_at":"2026-08-06T19:40:05.562715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.414748Z","title":"Video2music: Suitable music generation from videos using an affective multimodal transformer model,","venue":null,"work_id":"6942d5a0-459b-461b-8d4f-74667c0a4f41","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.646574Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:5add6d3605d2c595cf2ff1c5af187539fc6de83e454eff9df5b8ca17b8780e51","observation_id":"3570c2dd-fc12-4839-94ba-a278eac465da","resolution":{"observed_at":"2026-08-06T19:40:08.478892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T19:40:06.423278Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.423278Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:4099d7afdc6e17bf5ca8bbb54cb37e1b73a807602acb34f7e960ec4593194f1a","observation_id":"4d498afb-aabf-454d-b1f7-7cb6a779273d","resolution":{"observed_at":"2026-08-06T19:40:06.423278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.266230Z","title":"Frechet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":"1808b9be-7c70-4d6a-9cf0-5893bebadbe7","year":2019},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.802192Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:625270c71f00fe6685e318384b4a58322416a4d9e064574c1d8d4cfca0ac1451","observation_id":"2109cd34-ce37-4fb4-ab09-158242398ce3","resolution":{"observed_at":"2026-08-06T19:40:08.324059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:08.130020Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"a5d0e539-c82e-4f80-8b90-c4cff9b26429","year":2017},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.915584Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:d5effa4ba59821806a5c079e61bf2f4a8904c84f9076944ffa969bd4d2404bf8","observation_id":"b3b0825d-f5ef-4181-bdd0-f6dda41b6f6c","resolution":{"observed_at":"2026-08-06T19:40:08.184873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.971523Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"361ad834-3f4f-4309-93b3-e2c4c54dde63","year":2020},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.008469Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:3e165dc4a49b27663af79fd6eea7f56e2af139f03eb03d87f7712bb7c828ab5a","observation_id":"9bc0bd82-ac09-487d-ae91-6404e14bdf0a","resolution":{"observed_at":"2026-08-06T19:40:08.043067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.806971Z","title":"Efficient training of audio transform- ers with patchout,","venue":null,"work_id":"a1d8844c-4f05-4744-8282-23577d065ca6","year":2022},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.095672Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:f2e1e47dc002094c4d89f8299e3b89a2a54226fbb86921628a40b44c292add21","observation_id":"4ae24de1-8228-4f7d-ad82-b95dbfabf1d2","resolution":{"observed_at":"2026-08-06T19:40:07.890135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.656656Z","title":"Improved techniques for training gans,","venue":null,"work_id":"7c865b89-5b90-488c-be1d-91dd41db514f","year":2016},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.183184Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:784b1d91579eb974e5090d26e24b0d9f8a3c75ac6fb833b497a85965325fba6e","observation_id":"a7efb45e-843f-4d91-96e9-5a8b69baac36","resolution":{"observed_at":"2026-08-06T19:40:07.747301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.451102Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"dea81b7f-5664-4702-b72d-53f594e324ca","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.270020Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:762ab3ce82188b39a55325498281630251349faab68adf7f5b7f8002aa584423","observation_id":"ddce1c67-46ab-452f-9717-4bbfefbf307d","resolution":{"observed_at":"2026-08-06T19:40:07.534298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:07.321761Z","title":"Available: https://arxiv.org/abs/2211","venue":null,"work_id":"c50ca14c-863b-45f4-b5d3-910b9c4a9875","year":null},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:06.341162Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:31a6480b160e2ee7f51c3ef5bd27deec3e5aed9743a60394899cf58ec0675e25","observation_id":"f793ccb1-7e6e-4408-82c8-6d38868b0d67","resolution":{"observed_at":"2026-08-06T19:40:07.382378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:40:05.719311Z","title":"Available: http://dx.doi.org/10.1016/j","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:05.719311Z"},"links":{"citing_paper":"/paper/2507.04955"},"observation_digest":"sha256:6d0a87dd838740f94b8c4fe20a5809afe273da61e83384ed15fa23fcac7b421b","observation_id":"7a790e88-2b6f-4552-95e8-4e401d7c3a91","resolution":{"observed_at":"2026-08-06T19:40:05.719311Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04955","last_updated":"2025-07-07T12:56:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T07:21:10.713434Z","submitted_at":"2025-07-07T12:56:20Z","title":"EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2507.04955."}