{"as_of":"2026-08-18T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:523dbbe9fd16d411f90a83596f3704fdf8aac42c603a9f5c49f085dc8c879974","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:28:27.726082Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11899/citation-record","integrity":"/paper/2608.11899/integrity","json":"/paper/2608.11899/citation-record.json","paper":"/paper/2608.11899"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-16T15:25:26.441326Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-16T00:28:26.109837Z","title":"Simple and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.109837Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:1f73edaa4d84198852e1434e414949c22d57341644c289258de1db714d780523","observation_id":"a0872711-aa1b-48fd-8ba2-2c101cb7a09e","resolution":{"observed_at":"2026-08-16T00:28:26.109837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-16T00:28:26.177180Z","title":"and Borsos, Zal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.177180Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:7bdf0a7c8e4d56af7d3d1dc464e7dfb06169b7354372f924049611cf9e703d5b","observation_id":"66cbd473-cc96-4d28-9b23-decfb6e1de8f","resolution":{"observed_at":"2026-08-16T00:28:26.177180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-16T00:28:26.284368Z","title":"doi:10.48550/arXiv.2506.00045 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.284368Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:32dd1d21c91fe996116e1b6d828adaea058a204ab939df89076c9d7d21a303c7","observation_id":"11c254ee-56bb-40d0-91c6-07e21c5ba28e","resolution":{"observed_at":"2026-08-16T00:28:26.284368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.00744","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.668353Z","title":"doi:10.48550/arXiv.2602.00744 , urldate =","venue":null,"work_id":"5e81343c-a2b9-4ca7-9cd6-612facb3a783","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.289360Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:2d09f8cfa25d3ff03c30d67480cb815942a7873b6cd387e595998a4bf594403c","observation_id":"71a38278-fbe8-45d8-9349-73208e10f413","resolution":{"observed_at":"2026-08-16T00:28:28.718546Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15060","last_updated":"2024-07-21T05:27:53Z","snapshot_observed_at":"2026-08-16T13:32:25.291771Z","submitted_at":"2024-07-21T05:27:53Z","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15060","snapshot_observed_at":"2026-08-16T00:28:26.293852Z","title":"doi:10.48550/arXiv.2407.15060 , urldate =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.293852Z"},"links":{"cited_paper":"/paper/2407.15060","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:31048579c8fa07e1e85bbdf4a579de03b589182a1f9dba2e3ec4b0abecada15f","observation_id":"b09bc5a3-8721-495a-998c-841276ab5a9f","resolution":{"observed_at":"2026-08-16T00:28:26.293852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10811","last_updated":"2025-03-24T02:05:18Z","snapshot_observed_at":"2026-08-16T12:58:45.392037Z","submitted_at":"2025-01-18T16:21:03Z","title":"MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10811","snapshot_observed_at":"2026-08-16T00:28:26.314995Z","title":"doi:10.48550/arXiv.2501.10811 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.314995Z"},"links":{"cited_paper":"/paper/2501.10811","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:541a90145173b721a0a8142465940b26a1187f03db22370b64c19415960097fe","observation_id":"10ae5514-10db-4268-85d7-dc4947ce3815","resolution":{"observed_at":"2026-08-16T00:28:26.314995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-16T16:08:07.333631Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12285","snapshot_observed_at":"2026-08-16T00:28:26.320414Z","title":"doi:10.48550/arXiv.2506.12285 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.320414Z"},"links":{"cited_paper":"/paper/2506.12285","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:3b1ca1fcbf29a0365b652101847bc4efc2c2bff13f62baf9a64e04ed7186a54e","observation_id":"3bd89cb3-28a2-405c-bb5c-bc39a5f62d48","resolution":{"observed_at":"2026-08-16T00:28:26.320414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00610","last_updated":"2026-06-11T15:20:43Z","snapshot_observed_at":"2026-08-14T18:43:03.691653Z","submitted_at":"2026-02-28T12:10:58Z","title":"CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00610","snapshot_observed_at":"2026-08-16T00:28:26.325260Z","title":"doi:10.48550/arXiv.2603.00610 , urldate =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.325260Z"},"links":{"cited_paper":"/paper/2603.00610","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:28ec678e8bf4c76c2fb04cc26f5c694f481e72efab38e62e8f55a746433f813e","observation_id":"6397be86-bc80-45fb-90be-73f64e8da7fc","resolution":{"observed_at":"2026-08-16T00:28:26.325260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.08638","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.541700Z","title":"doi:10.48550/arXiv.2503.08638 , urldate =","venue":null,"work_id":"20f4a554-fa6e-4f74-b0d5-fb4875c530b9","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.331735Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:63f77722ee3edfb78eff8b1e2bf4f6821492828add565537f4362a56307b0a37","observation_id":"87473a7e-b1ba-4115-a49c-4d34f3dcfb7f","resolution":{"observed_at":"2026-08-16T00:28:28.546361Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.23350","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.386698Z","title":"doi:10.48550/arXiv.2509.23350 , urldate =","venue":null,"work_id":"05c51847-46a2-4507-baf7-23bc833cf493","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.336974Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:6c094365ab95532c4d958b9d5451adb04e2a7b0c5d177eb481ffb1c3f5b4bd9e","observation_id":"85a18ad6-5dbb-45b8-8e7b-288842d9022a","resolution":{"observed_at":"2026-08-16T00:28:28.414010Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07069","last_updated":"2023-11-13T04:24:14Z","snapshot_observed_at":"2026-08-16T14:43:55.250464Z","submitted_at":"2023-11-13T04:24:14Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07069","snapshot_observed_at":"2026-08-16T00:28:26.427618Z","title":", year = 2023, number =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.427618Z"},"links":{"cited_paper":"/paper/2311.07069","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:959f046594e90568c77655d07c21fac5150dcaa927a51981ee365f3242a0ecfa","observation_id":"d4c41290-afdf-46b1-8157-ba3285c4881b","resolution":{"observed_at":"2026-08-16T00:28:26.427618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2510.22950","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.299660Z","title":"doi:10.48550/arXiv.2510.22950 , urldate =","venue":null,"work_id":"5040248e-9c05-46e0-81d8-387dbac5e1c6","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.520700Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:5d15b006100ea9d4f86b5c4bdc58b505f47fef11aa98e503cdbe399d90787144","observation_id":"fa1a66d0-3cab-4bfa-a741-1b5ac83915cf","resolution":{"observed_at":"2026-08-16T00:28:28.305501Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.07520","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.220340Z","title":"doi:10.48550/arXiv.2506.07520 , urldate =","venue":null,"work_id":"34a02008-7153-455a-b2a1-ba32680d5899","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.585183Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:e02ba6ea3753b0aa4cf939b1b610bb6cba90f7273b325ac7c30dff2d4942dec1","observation_id":"1f31472f-ec84-423c-a039-ce74e65a3297","resolution":{"observed_at":"2026-08-16T00:28:28.236350Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:30.042538Z","title":null,"venue":null,"work_id":"435cf45c-ff26-4b08-be1c-52550126009b","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.593641Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:049eacca9279c982ed0842aa5626e1f75a4dddeaeaff73f544f3ac10b564d3aa","observation_id":"b16d90f8-71d5-4d99-9097-6627734e9f41","resolution":{"observed_at":"2026-08-16T00:28:30.098546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-16T13:32:41.679971Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-16T00:28:26.599102Z","title":"and Carr, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.599102Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:d1a76213fe68e4b6b92e6d01222e9ff4a16516636616dacb8cd159931c5c2b21","observation_id":"90e40958-e696-4903-91ed-1eab3767a1a6","resolution":{"observed_at":"2026-08-16T00:28:26.599102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17991","last_updated":"2026-05-18T07:47:03Z","snapshot_observed_at":"2026-08-16T06:50:56.794163Z","submitted_at":"2026-05-18T07:47:03Z","title":"Stable Audio 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17991","snapshot_observed_at":"2026-08-16T00:28:26.604045Z","title":"and Rice, Matthew and Carr, C","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.604045Z"},"links":{"cited_paper":"/paper/2605.17991","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:e267912b64e9e1cdecf8dc87f903affbb8f09271d9aaea9c9c61e1c6958abf82","observation_id":"46811aac-ca2b-4b6d-8dc6-2de61b0836ac","resolution":{"observed_at":"2026-08-16T00:28:26.604045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-16T14:43:20.569125Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-16T00:28:26.609238Z","title":"Mustango:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.609238Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:88a1373187cc5c2a5d1bb2fdf1ec355e33a53f7309d18e056f2ee98904c06f4e","observation_id":"b301c622-6332-45e6-a3b7-1ad8f5731c5a","resolution":{"observed_at":"2026-08-16T00:28:26.609238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-16T15:27:47.225337Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-16T00:28:26.614282Z","title":"doi:10.48550/arXiv.2306.00110 , urldate =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.614282Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:7870c092e01b8bb1c3a608414c47741999488be65b2ada85a4db1e0402d1a122","observation_id":"a58f21de-024f-442e-bf12-583c1fc44492","resolution":{"observed_at":"2026-08-16T00:28:26.614282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04090","last_updated":"2022-12-19T18:27:36Z","snapshot_observed_at":"2026-08-17T22:05:21.441163Z","submitted_at":"2021-05-10T03:44:03Z","title":"MuseMorphose: Full-Song and Fine-Grained Piano Music Style Transfer with One Transformer VAE","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04090","snapshot_observed_at":"2026-08-16T00:28:26.618547Z","title":"doi:10.48550/arXiv.2105.04090 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.618547Z"},"links":{"cited_paper":"/paper/2105.04090","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:e56cba683a35e340def5b971debd68685e3365257928de6b7aadd22e92e51ba6","observation_id":"17d04a20-2b74-4785-8f1b-d196a622d6ba","resolution":{"observed_at":"2026-08-16T00:28:26.618547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-15T21:01:03.472765Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-08-16T00:28:26.622928Z","title":"doi:10.48550/arXiv.2505.10793 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.622928Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:44b18ec563f7db8cb8794fb46ef2137b38091175d17579bff2dbca84a2d6a3fa","observation_id":"c50d75e1-b465-4543-b85b-428ea73e466e","resolution":{"observed_at":"2026-08-16T00:28:26.622928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10936","last_updated":"2024-02-22T10:34:18Z","snapshot_observed_at":"2026-08-17T05:34:31.699753Z","submitted_at":"2022-01-26T13:51:19Z","title":"FIGARO: Generating Symbolic Music with Fine-Grained Artistic Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10936","snapshot_observed_at":"2026-08-16T00:28:26.626971Z","title":"doi:10.48550/arXiv.2201.10936 , urldate =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.626971Z"},"links":{"cited_paper":"/paper/2201.10936","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:32dedee9cfba3747a57ad27a7821e14d874341047ce2a3910d8898c17f798df5","observation_id":"cffb460f-ea7f-46bd-8e1f-9d125e47fcf4","resolution":{"observed_at":"2026-08-16T00:28:26.626971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30642","last_updated":"2026-06-29T17:59:20Z","snapshot_observed_at":"2026-08-13T14:26:47.969747Z","submitted_at":"2026-06-29T17:59:20Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training","version":1},"cited_work":{"arxiv_id":"2606.30642","doi":"10.48550/arxiv.2606.30642","metadata_source":"pith","pith_arxiv_id":"2606.30642","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training","venue":"cs.SD","work_id":"a6824794-7c23-4ff5-b86f-ddd163d6af7c","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.658529Z"},"links":{"cited_paper":"/paper/2606.30642","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:150421c84ba36d6d48cd39c5be259b8d35f3d8f8a25e55c0ce2646295ea65cc4","observation_id":"8c045c9b-6d69-4982-8b47-5795996ca347","resolution":{"observed_at":"2026-08-16T00:28:28.000730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:30.028403Z","title":"Proceedings of the International Computer Music Conference , address =","venue":null,"work_id":"526e872c-0c78-477a-b743-01758eb08246","year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.762197Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:1c7f7b8a7109e87ef90bb4a5bdeabfc78326ccbd984f2bdd44c1bea75bc3f9fa","observation_id":"0188d9d8-2da6-4774-8558-1e227682ead6","resolution":{"observed_at":"2026-08-16T00:28:30.033586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.953897Z","title":"Proceedings of the 7th International Conference on Music Information Retrieval , url =","venue":null,"work_id":"4f363384-abe9-4cad-b630-9b080f7da350","year":2006},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.787481Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:3ffb8f91717a7193da7928b71f9133f1390a4b6d5d5b582730461e37f2e78f8c","observation_id":"7ee19cf0-4b67-44f1-96b9-b453146af944","resolution":{"observed_at":"2026-08-16T00:28:30.001789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.877658Z","title":"and Salamon, Justin and Nieto, Oriol and Liang, Dawen and Ellis, Daniel P","venue":null,"work_id":"1fcee90f-a8ae-49bf-83ba-fb9438c06469","year":2014},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.792385Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:8fcfc78fd648483c2a204e393223ebbd6f99c01557555c9c2c88c3b2dfd774c6","observation_id":"e911ecbe-eaf5-488e-9d50-484c98b5b0a7","resolution":{"observed_at":"2026-08-16T00:28:29.905805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.850729Z","title":"Proceedings of the 16th International Society for Music Information Retrieval Conference , address =","venue":null,"work_id":"33b6f7c6-052e-4423-bed1-edbcf91c6f60","year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.983549Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:06aea20883d7033e9139f594ece73aa982a4b6209fe5b31aca8b7d18fc05c115","observation_id":"bc17555b-aa7f-4d2d-bdcd-3b265a31f76f","resolution":{"observed_at":"2026-08-16T00:28:29.855632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.836460Z","title":"Proceedings of the AES 25th International Conference on Metadata for Audio , address =","venue":null,"work_id":"ad3af11b-a127-4850-b940-4c59a6e4bd1b","year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:26.997457Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:31bf16a2b257f384261a57dc6a14a6d47b85312565e596e7431c87987f363e50","observation_id":"31915631-7fa8-4fa6-888b-c64fc3e92324","resolution":{"observed_at":"2026-08-16T00:28:29.841855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.822603Z","title":"2015 , address =","venue":null,"work_id":"be6198bd-def7-4fb8-a107-bf5ebd27055d","year":2015},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.003800Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:3551995c199e1286e0c3b5f4c20a60932b1b9216403cea4a1fe309ecdf14bd6e","observation_id":"a6de812f-a8e4-40e7-8cee-2416cb5c12cf","resolution":{"observed_at":"2026-08-16T00:28:29.826958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.807894Z","title":"Beyond Accuracy: Behavioral Testing of","venue":null,"work_id":"a8f3da44-09b4-4e2f-9921-fa01828f3b1f","year":null},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.007770Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:46b4c6566edc4e6a04674a2959f80ffe1fa148db4af967989e33c50a8fde643c","observation_id":"51f13b55-ef89-4a52-bcac-da853f1150e2","resolution":{"observed_at":"2026-08-16T00:28:29.812752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-08-11T09:42:32.928404Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01048","snapshot_observed_at":"2026-08-16T00:28:27.014667Z","title":", year = 2026, month = may, number =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.014667Z"},"links":{"cited_paper":"/paper/2605.01048","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:368e9ba7d92221e57f53ee4ee6939b2f8db699ce6ed23978130c614e7143aa2b","observation_id":"e840c0b4-05cf-4db5-9e83-d1e0275d23f4","resolution":{"observed_at":"2026-08-16T00:28:27.014667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.670002Z","title":null,"venue":null,"work_id":"fa444a6f-6ddc-4690-bc3e-4784c9c85562","year":2023},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.029047Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:773415595e0da09f8a0ee2156cef85cb386cf1174b444165afb4309ce4822c8c","observation_id":"0bd818e5-3bf9-4c68-8449-37400a9bcbbe","resolution":{"observed_at":"2026-08-16T00:28:29.752173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.595722Z","title":"Simple and Controllable Music Generation , January 2024","venue":null,"work_id":"46566e75-5463-480d-bcda-84c5c8881723","year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.033014Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:921bce2a0e9e594f075853918f09e80a4e4434270b81c9ebd1af20eb3935a005","observation_id":"f00ba2f1-5739-4d87-9881-90740a8de78b","resolution":{"observed_at":"2026-08-16T00:28:29.636996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.539516Z","title":"Parker, C","venue":null,"work_id":"307b8b14-c626-4f4d-abc3-3ebee9306482","year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.036868Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:10d87e3dd750b135018dcdca92290667a30233043a8c89371fac31d28edd4363","observation_id":"4a49088f-a280-4a2b-a2a5-360ea31c9166","resolution":{"observed_at":"2026-08-16T00:28:29.543411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.525935Z","title":"Parker, Matthew Rice, C","venue":null,"work_id":"c3ce16a0-18ae-462c-9345-4b42c642e002","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.041167Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:af4b11d61b6609cbda27d5554439ab7b0e186fed6379ffe05c90275c0ef068dc","observation_id":"c0da051c-e40c-479f-aaea-9d7f073f4f71","resolution":{"observed_at":"2026-08-16T00:28:29.530241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21658","last_updated":"2024-07-31T14:59:17Z","snapshot_observed_at":"2026-08-16T13:29:30.923656Z","submitted_at":"2024-07-31T14:59:17Z","title":"Beat this! Accurate beat tracking without DBN postprocessing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21658","snapshot_observed_at":"2026-08-16T00:28:27.045584Z","title":"Beat this! Accurate beat tracking without DBN postprocessing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.045584Z"},"links":{"cited_paper":"/paper/2407.21658","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:0d06a2552161f4b5b3a31a54f60cabaaa9d2c6c33af7c27ded6287f2c59dc7de","observation_id":"90534b1d-90a2-4609-8460-4b0fabb0c2a2","resolution":{"observed_at":"2026-08-16T00:28:27.045584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.511215Z","title":"ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation , February 2026","venue":null,"work_id":"d8b3861d-c434-4c6e-9e77-56ca8f183dbc","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.049879Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:163cf2a611579d60010016838b0c23f3dad52a5713d7bb0f85a81b9cf8582c39","observation_id":"cbe7d1a3-d254-4060-a3f8-9110dd7b0f07","resolution":{"observed_at":"2026-08-16T00:28:29.516594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12907","last_updated":"2025-04-01T14:32:32Z","snapshot_observed_at":"2026-08-18T01:32:14.481050Z","submitted_at":"2025-01-22T14:35:37Z","title":"S-KEY: Self-supervised Learning of Major and Minor Keys from Audio","version":2},"cited_work":{"arxiv_id":"2501.12907","doi":"10.48550/arxiv.2501.12907","metadata_source":"pith","pith_arxiv_id":"2501.12907","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"S-KEY: Self-supervised Learning of Major and Minor Keys from Audio","venue":"cs.SD","work_id":"ba1b139e-ff1c-4083-b7eb-2022537b8466","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.054010Z"},"links":{"cited_paper":"/paper/2501.12907","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:e9da40c2cc44c61b8effa68bcfea0077854c3b569194bfd10ea36552b0d3e2d0","observation_id":"087ed2f8-ff0b-42c0-9621-87e777581fd1","resolution":{"observed_at":"2026-08-16T00:28:27.873320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.496883Z","title":"MusiConGen : Rhythm and chord control for transformer-based text-to-music generation, 2024","venue":null,"work_id":"da9ccfab-de23-438d-9caf-cc3761f0471f","year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.057995Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:a940121755d99a44e61e9129fafcc9df43b1a1bdb0bcac45c5a18174f1af0593","observation_id":"b2498062-495e-42dc-b035-261bd7866921","resolution":{"observed_at":"2026-08-16T00:28:29.501593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.338481Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training , June 2026","venue":null,"work_id":"fbc3b1e0-984e-48e1-891a-cf6058a77d70","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.062323Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:0587cec0a5552536977e44ca43426f33062218a1ccce70b4a175bdf7e71ccae4","observation_id":"373bf2f6-651c-477c-a17e-1b3e026d191b","resolution":{"observed_at":"2026-08-16T00:28:29.397572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.177795Z","title":"MusicEval : A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation , March 2025","venue":null,"work_id":"2c5943ca-eef8-4042-9209-f4e4fceec80c","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.111878Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:eb184f4e5d1023610fba461ddf6ce3c8fbf46f5abac8334bc35589045acbb82d","observation_id":"193efec9-9939-4bbd-a7bd-1d156b5b252f","resolution":{"observed_at":"2026-08-16T00:28:29.251069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.140271Z","title":"MuseCoco : Generating Symbolic Music from Text , May 2023","venue":null,"work_id":"33ce3339-0a87-4cef-b7f3-47fe72b3a6d3","year":2023},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.250537Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:95615e8b2305becd5d6097c3448046241ec9cde2620354dd1c723c8c70aab408","observation_id":"041a9299-b036-4efc-9332-45bac6ca7dc1","resolution":{"observed_at":"2026-08-16T00:28:29.144617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.126875Z","title":"CMI-Bench : A Comprehensive Benchmark for Evaluating Music Instruction Following , June 2025","venue":null,"work_id":"9fd5e45e-1858-45ad-938f-41bab3aa7ce4","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.354980Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:2a903832c482b399b1f3693032434582eced995d416bbd7ce58c483c4ee4782c","observation_id":"38fb4f0e-b9c7-44d1-8658-287f86c21660","resolution":{"observed_at":"2026-08-16T00:28:29.131106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.113640Z","title":"GTZAN-Rhythm : Extending the GTZAN test-set with beat, downbeat and swing annotations","venue":null,"work_id":"4e866457-c98f-43dc-a9da-312928d8aec6","year":2015},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.367529Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:07dbb88c7724becdd897d918fb2969c597921861da287257d7fd237bf19273ae","observation_id":"bc7d5d78-4b85-4108-b016-76c2555faf66","resolution":{"observed_at":"2026-08-16T00:28:29.117742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.100927Z","title":"Mustango: Toward Controllable Text-to-Music Generation , June 2024","venue":null,"work_id":"656ca720-9266-493e-bb03-8076c5e06b40","year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.371944Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:a90d737fab88d6e4375c03d1d424ee242709a03fbc7a4b49880dbce3df9b58ff","observation_id":"bae363d7-b273-4d8c-a480-5cae0820101e","resolution":{"observed_at":"2026-08-16T00:28:29.105018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.087237Z","title":"Genre-specific key profiles","venue":null,"work_id":"4aa52bf2-3872-499b-aa13-100edef3faf9","year":2015},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.375932Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:d590721c0d4b8ea21279c4b6bae4e8406a8bbd41f4139be403adea487aea938f","observation_id":"158ddff2-d311-40c5-accb-5fe599f06154","resolution":{"observed_at":"2026-08-16T00:28:29.091795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.071689Z","title":"Humphrey, Justin Salamon, Oriol Nieto, Dawen Liang, and Daniel P","venue":null,"work_id":"bc20474a-4acf-4bda-ab02-297db886bdaa","year":2014},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.381075Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:8ccfa6651306da9bbcdcfcc5494adc670066f0edf1dec9ba01f6d4cf43c586da","observation_id":"388dd3f3-e260-40c1-9815-c7e6691c98f6","resolution":{"observed_at":"2026-08-16T00:28:29.076735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.058244Z","title":"Beyond accuracy: Behavioral testing of NLP models with CheckList","venue":null,"work_id":"ba789166-37cd-45d5-a72e-0c72d4ac1b6e","year":2020},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.385941Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:d6a33b27b8360a2676b4cb550e90fb6c12a5cf38bc7b214e0b78a106a2aa662c","observation_id":"594cbda2-64ab-42f4-860a-1ac7983ea9f1","resolution":{"observed_at":"2026-08-16T00:28:29.062481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.1461","last_updated":"2013-06-07T16:57:39Z","snapshot_observed_at":"2026-08-16T01:06:52.373567Z","submitted_at":"2013-06-06T16:30:44Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.1461","snapshot_observed_at":"2026-08-16T00:28:27.391018Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.391018Z"},"links":{"cited_paper":"/paper/1306.1461","citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:1beb9dd68e8ba5a7b2cde8ce66e077db2d44190c8820a6bc6933dcee8fd26b2b","observation_id":"31ad490c-df38-41ed-b1bf-e6ca8cebe65f","resolution":{"observed_at":"2026-08-16T00:28:27.391018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:29.043944Z","title":"FIGARO : Generating Symbolic Music with Fine-Grained Artistic Control , February 2024","venue":null,"work_id":"f46da55b-c9bb-41ef-8438-fa5a92be668a","year":2024},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.395458Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:a82ea69ecffac62ab1d65c7f25859ca347e4d7f85a1829ae40debe45c6414da0","observation_id":"32059aa9-efa1-424d-9801-40201cd7a5a9","resolution":{"observed_at":"2026-08-16T00:28:29.048500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.979450Z","title":"MuseMorphose : Full-Song and Fine-Grained Piano Music Style Transfer with One Transformer VAE , December 2022","venue":null,"work_id":"f38825e7-8dca-4b3c-8a11-42a79a4dc6d8","year":2022},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.399811Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:058633d082039aa9e83dcf8e16edd64bf16dbae99d1442231436deab172d9a82","observation_id":"db0ac36a-4f63-45cb-add7-7252d4743935","resolution":{"observed_at":"2026-08-16T00:28:29.033954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.893835Z","title":null,"venue":null,"work_id":"0167f083-f4a8-4e8c-a885-e59560f0dec8","year":2023},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.404349Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:13630164b88de6019f4dd0177da0028ca623b07b2ac0fd26cb905026bcc1a6cb","observation_id":"c8b97a66-e4bc-4ce3-b12b-eb5c19e5308f","resolution":{"observed_at":"2026-08-16T00:28:28.922944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.843525Z","title":null,"venue":null,"work_id":"8442bb20-14cb-4243-939a-c831066daf15","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.409664Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:4dae8f1f25a1e16669e041f66442e79075df1e12faf57bca1cf48c4a0cb05650","observation_id":"6ff3f0ad-f5d8-4b08-9451-3405a5246e9c","resolution":{"observed_at":"2026-08-16T00:28:28.867279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.828755Z","title":"SongEval : A Benchmark Dataset for Song Aesthetics Evaluation , May 2025","venue":null,"work_id":"5aa3dfc5-6116-4f95-84a4-e2f540c56998","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.462374Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:8d3d3e11a40edbf839f86ebf9980be4efad232b37ad770a61a03693ee71a29ab","observation_id":"aa3307b1-d2b0-4a0d-8a6b-2d4a083e39b6","resolution":{"observed_at":"2026-08-16T00:28:28.833294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.814428Z","title":"YuE : Scaling Open Foundation Models for Long-Form Music Generation , September 2025","venue":null,"work_id":"20b0c039-e13c-4b7e-854c-8c59e98720c9","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.539810Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:8d1b0adc5aa589ab15962eb719be61fd2ceaebbc86008422f88be4cf87883ed7","observation_id":"f8da1bb1-e90b-4a19-8230-023b91214fd1","resolution":{"observed_at":"2026-08-16T00:28:28.819312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.800338Z","title":"ABC-eval : Benchmarking large language models on symbolic music understanding and instruction following, 2025","venue":null,"work_id":"9850d556-ac55-4bd8-b2ee-96c7d830f928","year":2025},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.656813Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:6da986144ef4a6928771decf8e7a2018b05a9ba895aba857f62bc4bddfdf4956","observation_id":"ba977370-faf3-420e-a08c-d37c6d8995f1","resolution":{"observed_at":"2026-08-16T00:28:28.804967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:28:28.783750Z","title":"TPSMG : Text-Controllable Polyphonic Symbolic Music Generation","venue":null,"work_id":"8bbce6b4-707f-4217-af5b-380b73f5186f","year":2026},"citing_paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:28:27.726082Z"},"links":{"citing_paper":"/paper/2608.11899"},"observation_digest":"sha256:689a87059a656bd8dbce4481d2c6bca16388a62366c460d6dfdb97c0b760999c","observation_id":"48b8c151-d3ac-4ca6-93c3-5196891bb1fb","resolution":{"observed_at":"2026-08-16T00:28:28.788155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11899","last_updated":"2026-08-12T10:25:17Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T00:34:35.215078Z","submitted_at":"2026-08-12T10:25:17Z","title":"Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":27},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.11899."}