{"as_of":"2026-08-10T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8814d923b40a3139133d03581de625f96f5a27742bf4c56e83e9e73aad957d6","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:54:23.104469Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05222/citation-record","integrity":"/paper/2608.05222/integrity","json":"/paper/2608.05222/citation-record.json","paper":"/paper/2608.05222"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-08T17:54:22.857355Z","title":"Bar-Tal, O.; Chefer, H.; Tov, O.; Herrmann, C.; Paiss, R.; Zada, S.; Ephrat, A.; Hur, J.; Li, Y .; Michaeli, T.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.857355Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:5e06d9db1160cc7c87c3a5fdd98443167b343a1a9b2528f182b62c9b2656d2fa","observation_id":"a6515c44-4ef2-4503-b7bd-b62dc5b0f1e6","resolution":{"observed_at":"2026-08-08T17:54:22.857355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T17:54:22.867787Z","title":"Chen, K.; Wu, Y .; Liu, H.; Nezhurina, M.; Berg-Kirkpatrick, T.; and Dubnov, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.867787Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:385aed2170fe7a3875292ade5e0fbd27ce3d74090b8bfece3fe6969934cda768","observation_id":"4f43d365-518a-40f4-84b4-30d389fc9897","resolution":{"observed_at":"2026-08-08T17:54:22.867787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:54:23.535194Z","title":"InICASSP 2024-2024 IEEE Interna- tional Conference on Acoustics, Speech and Signal Process- ing (ICASSP), 1206–1210","venue":null,"work_id":"3fae719b-d788-4ce8-ba51-9a52da374e13","year":2024},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.873016Z"},"links":{"citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:f6ab84045109fa2cf7b111ea06565bff13cdf3ceb1629edbaea8d7982e523b1d","observation_id":"273693a8-f2cf-469e-9228-d62a582ed790","resolution":{"observed_at":"2026-08-08T17:54:23.539916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:54:23.519684Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 1–5","venue":null,"work_id":"7c1e0de9-2523-4df7-a733-563cdb3c981b","year":2023},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.887371Z"},"links":{"citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:8a102d27099ff51519ef929aab3965c32b6932854ddaf632e1afda7a022d9f0b","observation_id":"e1d1ea82-7ed2-438b-92db-8fe2228288cb","resolution":{"observed_at":"2026-08-08T17:54:23.524635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-10T07:59:31.427201Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-08T17:54:22.891858Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 1–5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.891858Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:eca2780faacc1e70f964b3b7427aff3590824071b4f4e258b8b9e6e0b39aa617","observation_id":"ae39f69c-a169-4759-b809-9e29a31f997f","resolution":{"observed_at":"2026-08-08T17:54:22.891858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T17:54:22.896826Z","title":"Ho, J.; Jain, A.; and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.896826Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:fdcc806391b4faac9339a4d6a34737ab6bbd7d9ed5b308edca82bada1281289e","observation_id":"105e8c7f-b948-40ec-9d5a-68954b12baaa","resolution":{"observed_at":"2026-08-08T17:54:22.896826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-08T17:54:22.901792Z","title":"Huang, Q.; Jansen, A.; Lee, J.; Ganti, R.; Li, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.901792Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:83036f9f439a4352ec55436cdece09639e683664b375bae699e18d636bb5e218","observation_id":"cc7317ee-6fd8-49ca-b85c-d9dc23da835f","resolution":{"observed_at":"2026-08-08T17:54:22.901792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-08T17:54:22.907977Z","title":"Hung, H.-T.; Ching, J.; Doh, S.; Kim, N.; Nam, J.; and Yang, Y .-H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.907977Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:ecec596ee63cb1251b1b470a96650593eaea27089a6b4f2edd2270e867c90119","observation_id":"4f81140f-afe0-49b6-8345-0031d08cab2b","resolution":{"observed_at":"2026-08-08T17:54:22.907977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07532","last_updated":"2024-01-15T08:41:01Z","snapshot_observed_at":"2026-08-09T05:43:24.920401Z","submitted_at":"2024-01-15T08:41:01Z","title":"Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation","version":1},"cited_work":{"arxiv_id":"2401.07532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07532","snapshot_observed_at":"2026-08-08T17:54:23.311411Z","title":"Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation","venue":"cs.SD","work_id":"c5183e0d-89db-455a-87e7-a6c64d285c88","year":2024},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.922897Z"},"links":{"cited_paper":"/paper/2401.07532","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:b84b47be610eb3b6d76d7900676c1b8a89e23745dba716a12f16a31269335bed","observation_id":"05672a3b-b744-4038-b8c4-c0a1684da041","resolution":{"observed_at":"2026-08-08T17:54:23.318894Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05448","last_updated":"2022-09-16T08:05:37Z","snapshot_observed_at":"2026-08-10T03:33:35.451984Z","submitted_at":"2022-05-10T13:08:49Z","title":"Symphony Generation with Permutation Invariant Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05448","snapshot_observed_at":"2026-08-08T17:54:22.927741Z","title":"Lu, P.; Xu, X.; Kang, C.; Yu, B.; Xing, C.; Tan, X.; and Bian, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.927741Z"},"links":{"cited_paper":"/paper/2205.05448","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:56c28ee51bd31dcb500c47b5897398295458c058bbdca6eb2d060e9e6f8ee4b1","observation_id":"c39156a9-052c-4d01-a835-1c5b26ce463e","resolution":{"observed_at":"2026-08-08T17:54:22.927741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-09T18:00:01.545485Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-08T17:54:22.950607Z","title":"arXiv preprint arXiv:2306.00110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.950607Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:c9979b43d039a7acbd8a5d5eea37eead7f4efc31e3cc72fd4aba9ba2e5cc5c01","observation_id":"af262a4d-1262-4886-a43d-acd0802b97e5","resolution":{"observed_at":"2026-08-08T17:54:22.950607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08355","last_updated":"2024-06-03T07:56:23Z","snapshot_observed_at":"2026-08-06T19:39:54.540216Z","submitted_at":"2023-11-14T17:54:38Z","title":"Mustango: Toward Controllable Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08355","snapshot_observed_at":"2026-08-08T17:54:22.979881Z","title":"Min, L.; Jiang, J.; Xia, G.; and Zhao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.979881Z"},"links":{"cited_paper":"/paper/2311.08355","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:89519ad30aa02d255f67ad480d16960f1b2152f0d79de68f938dc7d80d91adc7","observation_id":"8fc956f7-7bdc-42f8-9c5b-bb93f9cf7fbc","resolution":{"observed_at":"2026-08-08T17:54:22.979881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10304","last_updated":"2023-07-19T06:36:31Z","snapshot_observed_at":"2026-07-06T15:56:03.875184Z","submitted_at":"2023-07-19T06:36:31Z","title":"Polyffusion: A Diffusion Model for Polyphonic Score Generation with Internal and External Controls","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10304","snapshot_observed_at":"2026-08-08T17:54:23.032198Z","title":"Mittal, G.; Engel, J.; Hawthorne, C.; and Simon, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.032198Z"},"links":{"cited_paper":"/paper/2307.10304","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:22be9240521c3be54bfdd5469c8b3ecf13529807f1af6f512c6f86535636f707","observation_id":"50bc3d6e-8142-479c-bc00-ec77c11e1c30","resolution":{"observed_at":"2026-08-08T17:54:23.032198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16091","last_updated":"2021-11-25T19:58:39Z","snapshot_observed_at":"2026-08-04T23:36:11.662435Z","submitted_at":"2021-03-30T05:48:05Z","title":"Symbolic Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16091","snapshot_observed_at":"2026-08-08T17:54:23.055772Z","title":"M¨uller-Franzes, G.; Niehues, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.055772Z"},"links":{"cited_paper":"/paper/2103.16091","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:4bc10472be309290efaae7aa9cccf3569ae93ff1b39e3a84389a4931d2de991c","observation_id":"7ae14d82-eb1b-4d0b-bd1e-92bb6d562f48","resolution":{"observed_at":"2026-08-08T17:54:23.055772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T17:54:23.080284Z","title":"Raffel, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.080284Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:3ec9d59612d0be4830657a6dc845bb0c014d0b98cd6e74ff27c572cf8f4656f5","observation_id":"3177bb59-396d-4118-8ae3-b8ca441ec781","resolution":{"observed_at":"2026-08-08T17:54:23.080284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-08T17:54:23.085526Z","title":"Van Den Oord, A.; Vinyals, O.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.085526Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:4fb2c6b337cd7215f51b287947a2299776d1de58e1e07020cf1b78f095431beb","observation_id":"81e39820-6994-451f-99b8-a8c7a942db3b","resolution":{"observed_at":"2026-08-08T17:54:23.085526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09901","last_updated":"2024-05-16T08:48:23Z","snapshot_observed_at":"2026-08-10T07:04:29.029428Z","submitted_at":"2024-05-16T08:48:23Z","title":"Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09901","snapshot_observed_at":"2026-08-08T17:54:23.094990Z","title":"Wu, S.; and Sun, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.094990Z"},"links":{"cited_paper":"/paper/2405.09901","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:170a5f9008157ff478d7692bdea2c77f20130333ce3a973aa42f2fb0ff75140b","observation_id":"44d78cd7-78f1-4711-9823-c20a555e641b","resolution":{"observed_at":"2026-08-08T17:54:23.094990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11216","last_updated":"2023-01-04T01:06:19Z","snapshot_observed_at":"2026-07-06T14:20:58.769163Z","submitted_at":"2022-11-21T07:19:17Z","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11216","snapshot_observed_at":"2026-08-08T17:54:23.099837Z","title":"Zeghidour, N.; Luebs, A.; Omran, A.; Skoglund, J.; and Tagliasacchi, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.099837Z"},"links":{"cited_paper":"/paper/2211.11216","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:531485058208beae0b3643798fd78d5dc733e5c078aeab494ee62b375104fe7a","observation_id":"3571aefe-3462-4d1a-8a65-1b5a2c7edae0","resolution":{"observed_at":"2026-08-08T17:54:23.099837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-07-06T17:13:17.263599Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-08T17:54:23.104469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.104469Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:0e38e1863dd03fdded4296af87cc883431db642a3e6dc0936f6fcbe77792ff56","observation_id":"663438e4-e295-4e3d-851e-943b5c9e488a","resolution":{"observed_at":"2026-08-08T17:54:23.104469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T17:54:22.918152Z","title":"Lin, Z.; Chen, J.; Tang, B.; Sha, B.; Yang, J.; Ju, Y .; Fan, F.; Kang, S.; Wu, Z.; and Meng, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.918152Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:76598590da8e67b6635279a2c6c6a23617bfccbfcd5335972e725c79d79aad44","observation_id":"92bf661a-9c73-41c0-ab1e-0979609781d1","resolution":{"observed_at":"2026-08-08T17:54:22.918152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:54:22.882276Z","title":"Dong, H.-W.; Chen, K.; Dubnov, S.; McAuley, J.; and Berg-Kirkpatrick, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.882276Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:c07ca1ac1bbb8c2fdf90a9d76bbf9f0818f6e26fe1e7c6ab15cf1797ee64fa10","observation_id":"70069825-e6b9-4023-bce2-8e464c80c663","resolution":{"observed_at":"2026-08-08T17:54:22.882276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07142","last_updated":"2020-08-17T08:08:14Z","snapshot_observed_at":"2026-08-06T03:13:15.423488Z","submitted_at":"2020-08-17T08:08:14Z","title":"POP909: A Pop-song Dataset for Music Arrangement Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07142","snapshot_observed_at":"2026-08-08T17:54:23.090051Z","title":"Wang, Z.; Min, L.; and Xia, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:23.090051Z"},"links":{"cited_paper":"/paper/2008.07142","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:77abe76375d735acc45f41b3308fb29bf6852193ea847e38e0b9c39bd0321aa4","observation_id":"e8e6da20-9c3e-400e-8201-e5f354deb0db","resolution":{"observed_at":"2026-08-08T17:54:23.090051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01374","last_updated":"2021-08-03T08:59:26Z","snapshot_observed_at":"2026-07-06T11:35:04.274714Z","submitted_at":"2021-08-03T08:59:26Z","title":"EMOPIA: A Multi-Modal Pop Piano Dataset For Emotion Recognition and Emotion-based Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01374","snapshot_observed_at":"2026-08-08T17:54:22.913422Z","title":"arXiv preprint arXiv:2108.01374","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.913422Z"},"links":{"cited_paper":"/paper/2108.01374","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:27492a4431c12d94e0e83d2f4b38d30cac929af505b1a77e36e2e892232c5cbc","observation_id":"6fec1bb8-bd79-4231-b913-453677663ad7","resolution":{"observed_at":"2026-08-08T17:54:22.913422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-08T17:54:22.877436Z","title":"Devlin, J.; Chang, M.-W.; Lee, K.; and Toutanova, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.877436Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:03b89289800c16edfead1f411fcbdc69db7ff2ea883bd5af09273192add78210","observation_id":"90a167dd-addb-4891-94d6-4db58d9af18d","resolution":{"observed_at":"2026-08-08T17:54:22.877436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:54:22.839229Z","title":"Agostinelli, A.; Denk, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.839229Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:b0b8d35d1236d950d04ec803fe83cc330e70a83f720b2308be870e5e5e9496d7","observation_id":"43418b24-ca96-4809-ab7f-55dae6a259ec","resolution":{"observed_at":"2026-08-08T17:54:22.839229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-08T17:54:22.862705Z","title":"Blattmann, A.; Dockhorn, T.; Kulal, S.; Mendelevitch, D.; Kilian, M.; Lorenz, D.; Levi, Y .; English, Z.; V oleti, V .; Letts, A.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.862705Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:2fb1e3e22abffb92f2a06173f1842af8e300c5418d022082aa1989f821a1c7a4","observation_id":"16343409-1236-4d50-895e-c0f0a44e432c","resolution":{"observed_at":"2026-08-08T17:54:22.862705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T23:10:19.537039Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2608.05222."}