{"as_of":"2026-08-13T00:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d8eace6f607ddccbb9f082cbb33e221b054c494643e738af02bc1e51026da3b","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:12:25.051290Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T03:24:50.604019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T03:25:58.959457Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"cited_work":{"arxiv_id":"2506.08570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08570","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-regressive vs flow-matching: a comparative study of modeling paradigms for text-to-music generation.arXiv preprint arXiv:2506.08570","venue":null,"work_id":"dfc1954c-d746-49b3-b031-0a0784dda031","year":null},"citing_paper":{"arxiv_id":"2605.22717","last_updated":"2026-05-21T16:54:07Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:54:07Z","title":"Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T03:24:50.604019Z"},"links":{"cited_paper":"/paper/2506.08570","citing_paper":"/paper/2605.22717"},"observation_digest":"sha256:eff5aa73eff2924c4e895a392a301936f1dd7060d675a149d2f407cb7cd66d60","observation_id":"f4742ac3-e44c-4d1c-98b7-df88847bfe8f","resolution":{"observed_at":"2026-05-22T03:25:58.963026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08570/citation-record","integrity":"/paper/2506.08570/integrity","json":"/paper/2506.08570/citation-record.json","paper":"/paper/2506.08570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-12T18:49:23.347422Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T05:12:24.497950Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.497950Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:378ec3d4a05a0ad3704bfe28b6ca23eb09c73b9080f8ad1e0e6ae955b4a9aba9","observation_id":"0096660f-871f-4f0e-9921-735bdbe7c9b1","resolution":{"observed_at":"2026-08-07T05:12:24.497950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.372102Z","title":"To better isolate the runtime overheads, we discard cross attention layers (that can’t use KV-cache) and replace the AR softmax + top-p sampling with argmax sampling","venue":null,"work_id":"42c4fc67-d257-4e6f-9272-0692e4fb2bb5","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.051290Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:78a70d74514f280d58d13ed931b5a818cbe3912d32b1a0c6f22a58b72dcfffad","observation_id":"69a424d1-a53f-4f37-ae08-1898b22aa4ec","resolution":{"observed_at":"2026-08-07T05:12:26.383222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T05:12:24.578248Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.578248Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:6189c7766232aef55c522ee9b3aab03079984303dc5ab20a72a3e4144ce1b324","observation_id":"cc849a7e-e830-490c-8dbf-f0b1f2038b41","resolution":{"observed_at":"2026-08-07T05:12:24.578248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-07T05:12:24.591213Z","title":"Juke- box: A generative model for music.arXiv preprint arXiv:2005.00341,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.591213Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:d512155f1df47e630db93d0acdf9e650e7899c5bff60b485474f7b12b8d52a62","observation_id":"370594a1-d1f5-4a9a-ac07-984436ba69ac","resolution":{"observed_at":"2026-08-07T05:12:24.591213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04930","last_updated":"2016-06-15T19:38:14Z","snapshot_observed_at":"2026-08-09T03:27:36.053875Z","submitted_at":"2016-06-15T19:38:14Z","title":"Deep Learning for Music","version":1},"cited_work":{"arxiv_id":"1606.04930","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.04930","snapshot_observed_at":"2026-08-07T05:12:26.098842Z","title":"Deep Learning for Music","venue":"cs.LG","work_id":"6636282c-54fa-4247-85cc-3e3dfddd67b0","year":2016},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.628168Z"},"links":{"cited_paper":"/paper/1606.04930","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:84211ff51457bb27ecd9b7fdb0eb423e969d7adfb68fb274b36c89f1f594c5f7","observation_id":"ee8b33c5-403e-4093-ab81-1975daca5ff6","resolution":{"observed_at":"2026-08-07T05:12:26.108926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-07T05:12:24.675049Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algorithms.arXiv preprint arXiv:1812.08466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.675049Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:f26b95869bcd86aa33e93de51459e2578a662362c98c92a22c062c149548bfb7","observation_id":"e1e0b60a-add0-4290-9c89-987a37e75f8d","resolution":{"observed_at":"2026-08-07T05:12:24.675049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-08-12T23:29:06.235656Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-07T05:12:24.684386Z","title":"High fidelity text-guided music editing via single-stage flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.684386Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:a4af9053e986eff2dd6151c21bd4f1621a74ba5074231cf86d0879cf8bde74e0","observation_id":"344845c2-e6e4-484d-ad1c-2d00f9e4bc5e","resolution":{"observed_at":"2026-08-07T05:12:24.684386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12796","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:25.821326Z","title":"A survey on cross-modal interaction between music and multimodal data.arXiv preprint arXiv:2504.12796,","venue":null,"work_id":"eaaaaa4d-8970-47df-b833-4e32937e2e06","year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.701724Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:524fb214c6a0c1f2e3055b18d48779e699c379a313fdc50fb8df50421195945d","observation_id":"b4c3981d-e8dc-4eef-99ac-37f248a70e58","resolution":{"observed_at":"2026-08-07T05:12:25.845961Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T05:12:24.715076Z","title":"Flowmatchingguideandcode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.715076Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:94db5dba5413e1ee21d6aee70d3af50b8ae6ac4a57951f37288a4aec4da83234","observation_id":"a865798b-639b-42b2-b9ac-b4fa0f017fc4","resolution":{"observed_at":"2026-08-07T05:12:24.715076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:12:24.725538Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.725538Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:40e05d54c762200908017a364fcee7ffcb31ba5e18c02bd17fa6f5665c7091e1","observation_id":"747f30dd-9cd3-4e9b-9666-bfeba7dd8d19","resolution":{"observed_at":"2026-08-07T05:12:24.725538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.780419Z","title":"Mir_eval: Atransparentimplementationofcommonmirmetrics","venue":null,"work_id":"5019a688-18cd-4023-a9f1-231a25766b50","year":2014},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.757852Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:d9f61c3b944f00337deab209c5368127fc576bd925d2dd03a87ed4f6a4cd8f1e","observation_id":"60b6d1a4-2957-473e-ab9c-0cd06e8b607f","resolution":{"observed_at":"2026-08-07T05:12:26.802705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07461","last_updated":"2025-05-16T07:57:01Z","snapshot_observed_at":"2026-08-10T16:53:15.171191Z","submitted_at":"2025-02-11T11:12:19Z","title":"JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07461","snapshot_observed_at":"2026-08-07T05:12:24.775106Z","title":"Jamendomaxcaps: A large scale music- caption dataset with imputed metadata.arXiv:2502.07461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.775106Z"},"links":{"cited_paper":"/paper/2502.07461","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:c7bc5afdb54da856c11ad1ac8c4d67033ebf99d6376ba3493a099dfa7e5795e7","observation_id":"52b54cc5-0bbf-4d3a-a748-68c7a2994cbb","resolution":{"observed_at":"2026-08-07T05:12:24.775106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:12:24.798822Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.798822Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:1724730967e2db3ad3522f29f2c03ccd1a27b9f003550895144ad2571f68aa61","observation_id":"e155b3ba-2f58-472d-b99e-8182c9ac2f55","resolution":{"observed_at":"2026-08-07T05:12:24.798822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10970","last_updated":"2024-06-16T15:06:06Z","snapshot_observed_at":"2026-08-12T23:41:43.708838Z","submitted_at":"2024-06-16T15:06:06Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10970","snapshot_observed_at":"2026-08-07T05:12:24.814309Z","title":"Joint audio and symbolic conditioning for temporally controlled text-to-music generation.arXiv preprint arXiv:2406.10970,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.814309Z"},"links":{"cited_paper":"/paper/2406.10970","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:b931eb346d61943848f9d88583ed8ef8cc22832ddec22012735d2d3b6cb5750c","observation_id":"af9cee56-48e0-4d39-bfeb-37e3996fa753","resolution":{"observed_at":"2026-08-07T05:12:24.814309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T05:12:24.833982Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound.arXiv preprint arXiv:2502.05139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.833982Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:73371b64d59eadea4e014bf06439028a7269b8fff0dbbb4a30b3972e34c3a084","observation_id":"75b82d8c-b7c3-4758-8eaa-cfd69bf3107b","resolution":{"observed_at":"2026-08-07T05:12:24.833982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T05:12:24.856067Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.856067Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:3f5f4c65030e96d60d83b80a2767f16a3fe70fb682357ffad59addd28d1c9217","observation_id":"25c4f62d-2778-41f1-879b-66735e0cfc0f","resolution":{"observed_at":"2026-08-07T05:12:24.856067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12982","last_updated":"2023-08-24T00:49:08Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T00:49:08Z","title":"A Survey of AI Music Generation Tools and Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12982","snapshot_observed_at":"2026-08-07T05:12:24.890167Z","title":"A survey of ai music generation tools and models.arXiv preprint arXiv:2308.12982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.890167Z"},"links":{"cited_paper":"/paper/2308.12982","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:b44ac37bf8ebfe181776c6f2d205bdb8251565f7fcb04e9655af93cea7fc1497","observation_id":"b743b388-2dad-45b3-bd29-672b2f5f2ae2","resolution":{"observed_at":"2026-08-07T05:12:24.890167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.670422Z","title":null,"venue":null,"work_id":"9438d4e9-6ad1-40ed-9c93-aa555a4e3253","year":2019},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.918290Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:31764a5f21ff77de1ebec249eb210fbf30ab3fbb07b265bb3be5205718fcda85","observation_id":"fd73db9a-cc4e-4996-90eb-03eeac81a52b","resolution":{"observed_at":"2026-08-07T05:12:26.692444Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.629727Z","title":null,"venue":null,"work_id":"962b43b5-233b-4493-af74-265f5984a216","year":2023},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.939938Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:aa21bf3d753235ed3f21e826420a87e0111d7f71eb3a3b2412cea71d5b20cbd6","observation_id":"35b49900-877d-406a-bf71-a2e165185c05","resolution":{"observed_at":"2026-08-07T05:12:26.643915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.560526Z","title":null,"venue":null,"work_id":"3d8d7ddc-9e9d-41bd-aa12-5d33f8081eca","year":2023},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.955669Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:f6c030174ba4ce2bcc5f1a2ba42447644a5809bf8b0174d2091c8d7bba01a9fe","observation_id":"2d11e0b4-b15c-4bfb-8a92-e6cd1ba13de7","resolution":{"observed_at":"2026-08-07T05:12:26.569331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.506123Z","title":"For the FM case we perform slight modifications similarly to Tal et al","venue":null,"work_id":"98a2a2d8-85eb-44bf-9cb6-24ae16537e21","year":2024},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.986929Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:5b8db0bcd4fb1f78488f3487dab7c4ca1c5c840436111d736929226f7969dcad","observation_id":"230ad7ee-db56-41a6-a5a7-9b06867879e7","resolution":{"observed_at":"2026-08-07T05:12:26.530464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.469864Z","title":null,"venue":null,"work_id":"d33b8378-1b9b-43fe-9ab1-86d9523aae98","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.011025Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:ca53744f4daf385720d5266204998e6e9ce313cd441297e966f215a6225b61a3","observation_id":"35324411-32cd-42e8-a34a-27769c5d90fb","resolution":{"observed_at":"2026-08-07T05:12:26.479577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.425240Z","title":null,"venue":null,"work_id":"42e14f2a-c100-49d4-9501-690757e9884b","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:25.036504Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:d30f529c56493577ae06454009d785d89c21a51062f56d200d3b22d4b1e857f7","observation_id":"ac83068b-dee0-47ce-84b0-4728fa2bd53c","resolution":{"observed_at":"2026-08-07T05:12:26.436932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:12:24.749224Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1956,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.749224Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:4e827230ecb64af30062b4683a7de5bec2bb2c54d376c00985310e9cd2ab11cd","observation_id":"8a376d8f-dff3-419e-b723-7df51cba5bc3","resolution":{"observed_at":"2026-08-07T05:12:24.749224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.934203Z","title":"Stable audio open","venue":null,"work_id":"046b424b-ed5c-4c76-8ea1-eaaf7ac9f993","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1980,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.619879Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:8cbd4270fc453124cb385d6affcde84e8f4186a570a1a4d4575aaa4a5411be6a","observation_id":"4a873016-ce04-4310-9b0b-526ff1f98f07","resolution":{"observed_at":"2026-08-07T05:12:26.942927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.841615Z","title":"Tunes by technology: A comprehensive survey of music generation models","venue":null,"work_id":"0cdc5d33-3d16-4e72-8284-41e81d95bb4d","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.735028Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:94daff201910bb6c7c3f09666975dcc573e4878d8d73033f095fff575e4fc335","observation_id":"4fbd030f-8a32-41c1-916e-4fdecd91854c","resolution":{"observed_at":"2026-08-07T05:12:26.853579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.04281","last_updated":"2018-12-12T07:42:08Z","snapshot_observed_at":"2026-08-07T03:41:05.212645Z","submitted_at":"2018-09-12T07:15:26Z","title":"Music Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.04281","snapshot_observed_at":"2026-08-07T05:12:24.636619Z","title":"Music transformer.arXiv preprint arXiv:1809.04281,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.636619Z"},"links":{"cited_paper":"/paper/1809.04281","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:6224dad2da28170a8b182a186f1f1b3ffd8b34084902495a89624b95a16dcaee","observation_id":"ee0fecb6-e207-444f-b1c4-9e39593473b6","resolution":{"observed_at":"2026-08-07T05:12:24.636619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:27.071793Z","title":"The mtg-jamendo dataset for automatic music tagging","venue":null,"work_id":"4e16f480-97b2-4aeb-9463-a3f4ede71ff0","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.549802Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:a39aa5765d938ecfeaa5502026d26567e08ba1e04dd56a5af7e8f63619f7a3d8","observation_id":"0a55a77b-6190-4eab-be90-4d7ff5b80664","resolution":{"observed_at":"2026-08-07T05:12:27.081904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.894232Z","title":"Multiplicity of periodic bouncing solutions for generalized impact hamiltonian systems","venue":null,"work_id":"7c03b585-b255-4b09-9bff-607f903b0bcb","year":2019},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.647739Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:f0e38dbc165be2d5d3258a84d9b869ff06fbb0cf7c0960477e356acb5ea85a4a","observation_id":"19943c2b-d312-4f37-9e10-a8caf964091b","resolution":{"observed_at":"2026-08-07T05:12:26.910768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-07T05:12:24.656553Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.656553Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:1ecda979b60785a91deece5b5e7808c2cb4a16c2ba23dd6766283e0e4b2b2f58","observation_id":"2e992f79-4caa-4c9e-aa50-0cc9b025c4c8","resolution":{"observed_at":"2026-08-07T05:12:24.656553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.974076Z","title":"Evolving four-part harmony using genetic algorithms","venue":null,"work_id":"af6d93c6-4ec5-4b54-9c14-8557292b408b","year":2011},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.609093Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:3a6b4f1bdbe370c601ca199684ada631f156ebc8a106ae633e31e996eff9c23a","observation_id":"f6cbd517-15d6-4400-a060-15b086c1985c","resolution":{"observed_at":"2026-08-07T05:12:26.986299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:26.735760Z","title":"Diffusion based text-to-music generation with global and local text based conditioning","venue":null,"work_id":"b6fad184-2e7c-41a4-934e-c8520ef674ef","year":2025},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.879929Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:e7a379dc5cb38abc24cd6bee4d5e5fd0885fe3d7b1affe04641b53104bbcfed1","observation_id":"4b52ea69-ea1e-4b7e-b709-0fc7df0892dd","resolution":{"observed_at":"2026-08-07T05:12:26.749384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:27.025920Z","title":"Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies","venue":null,"work_id":"2fa7d3f0-5265-48d7-bf4f-f650b6b2ed83","year":2024},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.564295Z"},"links":{"citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:29b2225c57e77a1b9360962cc2b24fb2305acb1b632b47b062938b4133401424","observation_id":"a4bb7886-d64a-4652-8fd2-e5d75db69fcb","resolution":{"observed_at":"2026-08-07T05:12:27.034096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09214","last_updated":"2024-09-19T07:14:20Z","snapshot_observed_at":"2026-08-12T22:45:10.680768Z","submitted_at":"2024-09-13T22:06:18Z","title":"Seed-Music: A Unified Framework for High Quality and Controlled Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09214","snapshot_observed_at":"2026-08-07T05:12:24.508703Z","title":"Seed-music: A unified framework for high quality and controlled music generation.arXiv preprint arXiv:2409.09214,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.508703Z"},"links":{"cited_paper":"/paper/2409.09214","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:ef122c59075eb86d3c7bacfbb5cbb7a108fb69ff02212e0041830a8f59cd0d88","observation_id":"ef892dfd-b6a2-4aa0-a236-cc5531a08de7","resolution":{"observed_at":"2026-08-07T05:12:24.508703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-12T15:32:23.741504Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-07T05:12:24.524083Z","title":"Efficient training of language models to fill in the middle.arXiv preprint arXiv:2207.14255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.524083Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:c1930cfb4c8815b6b4a98e266201f4879c6bfc1560c4f0fc7e4a8107164f4d6e","observation_id":"dbc930a7-8b00-45c3-a39e-40141b837bda","resolution":{"observed_at":"2026-08-07T05:12:24.524083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:12:24.845888Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.845888Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:ce10b537a99b93348ce0c06623950965444eadab0de79f5c0c4054cd242422a6","observation_id":"f45e2c57-cbdf-40fa-af9d-578c1bb6b4b8","resolution":{"observed_at":"2026-08-07T05:12:24.845888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.08570."}