{"as_of":"2026-08-10T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4be8ca5e42982ee1d8a76e58f2cfe8d74a2b81c8f535d848a499eb268a9cd083","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:02:24.400382Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:02:24.319848Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:02:24.469579Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"cited_work":{"arxiv_id":"2507.06674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06674","snapshot_observed_at":"2026-08-06T19:02:24.469579Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":"cs.SD","work_id":"48ee0520-fb34-4ba6-818b-c5cf3cca0ee5","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.319848Z"},"links":{"cited_paper":"/paper/2507.06674","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:0fe7b0f1dd87e4f7da3b33fa57d47bc29ce20e39ba6f1eec5434cc317eb917c5","observation_id":"00fb6b57-fae5-4d8d-8ec0-16a53675b20c","resolution":{"observed_at":"2026-08-06T19:02:24.474768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06674/citation-record","integrity":"/paper/2507.06674/integrity","json":"/paper/2507.06674/citation-record.json","paper":"/paper/2507.06674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.651885Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":null,"work_id":"17c592dc-a3ec-4baf-a209-21cc43f233dd","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.315970Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:1a3e22b3f906cb53dc280c8f912f3df864cfd93765cef7a2c5abe824d3d612cb","observation_id":"52ca52a8-ca71-4afe-bf4a-16e4c5b02055","resolution":{"observed_at":"2026-08-06T19:02:24.654861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"cited_work":{"arxiv_id":"2507.06674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06674","snapshot_observed_at":"2026-08-06T19:02:24.469579Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":"cs.SD","work_id":"48ee0520-fb34-4ba6-818b-c5cf3cca0ee5","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.319848Z"},"links":{"cited_paper":"/paper/2507.06674","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:0fe7b0f1dd87e4f7da3b33fa57d47bc29ce20e39ba6f1eec5434cc317eb917c5","observation_id":"00fb6b57-fae5-4d8d-8ec0-16a53675b20c","resolution":{"observed_at":"2026-08-06T19:02:24.474768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.643376Z","title":"We re-sample all the audio into 44.1kHz and convert them into mono audio, splitting the tracks into non-overlapping 30s clips with vo- cals removed by HTDemucs [3]","venue":null,"work_id":"0a1023b1-9c21-4f40-822e-c432e384954c","year":null},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.323872Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:e5e1546fd83dc289cd70fc2e5e1f110dc0e315e9fa8d6d815d1290d6b3d0ddfe","observation_id":"933e7d64-8e41-4ebb-b62c-3c85af3ace30","resolution":{"observed_at":"2026-08-06T19:02:24.646549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.634597Z","title":"Both FAD and KLD are lower the better, while CLAP is higher the better","venue":null,"work_id":"11b3a59f-423c-47a9-814d-617a7afcac9d","year":null},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.327623Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:87879084962b192819253e2a184a1cc87f08a34e5aa90d0a31b867e9a973c402","observation_id":"92e4a2a2-8d09-43d2-842a-bfbf43b85354","resolution":{"observed_at":"2026-08-06T19:02:24.638280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.625885Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"869faf93-8e9b-487b-96a9-7f4541e39235","year":2019},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.330769Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:28ac7e946f5a2ec8297015c3271b67cf426988c075990e999b78e4bbbbd1a726","observation_id":"67e548ea-689c-482e-8389-041b800fafdb","resolution":{"observed_at":"2026-08-06T19:02:24.629458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.617857Z","title":"The MTG-Jamendo Dataset for Automatic Music Tagging,","venue":null,"work_id":"b8e67ace-d817-45fe-b8e8-952e026331a9","year":2019},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.334460Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:988fed74aa1dbd0753614c2159681d1d4b64c1f3395fbb8632d4c477a06ab64a","observation_id":"c631407a-b575-4016-9edd-38cd09ccdec3","resolution":{"observed_at":"2026-08-06T19:02:24.620895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.609537Z","title":"Hybrid Trans- formers for music source separation,","venue":null,"work_id":"841fb611-2d0b-4905-a2b2-74f58ee3c868","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.337857Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:efecb1b764c8cdd25605d802c834685f366d1005be471d2395b08c03624276a5","observation_id":"00e27017-3956-4034-9a79-9e6083dc83e5","resolution":{"observed_at":"2026-08-06T19:02:24.612619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.599957Z","title":"LP-MusicCaps: LLM-based pseudo music captioning,","venue":null,"work_id":"43926ef9-57b4-4647-9159-b2547cfc48a4","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.340676Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:97f5d747d037128c3b2219a470900190ff5fbcf774ce6481edd52237316ba708","observation_id":"11f9d51f-5607-4a3d-842a-24024fa52584","resolution":{"observed_at":"2026-08-06T19:02:24.603686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:02:24.343931Z","title":"The LLaMA 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.343931Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:82fd8c0285e1b240399745a683f66deb0733c872c3249f1224cd59a097c9487d","observation_id":"598b522d-7970-4ceb-9cde-8c1f1bf82d13","resolution":{"observed_at":"2026-08-06T19:02:24.343931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.590933Z","title":"The Song De- scriber Dataset: a corpus of audio captions for music- and-language evaluation,","venue":null,"work_id":"9c183b6a-e1e0-49fb-a58b-09391bcfa599","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.347731Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:215699ab9a1f610ed5566539e05106f4b61b4e8ebde36abc2186ef5fbcd74845","observation_id":"b85630d5-8619-4ffd-9772-07fe6ea42ae6","resolution":{"observed_at":"2026-08-06T19:02:24.594043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.582458Z","title":"Scaling instruction-finetuned language mod- els,","venue":null,"work_id":"682855af-3814-4884-a7c8-c53b58990336","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.351332Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:a624807f49701379176af15d42f232d959eb58c32652269617281bbf4e1d05ee","observation_id":"000d75ce-3637-4739-b292-b75a829d140c","resolution":{"observed_at":"2026-08-06T19:02:24.585432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T19:02:24.354155Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.354155Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:9b0f55362855df82151076bfe3d3117929da334dae61585cedd7ceb4c59a184c","observation_id":"7277841f-9344-40b2-a704-6fb3e73b614d","resolution":{"observed_at":"2026-08-06T19:02:24.354155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.573578Z","title":"Transformers are SSMs: General- ized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"384d8958-3d75-49de-a06d-bc1a2fcb9ee6","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.357348Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:d723d9c50c1a65c87855ae002f88026a23ece244117d310960d01da0e380e499","observation_id":"30aec164-c4aa-49f2-b7c3-cb9b7ef8d4fc","resolution":{"observed_at":"2026-08-06T19:02:24.576707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15360","last_updated":"2024-04-24T18:19:21Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:22:56Z","title":"SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time series","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15360","snapshot_observed_at":"2026-08-06T19:02:24.360110Z","title":"SiMBA: Sim- plified mamba-based architecture for vision and multi- variate time series,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.360110Z"},"links":{"cited_paper":"/paper/2403.15360","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:7728bd72ae73d71a5b318c9d7446bbe5dbab578692563fbdca634d99f7763287","observation_id":"2e692a93-aa63-4c43-8af3-e2c6e037539c","resolution":{"observed_at":"2026-08-06T19:02:24.360110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.565198Z","title":"High-fidelity audio compression with im- proved RVQGAN,","venue":null,"work_id":"b95f28aa-df58-40a2-8e7c-f3f99f7199d8","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.363148Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:3fd0db85b4cbff3f7e373a3938c80a0ac96db506c0995e4b921991aece011b7a","observation_id":"8fb1814f-e275-41fa-a96a-c12fce8d4b72","resolution":{"observed_at":"2026-08-06T19:02:24.568184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.556788Z","title":"Coarse-to-fine text-to- music latent diffusion,","venue":null,"work_id":"86aebe5d-170a-4a83-8189-1a5534331d20","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.365909Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:51211f03316d2bc35582939ce5d0fc98fd131755723f276febafd46796c18d05","observation_id":"756330a9-bde3-40ae-bc9f-83851b512d1a","resolution":{"observed_at":"2026-08-06T19:02:24.559894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T19:02:24.368575Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.368575Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:a48a224ee00fdc2ba86973758f3ff9328b622aa617de57305b4002c0e5ba36df","observation_id":"f1861585-e6c7-4b67-8a64-3bd05e108397","resolution":{"observed_at":"2026-08-06T19:02:24.368575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.548252Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"8cf73418-5085-41c5-9c19-542a6c07c11e","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.371630Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:e4c08f14fd391c2c3fd77b73e3ae3e8fdeaf389524fff7acb6b577d559a2e2d1","observation_id":"712c6245-8d1c-458f-a56a-62f7ad753d21","resolution":{"observed_at":"2026-08-06T19:02:24.551716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.540320Z","title":"Stable audio open,","venue":null,"work_id":"6e7dcd09-6c67-4eff-b02c-a4ad4f0908e7","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.374380Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:891b883fa27fbe3af546bde18dd6ac9c6857e09390acd72d623c523536f36461","observation_id":"4c80ae5d-f2e2-4948-9501-035de94da30d","resolution":{"observed_at":"2026-08-06T19:02:24.543061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.530041Z","title":"AudioLDM 2: Learning Holistic Audio Generation With Self-Supervised Pretraining,","venue":null,"work_id":"27517c91-d3b9-4e71-87f8-e2a21e3ce674","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.377638Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:bbe8ee2de86e42d4329ace93f5a09294a46da5031fb226aa8e613eba1644d2c1","observation_id":"eb504c78-366e-48ec-9b61-4c94020b752b","resolution":{"observed_at":"2026-08-06T19:02:24.533682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.519848Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":"d5e0b023-422d-415e-8cee-38421f163be7","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.380443Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:0edc0b13ef6eb6b4326f11681a73281697c22e579aea88800d5a51799477ec28","observation_id":"6052973c-9722-4fbe-9ef5-59f9fd2b497e","resolution":{"observed_at":"2026-08-06T19:02:24.523416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.510745Z","title":"JEN-1: Text-guided universal music gener- ation with omnidirectional diffusion models,","venue":null,"work_id":"13b4ab26-a25e-4331-a1fe-9e8428ecb420","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.384619Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:6dd3133837c1f94a366d1aa0dcba42b9af716409a237edb301539e6f54a459cd","observation_id":"18188d7c-b941-47ea-abf2-a948124e77d0","resolution":{"observed_at":"2026-08-06T19:02:24.514119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T19:02:24.387244Z","title":"Uniaudio: An audio foundation model toward universal audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.387244Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:b90e5f1cc94482da7905231e9d8bbc019f9ced0a3ebd93c0e6899048c9bc5c28","observation_id":"981006d2-d1a6-4647-8332-b80cd2f36eda","resolution":{"observed_at":"2026-08-06T19:02:24.387244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.499251Z","title":"Music ControlNet: Multiple time-varying controls for music generation,","venue":null,"work_id":"43de0655-f8e6-48fc-88dd-24d55bf5d308","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.390173Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:4ee6f7f39936f59ac2d6ac2a98df76d8cf8b65fead2eaf21896038cc057533ec","observation_id":"826ee30f-3694-43f6-8d8d-1672cfda6509","resolution":{"observed_at":"2026-08-06T19:02:24.503756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T19:02:24.393797Z","title":"Fréchet Audio Distance: A metric for evaluat- ing music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.393797Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:ae3bd7c3c3250f6be05f41b7198c664e74d5d32547333c109ca0ee104e8db63a","observation_id":"24806345-b78f-48b7-bf08-ab5630f53a63","resolution":{"observed_at":"2026-08-06T19:02:24.393797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.490411Z","title":"CLAP: Learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"4df3bab0-be96-4f8c-882b-5eb701f40241","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.396775Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:ad5f6c8614017c0b77315109b5bd14d649ffa1fa14da66b6fdcbc39fd390cdf3","observation_id":"3892877c-48bd-44d7-9e39-bd73ceda8384","resolution":{"observed_at":"2026-08-06T19:02:24.493484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.481246Z","title":"MuseControlLite: Multifunctional music generation with lightweight conditioners,","venue":null,"work_id":"36f4e79f-2e84-4a4c-95e2-40051af86912","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.400382Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:42db559662810187a206db727dbd04efcb193c65786be14207ec024e3d35a27f","observation_id":"90bba355-2469-4f7f-b1ed-0d607a9d9f5e","resolution":{"observed_at":"2026-08-06T19:02:24.484848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T23:02:01.289592Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2507.06674."}