{"as_of":"2026-08-19T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:daf9f1bba9dba407aeeff675bee57df3886ce6c5f9ad23e91dc81f0c41c6f8b0","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:59:11.802632Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:47.082431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:06:50.507426Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":"2605.18613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-07-10T06:06:50.507426Z","title":"SAME: A Semantically-Aligned Music Autoencoder","venue":"cs.SD","work_id":"3ef123ea-63e6-4f5e-b876-fae995eb4e53","year":2026},"citing_paper":{"arxiv_id":"2607.08526","last_updated":"2026-07-09T14:21:34Z","snapshot_observed_at":"2026-08-18T17:16:53.592693Z","submitted_at":"2026-07-09T14:21:34Z","title":"A Quantized Native Runtime for On-Device Semantic Audio Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T05:58:17.100557Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.08526"},"observation_digest":"sha256:f6d0f3fee59589eb11349f94df70f0174ff7f3a9e574a839b209f7be1beec077","observation_id":"57720e0b-3974-4a4a-8738-682cef2bcc82","resolution":{"observed_at":"2026-07-10T06:06:50.509304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-07-14T03:47:22.936776Z","title":"William Peebles and Saining Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-15T02:24:59.815201Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T03:47:22.936776Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:9732c3c13817f6a4b69095c2a771dc48303d1342331cfbe45e372156717731fc","observation_id":"741b6961-9843-4368-945a-67c1e2663b33","resolution":{"observed_at":"2026-07-14T03:47:22.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-02T06:52:28.298503Z","title":"William Peebles and Saining Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-15T02:24:59.815201Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T06:52:28.298503Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:b29dd2a939c52f254e06d3fa410b9145f96476ba548a41d8c004e4a88a3540f8","observation_id":"ec0df292-a9c6-4338-8012-b284af50115e","resolution":{"observed_at":"2026-08-02T06:52:28.298503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-07-30T14:08:14.347392Z","title":"SAME: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-13T15:36:22.523939Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.347392Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:c5294b0a744ccd0fe691614d6d915ffd8951a3e028cb6737d86ee14ba2aae434","observation_id":"c2728c85-db52-44b2-a69b-d7f618dea03c","resolution":{"observed_at":"2026-07-30T14:08:14.347392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-01T10:17:25.066467Z","title":"SAME: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-13T15:36:22.523939Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:25.066467Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:ded5d6e087befc18c006bf600adbd10b856c0115f491c74736a2cd1b1fe52f3a","observation_id":"b4620f63-e242-4900-acfc-50dc690bca6b","resolution":{"observed_at":"2026-08-01T10:17:25.066467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-04T16:29:26.723412Z","title":"Same: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:26.723412Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:760a5baa9c194662c6f01874e21d48d143a02d953506609c8f933193e60cfc08","observation_id":"95ebb923-c51c-437d-80c3-c2bb4a451048","resolution":{"observed_at":"2026-08-04T16:29:26.723412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18613","snapshot_observed_at":"2026-08-07T00:14:47.082431Z","title":"Same: A semantically-aligned music autoencoder.arXiv preprint arXiv:2605.18613, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-19T19:58:16.324949Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.082431Z"},"links":{"cited_paper":"/paper/2605.18613","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:d2ac819f1e86d97da825671aa80f0231b2e620609db5d729b01e6fe6dceab48f","observation_id":"7cecd235-87b3-40c3-8f52-32a819df9aab","resolution":{"observed_at":"2026-08-07T00:14:47.082431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18613/citation-record","integrity":"/paper/2605.18613/integrity","json":"/paper/2605.18613/citation-record.json","paper":"/paper/2605.18613"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"e53ebe99-ba32-4999-a70c-aeca801b4d4c","year":2022},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:a02d893b0075eae326b7f7118e190be44b3fb7a29030dd02303bd2e251a2d1bd","observation_id":"adb8357d-4e68-4eff-9fb8-b18c758cf6bf","resolution":{"observed_at":"2026-05-20T08:28:09.271236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SoundStream: An end-to-end neural audio codec","venue":null,"work_id":"084aaf6a-747c-4535-8ab6-9d5bf6a5b047","year":2022},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:403c923f1d4412f1ee3292027263ca025d1c91ae51f3f7a662203d9ec74390bd","observation_id":"38f9a095-b68e-4b0e-9d2c-1677b0afe847","resolution":{"observed_at":"2026-05-20T08:28:09.279086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High fidelity neural audio compression","venue":null,"work_id":"694c04f3-7182-43d6-ae11-2e1d21a16f5b","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:8c4717d73935756c0f35d9732c8ed05904fd11d34249e50b089ed1b36b679c92","observation_id":"754e839a-16cb-4065-adec-e86f9599b9cf","resolution":{"observed_at":"2026-05-20T08:28:09.276890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":"bd61b6fb-df3a-402c-a9bc-357768a3109b","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:2190e986632ecfbe47ec632403de9f092d015419129d2f47d21a6984ac717db7","observation_id":"25dc52c9-261a-45c6-bba1-574a4d983594","resolution":{"observed_at":"2026-05-20T08:28:09.272951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"18d43955-34fe-429c-aea7-ac5ddef4f310","year":2017},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:d8862a6542d6de2c0d5529e27248d122cf2a3ac3ec1db904f72f847dd64ed2a5","observation_id":"395ae8f6-115f-4ed6-aa1a-4731a64f4f86","resolution":{"observed_at":"2026-05-20T08:28:09.269401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioLM: A language modeling approach to audio generation","venue":null,"work_id":"ab40b890-560a-4721-ba19-5d2e088c86d3","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:117d50c8f7663719f0267bd79c40336fdf700c445f8b31b97a27569699f65bd6","observation_id":"19d374bf-1b08-4c10-a091-0ebd5d7a4dbe","resolution":{"observed_at":"2026-05-20T08:28:09.274942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple and controllable music generation","venue":null,"work_id":"0e56234b-5974-4eb5-822f-0f49ebabc284","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:0f2309f0cbc0b14d43bd5be03967710caaa6af05506710c0220f484ebd8203a7","observation_id":"61fbd16a-cfb2-4794-8673-07753333fbf9","resolution":{"observed_at":"2026-05-20T08:28:09.255696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable Audio Open","venue":null,"work_id":"bc8ca32b-a107-4e00-b883-be0914369c59","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:af5e208aa43ad32820196b9efcc74eabd2c2de68a340ee984c10ec154fc9c876","observation_id":"7ec80fcf-3b6a-4722-afe5-5ca518746800","resolution":{"observed_at":"2026-05-20T08:28:09.242129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14912","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.006934Z","title":"Back to ear: Perceptually driven high fidelity music reconstruction","venue":null,"work_id":"02eb3bb1-6e5a-435f-931f-60a76ce11cac","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:0ff013e15fc6a45ea726a84019e0dc3282f4109f2e6aaf3dc7a0f17f0d0b4373","observation_id":"1f6ea139-343f-47f5-b763-26282fc6d72b","resolution":{"observed_at":"2026-05-20T08:03:09.028422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HILCodec: High-fidelity and lightweight neural audio codec","venue":null,"work_id":"ed110f74-eadb-491d-b63a-a7e328ce6561","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:311eb27c6399c970026b2cb837c78aaef8541ed1a9b672c1c8f236d4d6549a8b","observation_id":"8d4006ea-7bd0-47c6-9968-39da1c0c5482","resolution":{"observed_at":"2026-05-20T08:28:09.238439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Music2Latent: Consistency autoencoders for latent audio compression","venue":null,"work_id":"49582ae8-affa-4808-8be2-1ce598611cbf","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:421eedc2e32aaeba08d2eba4f8783a85b6922dde1e79f998c5f0d17ed0cea8f7","observation_id":"df03b5b0-66eb-46fa-80f3-568a0a4772a7","resolution":{"observed_at":"2026-05-20T08:28:09.259419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Music2Latent2: Audio compression with summary embeddings and autoregressive decoding","venue":null,"work_id":"5cee4794-4780-42ef-a81a-cf64c308bcfb","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:f18e71dd62730cb2f3b33ae65a0a19bc4054186a00b8c483edda80c33291e9b7","observation_id":"ed81b00c-62af-4b44-b00b-9b8512495ede","resolution":{"observed_at":"2026-05-20T08:28:09.228821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoDiCodec: Unifying continuous and discrete compressed representations of audio","venue":null,"work_id":"3acd83c6-bedb-48a5-b361-40f26fe76880","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:44bd371699c7474d104dd133ea41fa24d0236cf1fe366f4c4211f453c31cc0a0","observation_id":"e20e19ec-f288-4f18-ba60-d71069b872c7","resolution":{"observed_at":"2026-05-20T08:28:09.267142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":"3255094d-272f-415f-806e-adbb6de35aac","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:bec97683aa92c13e982432d5fc7fce14b6469f56c36699a377dcdab7ce24c175","observation_id":"d5d10548-ff6b-412a-86cc-f4709e763016","resolution":{"observed_at":"2026-05-20T08:28:09.249916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TS3-Codec: Transformer-based simple streaming single codec","venue":null,"work_id":"00b782c8-0fb4-4491-b0cb-c4d2e8a2c652","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:a09e821ddfc9b563a9274c5dfb9477671050316ed64ad5fba50b6b33569de6ab","observation_id":"da66e041-6e04-417a-8450-c86b4032862b","resolution":{"observed_at":"2026-05-20T08:28:09.240324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALMTokenizer: A low-bitrate and semantic-rich audio codec tokenizer for audio language modeling","venue":null,"work_id":"1899d493-90ec-42d8-a84f-2fc55ccbc02c","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:babd5e43bb5244e9af3090606c9c8ce8ca0e17b5b729624dae5281746c66748e","observation_id":"f84b2963-6f99-42c7-97d7-3eb79e46cc37","resolution":{"observed_at":"2026-05-20T08:28:09.226692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeechTokenizer: Unified speech tokenizer for speech language models","venue":null,"work_id":"7b8d6468-c4a2-417e-bfab-155504ff04b1","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:ad1f8cfceae5d6f096b6d668e0f1b213c9c18bcc0589a0b3dc5277bc1f3d5d52","observation_id":"c860cb7c-ce36-40cc-a634-29b2ff486b78","resolution":{"observed_at":"2026-05-20T08:28:09.234627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:6589687ddbbbd36268f1d58d6d72dc9bf10baa975b5c2dc757beb5396f293ac2","observation_id":"b9e36cce-9356-466b-904a-5be3a68d981d","resolution":{"observed_at":"2026-05-20T08:03:09.024785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FunCodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec","venue":null,"work_id":"7902d8e6-2ea7-45b2-b645-f0ac8cb33116","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:821bcc24d862fe267de9625e4332fbe60d378673fa547ff5653a3f4060b9005d","observation_id":"56aa87db-235f-4331-8757-27235bb81219","resolution":{"observed_at":"2026-05-20T08:28:09.224626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"d10a5bc4-5b98-430f-88dd-9cfda8490cc3","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:1d9dfdd426d9c06bba9923d3de8a6731f0d504d1e8828735f9dd7c98221a5d73","observation_id":"047b2720-b6dc-41db-9725-374e1e076988","resolution":{"observed_at":"2026-05-20T08:28:09.218578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"65c21a00-28cf-4af5-9f0f-a76ed7f1395b","year":2021},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:3fb1da4290a87b11bf7592841efd7cf927c88c4a4e206feefd06c484ff853491","observation_id":"d124999f-cfb1-4dfc-878d-2b66ea87c73c","resolution":{"observed_at":"2026-05-20T08:28:09.251777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Differential Transformer","venue":null,"work_id":"fb8e3e10-bce1-4f06-b808-5bd120e48a62","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:bb4852a582108aa7ad83cb61424c395a68e72b7b547ffe9d786e8021b83c6562","observation_id":"91179220-522f-4873-bb6e-e749510338a2","resolution":{"observed_at":"2026-05-20T08:28:09.261137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoFormer: Enhanced transformer with Rotary Position Embedding","venue":null,"work_id":"8f33bb5e-639f-448f-872f-869b10189c30","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:f31294d36039dc2f487188f8cbcb8b430dcc45b462d4f48e20608847b7531818","observation_id":"0b3b56eb-1bc4-40e2-9534-4f2d7760c3b8","resolution":{"observed_at":"2026-05-20T08:28:09.265281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers without normalization","venue":null,"work_id":"2eae604e-d95c-4513-baaf-9192a3f61136","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:3f12baeaa0a4f954adc7fe41e09222856ebcded3c04d828fdf90b18af0861778","observation_id":"05207c42-c685-4519-8b62-30d5a4122fa5","resolution":{"observed_at":"2026-05-20T08:28:09.230589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LiteRT: On-device runtime for cross-platform machine learning inference","venue":null,"work_id":"9e8136b8-4a8a-4e85-bb31-c86560976c1a","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:128a11634563a721dfc6ceaf48cd6518329d47243c30b686b7ade54a403d6c60","observation_id":"d64d97cd-8c4a-4467-a0bf-f79a916ce770","resolution":{"observed_at":"2026-05-20T08:28:09.257565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:e2d13dc119f88f0d746dfdddb7230a0aa8bd6695dc93688c074fa5733a187f1c","observation_id":"f30f953c-9e4d-4d8b-b5c0-5045efcdcd51","resolution":{"observed_at":"2026-05-20T08:03:09.020437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:00.620880Z","title":"Unified latents (ul): How to train your latents","venue":null,"work_id":"633bf0a2-f752-4228-b608-e4221dc39438","year":2026},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:08938be7ff04693a07f319a4ab9a3d387c94791ab305031f9e56ebf1c3587e16","observation_id":"860db250-3eca-4a2a-b5fd-0690b60f3ee5","resolution":{"observed_at":"2026-05-20T08:03:09.032895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallel WaveGAN: A fast waveform generation model based on Generative Adversarial Networks with multi-resolution spectrogram","venue":null,"work_id":"1f3b1ea1-91a8-4cfe-a4fe-ffadca7064cb","year":2020},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:b1e8c7dcdf6c744f4429c10165410cc8519cd66ea513e78576f6a75ffabda677","observation_id":"eedc3626-4891-4aa6-9664-0792d6ea6d97","resolution":{"observed_at":"2026-05-20T08:28:09.263077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-scale spectral loss revisited","venue":null,"work_id":"16674f48-3bec-4efc-bc3a-520c00a37200","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:d303af605155ff0236a60ced7f8b6bbbf26b96175c19b8d5d49bb825558ddebb","observation_id":"b814ddc0-74e4-419c-a5c5-c1cf9881b8b0","resolution":{"observed_at":"2026-05-20T08:28:09.246017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The relativistic discriminator: A key element missing from standard GAN","venue":null,"work_id":"0336922c-4bdf-46d4-b716-e9b27280be50","year":2019},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:9c0adfceb4e305e170ce7ca21b96798140b0c66da7c600c88967603cdca8342e","observation_id":"0314a4b3-539c-4380-ba65-07a18e8ad0b6","resolution":{"observed_at":"2026-05-20T08:28:09.232460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Near-perfect-reconstruction pseudo-QMF banks","venue":null,"work_id":"9116ff95-5278-46f7-9907-c8d8a9cc2b02","year":1994},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:9ce600d50e3682a7457e83cadcbf079a931327063da54471214dc2b7fab68268","observation_id":"45fb1f45-d492-4f3a-ba4f-eb57e47f68f9","resolution":{"observed_at":"2026-05-20T08:28:09.253805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LARP: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":"2e26cf1e-022a-416f-918a-81b139b7a123","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:0a24e6642aedc3d344c07f0e5c750457495da12c93be4a1d8169349d6c407fe3","observation_id":"bf927c57-c9ab-47f4-801b-be8dd709aaea","resolution":{"observed_at":"2026-05-20T08:28:09.236593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow Matching for generative modeling","venue":null,"work_id":"c62812fc-10cb-4c32-9354-d4d3e4913c25","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:6321db4b9592cc8ef08a144cf19a48b929191338d95c5c29a613a3e45d5bb093","observation_id":"9275c599-08d7-40ae-b519-10060e6293f2","resolution":{"observed_at":"2026-05-20T08:28:09.220494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biorthogonal bases of compactly supported wavelets","venue":null,"work_id":"a940d6c9-af17-48c8-9b1a-0797a33fa1bb","year":1992},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:f986ca6b3587992b92d536cf75a710312ade774ca2f62484d60a999a741c7551","observation_id":"1573ce80-2a56-477e-8d13-1ba159c9f785","resolution":{"observed_at":"2026-05-20T08:28:09.222271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06225","last_updated":"2025-04-08T17:13:41Z","snapshot_observed_at":"2026-08-19T19:37:19.862599Z","submitted_at":"2025-04-08T17:13:41Z","title":"Encoder-Decoder Gemma: Improving the Quality-Efficiency Trade-Off via Adaptation","version":1},"cited_work":{"arxiv_id":"2504.06225","doi":"10.48550/arxiv.2504.06225","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.06225","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Encoder-decoder Gemma: Improving the quality-efficiency trade-off via adaptation","venue":"ArXiv.org","work_id":"59417b6e-82e5-4ab1-9997-ad0c41664ec8","year":2025},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"cited_paper":"/paper/2504.06225","citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:6979c3dd522e38bc11a9eacb19c89cdef033ad0de747608d79c22d668718940b","observation_id":"b10ee692-b4e4-44c4-8a12-1e155bdc15dc","resolution":{"observed_at":"2026-05-20T08:03:09.037981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.16085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:18:56.239246Z","title":"Cautious optimizers: Improving training with one line of code.arXiv preprint arXiv:2411.16085","venue":null,"work_id":"8aa8c25d-8998-4994-9770-40d78854018d","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:b3da985989980baab61ee056ecc5951cd6ae642c3e145763824cd9f57eb77fa9","observation_id":"70a4a902-5082-4f81-be6d-6f7154172ba3","resolution":{"observed_at":"2026-05-20T08:03:09.016799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-form music generation with latent diffusion","venue":null,"work_id":"d224f6a5-8619-48d6-8de7-5193e96ca769","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:d5be56e9f39701aab38b553ea68d00bbec021e2238897f5587a7bb96c0258b70","observation_id":"1da41848-9534-4da7-9215-00d3cf41146c","resolution":{"observed_at":"2026-05-20T08:28:09.244129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Song Describer Dataset: a corpus of audio captions for music-and-language evaluation","venue":null,"work_id":"634191c8-0138-448b-8ca9-e97ef4d3d2a8","year":2023},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:c8048362066485dc8033574f3e830ec04ffb2e4e20411ea76ca7df548f549eb9","observation_id":"4746feac-d84f-4f90-8583-83520adc999e","resolution":{"observed_at":"2026-05-20T08:28:09.248002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting Fréchet Audio Distance for generative music evaluation","venue":null,"work_id":"5a219086-b6af-4f1e-afe5-b16894617298","year":2024},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:347aabbac7f376d8f39eb71901c3e1e408e43e10d54b5d67a92a4b769f4f6e34","observation_id":"d2046df9-936a-40ca-9172-59b902dac0a8","resolution":{"observed_at":"2026-05-20T08:28:09.216452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:45:12.329926Z","title":"MuQ-Eval: An open-source per-sample quality metric for AI music generation evaluation","venue":null,"work_id":"cdc4f594-d504-44d5-b007-92562444547e","year":2026},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:5572debd19e15716a5ea65bb7998ecdd0bdb45cad6b7ce834ffe28140d1d2a32","observation_id":"a383438d-e2ab-4c17-9c99-5ef644ceb757","resolution":{"observed_at":"2026-05-20T08:03:09.012344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.00744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:06:50.523106Z","title":"ACE-Step 1.5: Pushing the boundaries of open-source music generation","venue":null,"work_id":"4d13f3ca-1cdd-4a87-8b3e-6faf7d71bdcc","year":2026},"citing_paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T07:59:11.802632Z"},"links":{"citing_paper":"/paper/2605.18613"},"observation_digest":"sha256:587944f2594af1be69ca3a097bb9e6a51db334a43ff2a5ad341f5596e213246d","observation_id":"571cd417-4f01-4901-85ba-0475ffed1fc0","resolution":{"observed_at":"2026-05-20T08:03:09.008463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18613","last_updated":"2026-05-18T16:23:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T06:26:48.573621Z","submitted_at":"2026-05-18T16:23:16Z","title":"SAME: A Semantically-Aligned Music Autoencoder"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2605.18613."}