{"as_of":"2026-08-10T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8a82daa6a4db49e90e49e1bc11feec4df0f90eca517ddaf744e8ce4dd08ecbb","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:42:37.133267Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04378/citation-record","integrity":"/paper/2608.04378/integrity","json":"/paper/2608.04378/citation-record.json","paper":"/paper/2608.04378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.075440Z","title":"Self-supervised learning from images with a joint- embedding predictive architecture","venue":null,"work_id":"c4c02609-c903-4ec6-83dc-e593e9eb44ed","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.912135Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:8162ef74b03c6bba96b918ad9fff4c4fdfb9b41eb157ad8625131bd8ad70a73b","observation_id":"0a8874bf-1f7d-4649-9a84-57fa7402b568","resolution":{"observed_at":"2026-08-08T18:42:38.080911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.059125Z","title":"LeJEPA: Provable and scalable self-supervised learning without the heuristics, 2025","venue":null,"work_id":"36f15944-7f3f-42ff-a6bf-af43842abf2f","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.918353Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:e6a86d9d9e1c43d147a64e7a456ceab76919420db7cbe9f686c476d4341d8002","observation_id":"87ab2416-fe04-4adf-a606-c7d2920dc467","resolution":{"observed_at":"2026-08-08T18:42:38.063959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.043803Z","title":"Bittner, Juan José Bosch, David Rubinstein, Gabriel Meseguer-Brocal, and Sebastian Ewert","venue":null,"work_id":"e5b12699-9eea-49b4-a86e-73e4bde7e4a4","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.923728Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:32e0cdeafc46aceb47dab7c939053aa6a54093066fdd2714036ec99fcd52a56d","observation_id":"f0ce2832-a2bc-4771-a2d8-30745e4a1e7d","resolution":{"observed_at":"2026-08-08T18:42:38.048869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.027345Z","title":"Zapata, and Xavier Serra","venue":null,"work_id":"6c74b383-b716-49d2-9aac-af28e57cd0d5","year":2013},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.929545Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:55f27cabd96b4d5d759c85203400fbb47c86df8f7b2c4576cd3552e27a0e89cc","observation_id":"2cf73a05-3977-49d2-80f3-fc2571c3f015","resolution":{"observed_at":"2026-08-08T18:42:38.032439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.012377Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"14e07cfa-0d65-45b6-a4dd-1ffba4f390b0","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.934794Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:44d478b94b48a52697ee28a4bbf0e6e0f3754d4148f77dff0a9b458fce075e73","observation_id":"8ab0eeaf-e0d4-4b3c-90ec-aca0412ce320","resolution":{"observed_at":"2026-08-08T18:42:38.017269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.996570Z","title":"Codified audio language modeling learns useful representations for music information retrieval","venue":null,"work_id":"2646d8dc-4a18-41b5-944d-266e8730df1c","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.939949Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:0a13887215f52da8313b20c0368b249141d8c6222c42dfb2f8196ae6770a0074","observation_id":"59777f34-56c3-4d60-b615-a86b8be63621","resolution":{"observed_at":"2026-08-08T18:42:38.001701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01291","last_updated":"2020-08-04T02:49:57Z","snapshot_observed_at":"2026-08-09T21:50:13.603000Z","submitted_at":"2020-08-04T02:49:57Z","title":"Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm","version":1},"cited_work":{"arxiv_id":"2008.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.01291","snapshot_observed_at":"2026-08-08T18:42:37.563154Z","title":"Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm","venue":"cs.LG","work_id":"e041a8a7-8840-4b36-9ba3-5a52fb2cfa71","year":2020},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.945515Z"},"links":{"cited_paper":"/paper/2008.01291","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:4a4ea3014d18477335e7a29217b64cff1399782a498690c60593563751b6af95","observation_id":"5c3baffb-2a94-4a1e-8893-96df08d80ae6","resolution":{"observed_at":"2026-08-08T18:42:37.568953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:36.950691Z","title":"Pixelflow: Pixel-space generative models with flow, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.950691Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ad6aa382705cca1e6cc3e6b8bf86135f1534f8c5a2176ada86a1e53e0aefd2d7","observation_id":"8b25a6df-49bf-4ad7-9374-fec2b95402df","resolution":{"observed_at":"2026-08-08T18:42:36.950691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07518","last_updated":"2020-10-15T04:52:02Z","snapshot_observed_at":"2026-08-09T03:59:11.933739Z","submitted_at":"2020-10-15T04:52:02Z","title":"Automatic Analysis and Influence of Hierarchical Structure on Melody, Rhythm and Harmony in Popular Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07518","snapshot_observed_at":"2026-08-08T18:42:36.955570Z","title":"Dannenberg","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.955570Z"},"links":{"cited_paper":"/paper/2010.07518","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ae725b2866592364cc6a69142dcfa2043436b403b7f8883e49c7d7bb506f3786","observation_id":"b76b3215-d6ea-4ee0-a166-f468f897a65c","resolution":{"observed_at":"2026-08-08T18:42:36.955570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.971805Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"8d708bb6-f68a-4fbc-9c6e-c454451031bd","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.960678Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:03fb4b3ae2e1edddfed7c947b3b20c9fa6b4c63fbc79ae4874f307398d7cd4a1","observation_id":"0872e412-f945-466a-b80e-e54c31e0fc54","resolution":{"observed_at":"2026-08-08T18:42:37.976481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.957299Z","title":"Generative modelling in latent space, 2025","venue":null,"work_id":"072aed86-466c-457f-bb5a-49e4897d9d8d","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.965421Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:410c332377100489471196ea0c7b11fbe3f9f26858d2b8fded333649b3d3d5ee","observation_id":"99673cb7-a190-4952-9601-3eaf6166e80b","resolution":{"observed_at":"2026-08-08T18:42:37.962049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.941503Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":"4998d3a8-f03a-4ef7-8ba2-324f4f70aac8","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.970418Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:6772859ef40575bec55615e98663bbbfc010c1385b3c93e794b86b115be40750","observation_id":"ee53d3be-8918-411f-a66a-0973ca62549c","resolution":{"observed_at":"2026-08-08T18:42:37.946586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00504","last_updated":"2024-03-01T13:05:38Z","snapshot_observed_at":"2026-08-09T21:49:33.912308Z","submitted_at":"2024-03-01T13:05:38Z","title":"Learning and Leveraging World Models in Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00504","snapshot_observed_at":"2026-08-08T18:42:36.975241Z","title":"Learning and leveraging world models in visual representation learning.arXiv preprint arXiv:2403.00504, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.975241Z"},"links":{"cited_paper":"/paper/2403.00504","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:c372b85788b17e5bb50f89af34ebd8be8b4d6790c54aab7b3bde6c3b8662a3a4","observation_id":"ec1dd9e5-264d-4417-b06f-3f8a9553fca9","resolution":{"observed_at":"2026-08-08T18:42:36.975241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-08T18:42:36.980422Z","title":"World models.arXiv preprint arXiv:1803.10122, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.980422Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:1d7412a6f8120bd44355f5c966dd3d1f3711f2434129344e01d131df2d22499d","observation_id":"823ffb86-9a19-46ce-8fac-aed9cf3d4be2","resolution":{"observed_at":"2026-08-08T18:42:36.980422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.924949Z","title":"Using a joint-embedding predictive architecture for symbolic music understanding","venue":null,"work_id":"8941ad10-8466-4c06-9aaa-b6dff5737b81","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.985406Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:89d189a0b759e2945f0b8a5d9ac6c9ba918f441fd74e14c419c6ecf6baa00ea9","observation_id":"19e4507f-3ca4-4b83-985a-1df8eaaef8b7","resolution":{"observed_at":"2026-08-08T18:42:37.929987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.909028Z","title":null,"venue":null,"work_id":"8b255566-87a6-435b-a647-536125afe9c6","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.990376Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:aaafefe718a68f67ce06c6e44ae4cd2b798b27bb4b6dc0d3ee1332624133fb16","observation_id":"2a4bf12f-9026-413b-a7da-0e8174363d51","resolution":{"observed_at":"2026-08-08T18:42:37.914256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.893416Z","title":null,"venue":null,"work_id":"6d593ee8-6e8d-4b9e-81f7-1a4e8400cf3c","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.995429Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d0bd8ca0d8affdae39d69bf9ddd2d7fd287801d278ee6439d1521fb1d79bb600","observation_id":"dcf967d7-5d7b-4c45-9c3f-0b29962cccbf","resolution":{"observed_at":"2026-08-08T18:42:37.898382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.877839Z","title":"EMOPIA: A multi-modal pop piano dataset for emotion recognition and emotion-based music generation","venue":null,"work_id":"b6ca3bf3-d69a-4561-a4a1-e09ea07d026e","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.000539Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:1c347df8d3656ad50e3f1a95b7a31c09b11daccb00306fbace297cc6b19b0ae8","observation_id":"58bff056-ca19-4e5f-94e5-a646e70108bd","resolution":{"observed_at":"2026-08-08T18:42:37.882781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.005741Z","title":"How far can pretrained LLMs go in symbolic music? controlled comparisons of supervised and preference- based adaptation.arXiv preprint arXiv:2601.22764, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.005741Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:71aa00d8731d5334066eb52bcffabd1e6e4e22cda40fa946ad0229dc1d069aa5","observation_id":"776a0ebf-080a-4d0b-bcc9-900b302cffdc","resolution":{"observed_at":"2026-08-08T18:42:37.005741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.861917Z","title":"A path towards autonomous machine intelligence.OpenReview preprint, 2022","venue":null,"work_id":"202828c7-c54c-4ef0-ba2d-9488eaa42ff6","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.010781Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:da42c25cb410c5d3d07a6fb9ec8a4de163f26e02902670ff2595c5ef23083637","observation_id":"cb009084-0471-46a6-918f-b6819232b411","resolution":{"observed_at":"2026-08-08T18:42:37.867340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.015774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.015774Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d2d1d861b532c30b47e656344712454c7337f01d01d2f9bee83fe6bb75438dd5","observation_id":"df7df0f6-71f8-4b7f-92f3-da69e35974af","resolution":{"observed_at":"2026-08-08T18:42:37.015774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.836956Z","title":"Swin transformer V2: Scaling up capacity and resolution","venue":null,"work_id":"ed93210c-d926-43d3-af06-99488f12dd20","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.020732Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:c4f5f24751d9a29fc5bd1247816f355a7ec976b236ce61689a9bd56c808de711","observation_id":"ed68fb50-386a-41f0-9356-2fe0385ab834","resolution":{"observed_at":"2026-08-08T18:42:37.841633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.820668Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"961c9d15-4c76-421f-835b-4bd407d37a2c","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.026096Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:48cccd97b1613a350d03c9589c6ace57996e3fc9c23d14479aa8678d5b402c75","observation_id":"23e7dc7b-507c-4dab-86b3-6699f2f59d6f","resolution":{"observed_at":"2026-08-08T18:42:37.826192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.804572Z","title":"One-step latent-free image generation with pixel mean flows, 2026","venue":null,"work_id":"1ccc2fb8-3f2f-48da-b249-e7c86453cbc9","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.031151Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:e7bbe24e67bbb1a718ec1548dc6419fe83ff675cbbb836e39aa4fc84f02f999d","observation_id":"f4fec9ca-7df3-44f8-9754-a72c49232f45","resolution":{"observed_at":"2026-08-08T18:42:37.809553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.789090Z","title":"CMI-Bench: A comprehensive benchmark for evaluating music instruction following","venue":null,"work_id":"cf17ce30-e12e-4624-b519-641adc308eac","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.036013Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:c038cb3ce308c31d9f783c1fbe184db5ad2784b66cf93888616c38859c361797","observation_id":"2d36acc3-76b4-4d96-a9b7-a0d8875d630b","resolution":{"observed_at":"2026-08-08T18:42:37.794140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.773140Z","title":"Pnp-flow: Plug-and-play image restoration with flow matching","venue":null,"work_id":"31ff9c23-afb9-4d45-80d7-ed50d10a25ad","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.040895Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:92842a96f3776911a1904058ec932fd4206f3391f1cfccaa242773221c8ebd69","observation_id":"75e79708-a7b9-4776-8996-3be58b18a4d3","resolution":{"observed_at":"2026-08-08T18:42:37.778168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.758193Z","title":null,"venue":null,"work_id":"de7c8d9e-f927-4592-abf2-1bf3e9808905","year":2015},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.045834Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:18012040af688a7cc91862acb353edec59f1e2fd0c783181c3e6033105f8eee2","observation_id":"85c8f97e-4f54-4634-8f48-c8cedf74184f","resolution":{"observed_at":"2026-08-08T18:42:37.762821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.742210Z","title":"Polyffusion: A diffusion model for polyphonic score generation with internal and external controls","venue":null,"work_id":"30b094ff-563f-4e84-b9e7-e29d8c30e81b","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.050886Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:2f11b74443f5dc3dde6a542b35e05890083db8a56a1c75611100a5b419f64df6","observation_id":"134e1ddc-edaa-47a2-b3c8-48fd902bb68c","resolution":{"observed_at":"2026-08-08T18:42:37.747648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T18:42:37.055751Z","title":"DINOv2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.055751Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d75f72634558a1c42b07fc5e99111825c73c8cb86af540b7e4dfec83950f6f43","observation_id":"c8146f13-b4f8-4ba4-a32e-9f4b3cf33c60","resolution":{"observed_at":"2026-08-08T18:42:37.055751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.060824Z","title":"Muckley, Ricky T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.060824Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d75ecba41778eb531121d4a87f4e401e0a88fa593582b15e7c59086ccd474a9a","observation_id":"cc2dee26-7156-484b-99a7-ad1273520a00","resolution":{"observed_at":"2026-08-08T18:42:37.060824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.715597Z","title":"PhD thesis, Columbia University, 2016","venue":null,"work_id":"d0422f01-86d6-4f2d-be97-6acba648c857","year":2016},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.065674Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:5cbed3d5c1d76de1de89dbf91c2e714c923ade56e47060a1247c4cef14e3e1dc","observation_id":"40c9a460-054b-4def-828c-bc6a56b1a33e","resolution":{"observed_at":"2026-08-08T18:42:37.720976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.698747Z","title":"Stem- JEPA: A joint-embedding predictive architecture for musical stem compatibility estimation","venue":null,"work_id":"643072ce-3608-4339-a24b-774c877d4d29","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.070460Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:14ec1060a6a22b73b4cdfbe5786cdc10f7d020a7f5ace2d150876df4713076d6","observation_id":"223d6f9e-ba15-4769-9dcd-69218455e90f","resolution":{"observed_at":"2026-08-08T18:42:37.703918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.683461Z","title":"Crash: Raw audio score-based generative modeling for controllable high-resolution drum sound synthesis, 2021","venue":null,"work_id":"cd39e895-0f92-4cbb-aed2-fc7c280f1c28","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.075034Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:44e369917c1c4b6aab4d1b355c8a4f2f922640bef0bfd876c24dbfc8f456b894","observation_id":"0f15c106-a328-41bd-89bd-081b0e7f38c1","resolution":{"observed_at":"2026-08-08T18:42:37.688676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.668092Z","title":"Muscriptor: An open model for multi-instrument music transcription, 2026","venue":null,"work_id":"1af595cb-b16e-47fb-8325-b820f8f63280","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.079711Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:dcfc759a306a9cfa699e88b797aa5b5767d67163b0930cd4c9fb238d9b7532c5","observation_id":"6bb44a12-d538-46b4-8001-cd46248a1f9f","resolution":{"observed_at":"2026-08-08T18:42:37.673242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.650758Z","title":"Rick Rubin: The 60 minutes interview.60 Minutes, CBS News","venue":null,"work_id":"418571db-7a67-40d9-82ae-4fa1b215ed54","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.084436Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:6d2ec8d9c5cd8c4f1d113159939a586556bbda7cef35cee9c37bc9ecbc73dd6a","observation_id":"c226ce58-bccb-4284-878e-3145fae4044d","resolution":{"observed_at":"2026-08-08T18:42:37.655671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.635007Z","title":null,"venue":null,"work_id":"3b29ba26-a162-46cc-8fa6-b49857163e3d","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.089482Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:775dd238c7387a9d08c19afdece2c77ff10cd0295d34f23f240732092e4ffe8d","observation_id":"2c5f8fec-afaa-4ae4-a232-96c8a90cf810","resolution":{"observed_at":"2026-08-08T18:42:37.640139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.093962Z","title":"Improving and generalizing flow-based genera- tive models with minibatch optimal transport.Transactions on Machine Learning Research,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.093962Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:b1eeaa57ae83327f0f19066a6719ebc3a9f38e588139a03dbcf3ab763cf4db38","observation_id":"36cb00f1-254e-4088-8729-14943ecbb7c7","resolution":{"observed_at":"2026-08-08T18:42:37.093962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.596311Z","title":"Music-JEPA: Learning a world model of sound from action, 2026","venue":null,"work_id":"384b634c-1128-466f-b043-a1728ccb44ef","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.104016Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:7a1470287a8a20571ee884b4baa854fa7ee2c4acfe5b67e9da0154818ad6aa93","observation_id":"ab69694a-1cbf-45f4-b5c5-310b296da0c0","resolution":{"observed_at":"2026-08-08T18:42:37.601766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.579877Z","title":"Visreg: Variance-invariance-sketching regularization for jepa training, 2026","venue":null,"work_id":"692d6f02-7b28-460a-8373-605958d8f109","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.108727Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:c6863f93974b4c71a15d2f25e2b2e8e7e5ae926c4f59051affca33c9e2d16ba9","observation_id":"ef97b942-4dd2-4979-ba95-68a7039b397d","resolution":{"observed_at":"2026-08-08T18:42:37.585245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10738","last_updated":"2023-09-20T10:56:07Z","snapshot_observed_at":"2026-08-07T09:52:59.812138Z","submitted_at":"2023-09-19T16:34:24Z","title":"MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation","version":2},"cited_work":{"arxiv_id":"2309.10738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10738","snapshot_observed_at":"2026-08-08T18:42:37.403158Z","title":"MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation","venue":"cs.SD","work_id":"485a5565-62b8-4e53-a55a-9d975ffee400","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.113557Z"},"links":{"cited_paper":"/paper/2309.10738","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:7f602d7d94c0f56fe03c01960af311bc9e0d128ec39be06f78d2a839f700a585","observation_id":"d4332ef1-0b75-4283-a70f-c45e98a78200","resolution":{"observed_at":"2026-08-08T18:42:37.410262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21740","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.378931Z","title":"MIDI-LLaMA: An instruction-following multimodal LLM for symbolic music understanding.arXiv preprint arXiv:2601.21740, 2026","venue":null,"work_id":"35e7e6de-0303-4a09-b775-f7927ad17a9c","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.118857Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:b3ab8f05cc3d48afe5870439c6065e8fe9c66ae1e9b09536d0378a252ab031d6","observation_id":"8564d54c-c355-4bf7-ade4-163d2526236d","resolution":{"observed_at":"2026-08-08T18:42:37.387019Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10003","last_updated":"2026-07-10T22:02:00Z","snapshot_observed_at":"2026-08-09T17:04:53.257364Z","submitted_at":"2026-07-10T22:02:00Z","title":"ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music","version":1},"cited_work":{"arxiv_id":"2607.10003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.10003","snapshot_observed_at":"2026-08-08T18:42:37.302502Z","title":"ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music","venue":"cs.SD","work_id":"3d3a7920-dc6d-4cd0-a938-060541d19317","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.123392Z"},"links":{"cited_paper":"/paper/2607.10003","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ba6a3702a9fc7e33eacceaa82dd5352e4b21099851d33791794d3b3a1a914f2a","observation_id":"b90d367e-3164-4d36-a123-753077ee38f0","resolution":{"observed_at":"2026-08-08T18:42:37.310363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.128449Z","title":"ABC-Eval: Benchmarking large language models on symbolic music understanding and instruction following.arXiv preprint arXiv:2509.23350, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.128449Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:6cebec90fd2abebfec421a52be0e62cb92514c84cf0e42b1a4d6b7492896bf1c","observation_id":"d31e8fa0-d1c7-49c7-bad9-438cbb904560","resolution":{"observed_at":"2026-08-08T18:42:37.128449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-08T18:42:37.133267Z","title":"/all”; values = best across levels, one consistent probe-suite vintage; “/all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.133267Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:fee6b2555ad873a7af6e263ce24f8f098a9bc0eb89f8d5d47d3e52c9f758f554","observation_id":"9c36c57d-20fb-411d-b5cc-6c78bc1b0432","resolution":{"observed_at":"2026-08-08T18:42:37.133267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.099100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.099100Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:f6962f045b1a026343d72a779b52d8817a2203ac772926d4bb924111e24139dd","observation_id":"c4c16f69-7feb-45d3-b797-efdfae11cf75","resolution":{"observed_at":"2026-08-08T18:42:37.099100Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T21:49:55.983462Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":15,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.04378."}