{"as_of":"2026-08-22T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd4b679970089f923f6cb5ec209d501a07cbcbcdead9b971140401f2a3490da0","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:12:47.611011Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:12:40.962023Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22000","snapshot_observed_at":"2026-08-01T06:12:40.962023Z","title":"# \"!\"#\"! # $ MSE !̂!","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:40.962023Z"},"links":{"cited_paper":"/paper/2607.22000","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:8e272dfa16ca8618cfd6e0eaa2971d54a6f87a5162e8714d214645d811b9d950","observation_id":"af5362bb-95d7-4d1d-b047-3ad8e452d148","resolution":{"observed_at":"2026-08-01T06:12:40.962023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.22000/citation-record","integrity":"/paper/2607.22000/integrity","json":"/paper/2607.22000/citation-record.json","paper":"/paper/2607.22000"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22000","snapshot_observed_at":"2026-08-01T06:12:40.962023Z","title":"# \"!\"#\"! # $ MSE !̂!","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:40.962023Z"},"links":{"cited_paper":"/paper/2607.22000","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:8e272dfa16ca8618cfd6e0eaa2971d54a6f87a5162e8714d214645d811b9d950","observation_id":"af5362bb-95d7-4d1d-b047-3ad8e452d148","resolution":{"observed_at":"2026-08-01T06:12:40.962023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.072877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.072877Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:314784e74202a1ed05bd9fd5ddd42c8225f5bf6853525e122ffa891781f883a7","observation_id":"593cc8b4-7f03-43c8-9805-c02377f9c65b","resolution":{"observed_at":"2026-08-01T06:12:41.072877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.205908Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.205908Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:6280c880ce2c292d815057e9cd961f50186d2f32c911356b01280f101a281ecf","observation_id":"9310074f-1716-43ea-aff3-6dd70e1fd63a","resolution":{"observed_at":"2026-08-01T06:12:41.205908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.324801Z","title":"We first describe the dataset, training procedure (Section 4.1), and baselines (Section 4.2)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.324801Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:6e2b12aff8b7afa0bbd5984a0a7539040de936d882020b6dc2ae8bb0b53fcda5","observation_id":"8467e091-8626-4951-83e0-390fdb8bb302","resolution":{"observed_at":"2026-08-01T06:12:41.324801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.453362Z","title":"We demonstrate three key capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.453362Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:9bb5e857fdc818540b69772f928d94f2016085b2d978600a780e6ba21a236734","observation_id":"f5d89169-d190-4730-a375-c8576c0df9aa","resolution":{"observed_at":"2026-08-01T06:12:41.453362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.590602Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.590602Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:b4bbcce2a71b9c32cfef6fb13a162d22368a03f64d440a5e6d71006e4a3fc70f","observation_id":"462bfbe0-92a8-4f21-8846-349753783729","resolution":{"observed_at":"2026-08-01T06:12:41.590602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.687186Z","title":"Hohwy,The predictive mind","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.687186Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:5bc6ff4cfb2abafd0c2ac44a375ecf97d81a14b54a0bfa27c355a54acb6a9baf","observation_id":"23b4aaf0-2ba9-41e0-b687-3f51ddca48c3","resolution":{"observed_at":"2026-08-01T06:12:41.687186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.809200Z","title":"A path towards autonomous machine in- telligence version 0.9.2, 2022-06-27,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.809200Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:df84c68cfc8d07a0436e8c4d9a4207bee199538a7613e2befd7de891d10268d9","observation_id":"e6f91316-3b83-4dae-886a-c0e6c5b8b914","resolution":{"observed_at":"2026-08-01T06:12:41.809200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:41.930874Z","title":"Self-supervised learning from im- ages with a joint-embedding predictive architec- ture,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:41.930874Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:7685b00feee2a4272523f6e8205ef1fcd90a5b5017b04eb869c1b3adddc9b2d9","observation_id":"32630d7b-c87a-456f-94e3-a1723d7dd23b","resolution":{"observed_at":"2026-08-01T06:12:41.930874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-01T06:12:42.094860Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.094860Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:e8351e63d8eeca692da6e3542beaed7fcd382bafa4f55a7c8005bc0bcef4e473","observation_id":"b2cc5bb5-4c14-4045-971a-6203a223747f","resolution":{"observed_at":"2026-08-01T06:12:42.094860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15830","last_updated":"2024-01-11T13:16:43Z","snapshot_observed_at":"2026-08-22T04:35:56.507945Z","submitted_at":"2023-11-27T13:53:53Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15830","snapshot_observed_at":"2026-08-01T06:12:42.238243Z","title":"A-JEPA: joint- embedding predictive architecture can listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.238243Z"},"links":{"cited_paper":"/paper/2311.15830","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:54402045fb183623b0039a75733d025e6f0aa7e35b9bbf3692fb5388c0666b6f","observation_id":"0c49ba69-6036-40ff-885a-caa58fac3cbb","resolution":{"observed_at":"2026-08-01T06:12:42.238243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-01T06:12:42.365990Z","title":"Audio-jepa: Joint-embedding predictive archi- tecture for audio representation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.365990Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:a0cf6af0ed675f060ffed76489cb05f1d81f19254ef491a609c0259d9a24646e","observation_id":"163f1b05-700e-4916-8794-06d0bdd0842c","resolution":{"observed_at":"2026-08-01T06:12:42.365990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:42.454661Z","title":"Investigating design choices in joint-embedding predictive architectures for general audio repre- sentation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.454661Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:77f370a4a167b316d0a120121c4dec733bd9aff68edd9d71944ea64f80e12d9e","observation_id":"cbeb8660-15de-45da-aa3e-bcea2e426376","resolution":{"observed_at":"2026-08-01T06:12:42.454661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:42.597033Z","title":"Stem-jepa: A joint-embedding predictive architecture for musical stem compatibility estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.597033Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:9981ac40ef5012009af16645232f5fe43006b469b69be7301cdda93a335d35f4","observation_id":"f0abb9ab-8540-4ab7-83f3-d55642f4f899","resolution":{"observed_at":"2026-08-01T06:12:42.597033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.17811358","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent musical properties of a transformer under contrastive self- supervised learning,","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"e2a83436-5d82-49d5-abfc-7c6ebffdff2a","year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.753490Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:8df2cdc0d82f8168c7fa7edd1d97d9afa4fbbd2270cc583183ba058f01ad98be","observation_id":"ff2fffe6-2cd4-4508-a5fb-a3a954a1c02a","resolution":{"observed_at":"2026-08-01T06:14:13.236348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:42.864492Z","title":"Contrastive learning of musical representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.864492Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:a68777135bf0e15dfc966e39068f53c0b63f39efcea313cd42ebca1012f99467","observation_id":"dfe89b82-c828-4a57-9547-4cf97014b229","resolution":{"observed_at":"2026-08-01T06:12:42.864492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:42.989580Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.989580Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:ed730a04d687baea7a18215feac3ce94ceefffddc28fe6cefcd10f7f249845e0","observation_id":"c62c7420-ea10-4613-91c8-b1ac2e417055","resolution":{"observed_at":"2026-08-01T06:12:42.989580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:43.155786Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.155786Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:e284f3582db8bb623ee8cbad8838376eb97d65bcb0e911bf69da8c40d5a93c1a","observation_id":"156b46a4-3d01-4dba-b295-8bd853c367dc","resolution":{"observed_at":"2026-08-01T06:12:43.155786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:43.299760Z","title":"Exponential moving av- erage normalization for self-supervised and semi- supervised learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.299760Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:1b06917146f4ce4a2563c8a6ad2d3f48eccf09b1df880fc7908ebff56a15ee7b","observation_id":"94a03cc4-6a09-411f-ab1a-3ab2fcaa2c62","resolution":{"observed_at":"2026-08-01T06:12:43.299760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:43.425331Z","title":"Iterative amortized policy optimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.425331Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:0edfd4ed58cf5e2fdd8f303ad71aa30867bfd7615fc0f1219b130a59c3cf59c5","observation_id":"246a3af9-8cc6-44cd-ade5-42df6ef4906a","resolution":{"observed_at":"2026-08-01T06:12:43.425331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.17811439","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-resolution sustain pedal depth estimation from piano audio across room acoustics,","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"fac4700e-bf04-476b-9f82-daf923c06ebe","year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.570627Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:9d7affc222a08cb06d1ec42cf0678db127fb048f3627ee4733c6ee0a5f509315","observation_id":"a2cf254a-9ada-4b50-b6b7-880df049d17f","resolution":{"observed_at":"2026-08-01T06:14:12.970082Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05169","last_updated":"2026-06-17T19:20:50Z","snapshot_observed_at":"2026-08-18T14:42:52.569969Z","submitted_at":"2025-07-07T16:23:46Z","title":"Critique of World Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05169","snapshot_observed_at":"2026-08-01T06:12:43.725257Z","title":"Critiques of world models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.725257Z"},"links":{"cited_paper":"/paper/2507.05169","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:8c2aaaac87f12cc96fe304069d9488729c661d3acbb954904a9dc53a57eb90b4","observation_id":"f6f71b0d-2307-4902-b745-7082e314e94b","resolution":{"observed_at":"2026-08-01T06:12:43.725257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13292","last_updated":"2024-02-22T21:07:10Z","snapshot_observed_at":"2026-08-16T15:21:46.303236Z","submitted_at":"2023-06-23T05:01:02Z","title":"Variance-Covariance Regularization Improves Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13292","snapshot_observed_at":"2026-08-01T06:12:44.487815Z","title":"Variance-covariance regularization improves representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.487815Z"},"links":{"cited_paper":"/paper/2306.13292","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:f9117fb5218d6628b516642d5232d17226320eb1147882f9c44600d44e4d69e2","observation_id":"8a428ec8-1cc0-4fc3-8f65-79261938f527","resolution":{"observed_at":"2026-08-01T06:12:44.487815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:43.975885Z","title":"PAN: A world model for general, interactable, and long-horizon world simulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.975885Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:d39f243c7f19fff0c2653624a2bf2d2d07bf5f0759694e0ebc75106b5db65a57","observation_id":"13c6c331-710a-4d62-a806-d0e079823859","resolution":{"observed_at":"2026-08-01T06:12:43.975885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.082214Z","title":"Pointworld: Scaling 3d world models for in-the-wild robotic manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.082214Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:1ea9f1d5b86b785d7916070dc2ca08b188136d0aa685f4e99ac823548f10fa83","observation_id":"d89bca9d-453e-47a2-9976-f60f22d1e218","resolution":{"observed_at":"2026-08-01T06:12:44.082214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.212978Z","title":"A theory of cortical responses,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.212978Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:6d03d80114ac2680277fe9a7fd5710e0aa3108451140bc35a548941d1e2e03a6","observation_id":"dc765bb4-dc8b-4fba-b9c3-8637aa5e78b8","resolution":{"observed_at":"2026-08-01T06:12:44.212978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.328214Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.328214Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:9bdf1c5a4c3efcd621cde89c20c9cad6683a7131476db92a736a247ed53cd187","observation_id":"6a24290f-0b31-4273-850d-d2c635c0b7bc","resolution":{"observed_at":"2026-08-01T06:12:44.328214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.391764Z","title":"London,Hearing in Time: Psychological Aspects of Musical Meter","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.391764Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:775b61d22c9a47909c8e37e4b2701ce5ba91f1a3f80d2bd9c6663170ec21b687","observation_id":"9b4f6962-1111-4dbe-85bd-83b6011ff5c9","resolution":{"observed_at":"2026-08-01T06:12:44.391764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.267246Z","title":"Unsupervised disentanglement of content and style via variance- invariance constraints,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.267246Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:07d583ec88543aeefd100daa4db5db054cdd8290648519ad3e6dc071d6dd0b54","observation_id":"4bc32673-fe35-43c8-b288-f6313b164ceb","resolution":{"observed_at":"2026-08-01T06:12:45.267246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.368586Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.368586Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:12b8ce4bea8a5a72df94567b0d175d0ede57736d232f1e6e2b923a89d5c40391","observation_id":"6514da8e-e5ab-445e-9b71-f24898f1bb08","resolution":{"observed_at":"2026-08-01T06:12:45.368586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.749398Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.749398Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:a5739250d2d073f58dcd367f78c2f0291d3d101bf89a34ea2526666efac3d334","observation_id":"d05699c8-aae3-4f8d-a96c-d4ac62eab95b","resolution":{"observed_at":"2026-08-01T06:12:44.749398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-08-20T11:45:33.231931Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-08-01T06:12:44.829189Z","title":"Lejepa: Provable and scalable self-supervised learning without the heuris- tics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.829189Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:6af5da64c85412664cdad5cdacbb419a8980b9ebd94d1db5326ac32ff4984ac4","observation_id":"d966f9b0-0e15-4ce9-bcc6-cdcef251e637","resolution":{"observed_at":"2026-08-01T06:12:44.829189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:44.941200Z","title":"Balancing information preservation and disentangle- ment in self-supervised music representation learn- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.941200Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:ff6fd8530a8a42205226367a676f433960acb089e4aa32e517c409eb2eb7164b","observation_id":"9038b9cb-4fe1-40c7-8495-8f074d0d2290","resolution":{"observed_at":"2026-08-01T06:12:44.941200Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.078693Z","title":"Audio barlow twins: Self-supervised audio represen- tation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.078693Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:aa58076f3cbf85511f7edf688094e749324907a92292475333a65c362e2d210e","observation_id":"68352f67-509d-4375-9439-a0ade8d4962e","resolution":{"observed_at":"2026-08-01T06:12:45.078693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.10265343","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PESTO: pitch estimation with self-supervised transposition-equivariant objective,","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"99efeb2e-99bb-481e-aa08-08e24accfc0b","year":2023},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.176714Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:5a687eb72603158f884984bbc901c197b6af2a202f621be919e9e67fa3aacfcd","observation_id":"0750932b-266f-4471-9fc8-6cd496787145","resolution":{"observed_at":"2026-08-01T06:14:12.590023Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-01T06:12:46.534103Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.534103Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:e3bdd56b71800ec7ba02c3715e5b9fa925473c5140ef23110101009c35f28d34","observation_id":"6be93974-6482-47b7-829c-3fced9f5bbe1","resolution":{"observed_at":"2026-08-01T06:12:46.534103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:46.694747Z","title":"Bootstrap your own latent - a new approach to self-supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.694747Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:3ea4860a57c1f986ada2779a7a7e368baac62e867007c27e5fbaf79af58f027a","observation_id":"5c7452a7-6724-491c-bea4-87ad6124a6fd","resolution":{"observed_at":"2026-08-01T06:12:46.694747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:46.826671Z","title":"ASAP: a dataset of aligned scores and performances for piano transcription,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.826671Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:834e86147a2377af82636c85f683c933bdd2677e4a70e1a6acc070981bb0b92e","observation_id":"441b6b8d-9ae3-4d50-a9e1-3af44a8d294c","resolution":{"observed_at":"2026-08-01T06:12:46.826671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.670142Z","title":"Closing the train-test gap in world models for gradient-based planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.670142Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:0b07ccb5de657e1bb32260b4b39613bc8b69c24fd3744b3ce6657293f3977a6b","observation_id":"5271a9ff-aece-468e-b047-8c0cb3beeb9c","resolution":{"observed_at":"2026-08-01T06:12:45.670142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.810095Z","title":"Tem- poral straightening for latent planning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.810095Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:bd7a9a141608682bdd052ed425a7fb65bbb61c715d8e23b303eba85aecf04089","observation_id":"7c58a97f-5e86-4c97-b493-11653bb3657a","resolution":{"observed_at":"2026-08-01T06:12:45.810095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:46.005798Z","title":"Tutorial on amortized optimization for learning to optimize over continuous domains,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.005798Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:5dedd39875a8b8315efeaf83bd2dbabc9a36c6b074b980f8ea0e1eec576a4483","observation_id":"2fbcf5b4-4e5f-43c5-a457-408cb5b44bc8","resolution":{"observed_at":"2026-08-01T06:12:46.005798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08732","last_updated":"2026-06-05T11:55:33Z","snapshot_observed_at":"2026-08-11T12:43:37.131156Z","submitted_at":"2026-05-09T06:36:23Z","title":"Latent Geometry Beyond Search: Amortizing Planning in World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08732","snapshot_observed_at":"2026-08-01T06:12:46.195503Z","title":"Latent geometry beyond search: Amortizing planning in world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.195503Z"},"links":{"cited_paper":"/paper/2605.08732","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:76720cb3fa2045e6144f6ea53cbb35f1ab60ccbbeacd202f7498bcbaa1f4c392","observation_id":"a9321afb-314f-4ed5-bea3-b7eb62499eda","resolution":{"observed_at":"2026-08-01T06:12:46.195503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:46.366841Z","title":"Enabling factorized piano music modeling and generation with the MAE- STRO dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.366841Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:dad34a9cbb2cd15d95e9fd3d7e6761b197c20dda96ed351c478e3c3513149877","observation_id":"b1c09ccd-d0d4-401b-9d21-d04dafb52111","resolution":{"observed_at":"2026-08-01T06:12:46.366841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.14877491","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beat this! accurate beat tracking without DBN postprocessing,","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"f961df58-67aa-4c7d-876a-a06f4a207d57","year":2024},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:47.066148Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:7171cbdf8e7a826878e17678dac6da233981243c6b56136bf1fcf616b6796be8","observation_id":"ede7d27e-11cb-4756-958c-b7b6e30ccba9","resolution":{"observed_at":"2026-08-01T06:14:12.164925Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:47.188376Z","title":"madmom: a new Python Audio and Mu- sic Signal Processing Library,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:47.188376Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:df17b1eb4c8f3fbe13228f98bc126aaebd08ba12c118ceebe5e81371d57f6dd5","observation_id":"b3cc2071-3d37-4f1b-8568-716014f3b21d","resolution":{"observed_at":"2026-08-01T06:12:47.188376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:47.335715Z","title":"High-resolution piano transcription with pedals by regressing onset and offset times,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:47.335715Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:449203f3842cfc3e03d0b65344a5844b6a8d8b528b3ac1b1b946e96086cc8941","observation_id":"eff797c3-b216-4486-bd87-9cf6ac6e3613","resolution":{"observed_at":"2026-08-01T06:12:47.335715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:47.498370Z","title":"Available: https://doi.org/10.1109/ TASLP.2021.3121991","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:47.498370Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:c809e538e01907d2ddae5eadaeeab953899840379ce3fc1862caa881be2f6e8c","observation_id":"ed5d03ec-d920-41ad-aec3-e60e99a8f1d3","resolution":{"observed_at":"2026-08-01T06:12:47.498370Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:47.611011Z","title":"Scoring time intervals using non-hierarchical transformer for automatic piano transcription,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:47.611011Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:957d19487bc15abd4b2882156939fdec7fae6ee323a77a337f5c1fbc62f3d4f5","observation_id":"8581351a-fa08-430a-872f-cf75d78ed15a","resolution":{"observed_at":"2026-08-01T06:12:47.611011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:46.922300Z","title":"Available: http://archives.ismir.net/ ismir2020/paper/000127.pdf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":541,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:46.922300Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:4de888c6d7a7c06f255e98b3cbdc2a1f0ace09b586b836cbbabf6a2137295418","observation_id":"aa78319c-ff7a-49b9-bd36-49d39fa6d2bc","resolution":{"observed_at":"2026-08-01T06:12:46.922300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:12:45.471023Z","title":"[Online]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:45.471023Z"},"links":{"citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:eb5ac1e0b69c73ec2a1aa724903e72c8a0b70da2cbc4ba17eb667454130b8b1a","observation_id":"28ab99fc-51d1-4b8f-916b-d5a64efef46c","resolution":{"observed_at":"2026-08-01T06:12:45.471023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13292","last_updated":"2024-02-22T21:07:10Z","snapshot_observed_at":"2026-08-16T15:21:46.303236Z","submitted_at":"2023-06-23T05:01:02Z","title":"Variance-Covariance Regularization Improves Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13292","snapshot_observed_at":"2026-08-01T06:12:44.623623Z","title":"Available: https://doi.org/10.48550/ arXiv.2306.13292","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:44.623623Z"},"links":{"cited_paper":"/paper/2306.13292","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:85c6f8218e2ec00196cfc701b4306cc3eb8c850f57d4e6469401077b92cbf0d6","observation_id":"ea6ddf7b-cf18-4572-b4dc-7a4905e03cbb","resolution":{"observed_at":"2026-08-01T06:12:44.623623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05169","last_updated":"2026-06-17T19:20:50Z","snapshot_observed_at":"2026-08-18T14:42:52.569969Z","submitted_at":"2025-07-07T16:23:46Z","title":"Critique of World Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05169","snapshot_observed_at":"2026-08-01T06:12:43.862975Z","title":"Available: https://doi.org/10.48550/ arXiv.2507.05169","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:43.862975Z"},"links":{"cited_paper":"/paper/2507.05169","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:70650f1eab4d5ccfe039d2f2a28ec1b7dd84200b718a0296fa245521fe389a9a","observation_id":"8c384633-909e-4c97-af7b-3a1a2a9b14f7","resolution":{"observed_at":"2026-08-01T06:12:43.862975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2607.22000."}