{"as_of":"2026-08-10T22:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:334fa4f2974311b007074e65af1c6d1f9517b6a1c82a6a52e8a6023d15fa589e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:10.142767Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12996/citation-record","integrity":"/paper/2507.12996/integrity","json":"/paper/2507.12996/citation-record.json","paper":"/paper/2507.12996"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.12210","last_updated":"2023-06-28T14:15:22Z","snapshot_observed_at":"2026-08-09T08:10:39.086440Z","submitted_at":"2023-04-24T15:49:53Z","title":"A Cookbook of Self-Supervised Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12210","snapshot_observed_at":"2026-08-06T16:39:06.123576Z","title":"A cookbook of self- supervised learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.123576Z"},"links":{"cited_paper":"/paper/2304.12210","citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:d71b4ae567fcd7813313a55513ba7ecf2e779cd7a35c515f68a2d11a363b5172","observation_id":"2fe4a21a-d2ed-4511-b347-6180486e21f9","resolution":{"observed_at":"2026-08-06T16:39:06.123576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.509418Z","title":"An experimental comparison of multi-view self-supervised methods for music tagging,","venue":null,"work_id":"a1251f6c-ea51-41eb-9b06-b0eca778c04a","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.198285Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:a64beb11adf33ed0e91f0a53287455f823fa3fcbcfb114ecde9f556dadd7476d","observation_id":"1ee98ac7-333b-4727-a5aa-9f4f98148951","resolution":{"observed_at":"2026-08-06T16:39:19.650436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.339320Z","title":"Contrastive learning of musical representations,","venue":null,"work_id":"14421583-8fe6-413a-b296-d35441965ad4","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.275515Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:f1e2dd1f9298cb1d4782eb36db5b8c7e457f8f4fa07bfb61820376e1de14c329","observation_id":"e13b67f7-4a86-4eb2-a04f-96cbe17a23e0","resolution":{"observed_at":"2026-08-06T16:39:19.413237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.147155Z","title":"Supervised and unsupervised learning of audio representations for music understanding,","venue":null,"work_id":"cd094124-6f28-4086-8f41-1dbab65f7a95","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.391504Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b07142be6beba5d79e0a34b1e5cec11bbb42b4b7d4424f980ddc13397b426394","observation_id":"ed5517f9-3ed9-4668-afbf-a4cbb9badf4c","resolution":{"observed_at":"2026-08-06T16:39:19.239335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.838474Z","title":"Leave-one-equivariant: Allevi- ating invariance-related information loss in contrastive music represen- tations,","venue":null,"work_id":"6f4a0dc8-d524-4ec0-90c0-2e864885e006","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.491071Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:04c3f6e9e74672e2110266cb722c100c683abfb6d8b369da28e33e4ddf6217bc","observation_id":"fcd90180-0da5-4409-a693-4887cfadda05","resolution":{"observed_at":"2026-08-06T16:39:18.938611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.471646Z","title":"Towards proper contrastive self- supervised learning strategies for music audio representation,","venue":null,"work_id":"0540ad3d-d6b9-4407-9818-ba8a809dc517","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.584398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:2d82ed9440b70eafa614cb5f370e374221912491806d8499251263ed8f16ffd2","observation_id":"3dfbb3a2-b9fe-4033-8fc7-f782a4619db3","resolution":{"observed_at":"2026-08-06T16:39:18.636505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.271169Z","title":null,"venue":null,"work_id":"464f509a-3db6-447a-8907-8029869c5cdd","year":2010},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.710962Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:209e86c179bca6360ed66a463cb2e776bca3d06fa808ec12e5395759ef2aed0b","observation_id":"5fd0c5d4-e01e-4c2b-9765-7941f7866e88","resolution":{"observed_at":"2026-08-06T16:39:18.354315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.031588Z","title":"Zero-note samba: Self- supervised beat tracking,","venue":null,"work_id":"f9bd5b22-235d-4332-b683-6f68e5652eac","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.783107Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:afeb19ecea1e0fcb7ab6bfb8505582c6780b51f51e1adf5a98df11f3d11d01ec","observation_id":"817544f3-d3cd-4c4f-a7e9-13ce2ef38eea","resolution":{"observed_at":"2026-08-06T16:39:18.176209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.761686Z","title":"SPICE: Self-supervised pitch estimation,","venue":null,"work_id":"0cdfd9dd-3b88-4f86-91e6-155d4bed7a48","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.851571Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:095fc140149f73300505a333ab8bb439ad9ec19e6a1045329d1bc5057d5608e3","observation_id":"7e74a78d-730c-4ea1-8ea6-1c1f69105a7b","resolution":{"observed_at":"2026-08-06T16:39:17.910210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.469216Z","title":"PESTO: Pitch estimation with self-supervised transposition-equivariant objective,","venue":null,"work_id":"ab1d4ee3-81fb-42c7-927e-494150e61352","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.947186Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:35bef9b4434d357e984f00c28527051945d3e7d4734b7e54cff310ff9c403bd9","observation_id":"09c6c241-01e9-47cd-8d0f-1e822d11e6d5","resolution":{"observed_at":"2026-08-06T16:39:17.612435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.202037Z","title":"Equivariant self-supervision for musical tempo estimation,","venue":null,"work_id":"387a0cc6-bd8d-4096-a753-541b952a90d3","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.024991Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:8ba607d6cd7f599463fc97cd2ae3f3d46efa279fff12d62d9a807d955d180e10","observation_id":"56ea1556-9f84-490c-a75b-996df1cba6df","resolution":{"observed_at":"2026-08-06T16:39:17.343428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.934737Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"edac9a7f-831b-472b-a481-391f37b20270","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.147424Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:807a02fd20537bf69c94702299fa587dea1743ddad9bbf7ff8df39bbec24dee5","observation_id":"3be5322f-8508-49cc-80a8-0f821c6cdaee","resolution":{"observed_at":"2026-08-06T16:39:17.052103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.720138Z","title":"A foundation model for music informatics,","venue":null,"work_id":"94f91c2d-bb44-4d92-88a9-9cb6c2c097ff","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.229386Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:884080deef1645a3317853a090688afe8111b9cb27e36ef3af5643db0a6de162","observation_id":"959c7398-da7a-4178-a5e1-bd55996d9723","resolution":{"observed_at":"2026-08-06T16:39:16.844938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.419633Z","title":"Multi-tasking with joint semantic spaces for large-scale music annotation and retrieval,","venue":null,"work_id":"d5cba502-3a66-44ae-9e8b-83af4758195c","year":2011},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.349970Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:db1ac03ff774112c802eb54723b6351025e8ff630347139adcbbb481f1d3deb2","observation_id":"29b309fb-390b-432c-b0c2-006db51e2935","resolution":{"observed_at":"2026-08-06T16:39:16.574363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.087587Z","title":"Transfer learning in MIR: Sharing learned latent representations for music audio classification and similarity,","venue":null,"work_id":"d2fcfbe9-511b-4b2b-9535-9c4b0f27f459","year":2013},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.477417Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:e3c08335d08932714673e6b338c501c915f90a08317f3c84d7a269e0a149c09f","observation_id":"9f94d96d-1757-496a-bd8c-780f2ac0430d","resolution":{"observed_at":"2026-08-06T16:39:16.272406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.757810Z","title":"The MIREX grand challenge: A framework of holistic user-experience evaluation in music information retrieval,","venue":null,"work_id":"400384be-d4ba-4752-8242-226dc8dc663c","year":2014},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.586303Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:3578e8b0fdd44aa43bcec2e45e891d249e6a998a485df372875c0737ba16522c","observation_id":"e2e13f93-62ba-4501-98e1-d96453e75fd9","resolution":{"observed_at":"2026-08-06T16:39:15.915095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.483059Z","title":"Cross task study on MIREX recent results: An index for evolution measurement and some stagnation hypotheses,","venue":null,"work_id":"abdad610-b70d-4252-bb77-7360da3267b6","year":2016},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.751761Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:e6103cdd7a13009a453fff732a25a50caa722f9d2039ce716fb4527833a929e2","observation_id":"8e2486d3-80ae-4ce1-b854-77a97fa9d150","resolution":{"observed_at":"2026-08-06T16:39:15.607290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.161577Z","title":"Multitask learning for frame- level instrument recognition,","venue":null,"work_id":"7eaf6e10-28bd-4e5f-aa70-177410831472","year":2019},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.815949Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:5f9f7d55aa81d2902841d197c79e49b0d21f459845d2eda7e8a692171b56b718","observation_id":"eb62518d-20b7-4422-a59b-b9f9a643f818","resolution":{"observed_at":"2026-08-06T16:39:15.329771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.941211Z","title":"One deep music representation to rule them all? a comparative analysis of different representation learning strategies,","venue":null,"work_id":"6d53a1e2-d368-43b2-be1d-3e46150245c4","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.923063Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:a0fe03062e044a3340df43dd8af10d81ec306497aa87a2b5b27ef07fd9bb7f1b","observation_id":"12e353a7-e3ef-4815-a55f-65ef60644bcd","resolution":{"observed_at":"2026-08-06T16:39:15.050061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.636341Z","title":"Multitask learning based deep learning model for music artist and language recognition,","venue":null,"work_id":"f7f20677-f1d5-402e-98f6-1e2663e28e5e","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.054398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:03514d1c496109d223fa6f3a428dcc6f907ac52164a0da479b2af1c632e2ee94","observation_id":"745be124-e777-413c-a87c-bc7f389cb750","resolution":{"observed_at":"2026-08-06T16:39:14.824319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.337839Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"596e2f06-550f-4074-931c-d0364d3d5e8f","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.140316Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:c2d46594975d05cca89088cff7d2a84dccf2af3a9901714fa20561daaac313ef","observation_id":"1c2404bd-3689-4e68-89cb-c4a661c7170e","resolution":{"observed_at":"2026-08-06T16:39:14.508969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.063413Z","title":"Emergent musical properties of a transformer under contrastive self-supervised learning,","venue":null,"work_id":"59fc1d47-9a69-4170-a0e6-9df478449e82","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.247736Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:789f762cd50ef198c9afe20bab339a729a8cb32730c33c39d5d89ed230722c95","observation_id":"e028789e-7348-48ce-82f8-4c0689b8f49b","resolution":{"observed_at":"2026-08-06T16:39:14.186329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.755415Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"ff181329-2816-42e9-9802-d3a4a0fc01af","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.357150Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b80c8a37589f611faa8eda1c028efc05289876e6e6ab9934ae5314210986230a","observation_id":"1685e77c-5974-4797-9f91-a096ec2d2d0d","resolution":{"observed_at":"2026-08-06T16:39:13.941756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.478968Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"0ef4eaca-d8a7-4067-a1f7-25325ed56b89","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.431114Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:c074853085234857aefa89d086e6bdeca2478e56fffd729b0cadbe22e77434b4","observation_id":"ea1a4756-c765-4d4c-bfa4-31cdf48cbc7a","resolution":{"observed_at":"2026-08-06T16:39:13.625911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.198215Z","title":"STONE: Self-supervised tonality estimator,","venue":null,"work_id":"c63c034d-a8ed-4b52-b9a9-92777ff9be28","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.550193Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:329b54beda34f75c38dc2fda29de73ba94384b3ad03f05b7997a0be00e2907a8","observation_id":"bd96e717-5916-42f3-a894-56617d7ff849","resolution":{"observed_at":"2026-08-06T16:39:13.356380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.969948Z","title":"S-key: Self-supervised learning of major and minor keys from audio,","venue":null,"work_id":"8895c4ea-990b-4967-b7fe-2af010d933b3","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.628087Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:5e2037242c129770e15867f1aeaa071525e81c31d7028116ff6a20cd2e1a8565","observation_id":"e815fed8-6ac9-4947-9683-92e8dd26e1f5","resolution":{"observed_at":"2026-08-06T16:39:13.093929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.738369Z","title":"Deep salience representations for f0 estimation in polyphonic music,","venue":null,"work_id":"e879265a-acdf-4bc9-a151-527422e50e8a","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.691067Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:2bb8b199e35d5e8ebb0135cfac27c1825d966d1e6bc107faa74cbbf1844a7621","observation_id":"a099fb61-c4ca-4198-afbe-78be05eb6c7f","resolution":{"observed_at":"2026-08-06T16:39:12.827193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.429510Z","title":"Vision transformers need registers,","venue":null,"work_id":"dc7dcaf1-efa9-49ae-88ac-18250a204d36","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.763168Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:830e9a43ab948b5c8aba77bcc2e61df1bd3f87d767af27b87229e245b7feb5c5","observation_id":"c5c43fd0-dff6-493f-8297-487a47c10a58","resolution":{"observed_at":"2026-08-06T16:39:12.561961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.251333Z","title":"Mctformer+: Multi-class token transformer for weakly supervised semantic segmentation,","venue":null,"work_id":"ccb6c97c-d58a-44e0-bf6c-8f51e64a89ec","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.931222Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:79cd4680b434bd6d43b9777ef20dc329dd79a2e8665068d48af61921e5ff181e","observation_id":"b2fd8ca1-0eed-465d-b40d-41e0b6c0a942","resolution":{"observed_at":"2026-08-06T16:39:12.363612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.052762Z","title":"Evaluation of algorithms using games: The case of music tagging,","venue":null,"work_id":"c3ef3211-c6bd-4a62-86c9-a084f79805bb","year":2009},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.997241Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:343b0c4536de353e4bdce7e48e7cfdfa941fbab8e139b9f3b974e2a8490f8985","observation_id":"dae52f66-3bbf-4969-9109-d82c9d64f4c4","resolution":{"observed_at":"2026-08-06T16:39:12.136057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.884240Z","title":"Sample-level deep convolutional neural networks for music auto-tagging using raw waveforms,","venue":null,"work_id":"000b6cb4-7b1d-49a7-ad72-ddffb7b2c9fc","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.178222Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:16eea031310a21d77bce288101b7fd53f6b2122f50252c39e463bfbcd1817cfe","observation_id":"b5fc4ea1-4f27-421f-8e31-320df4670369","resolution":{"observed_at":"2026-08-06T16:39:11.948872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.745267Z","title":"Orchideasol: A dataset of extended instrumental techniques for computer- aided orchestration,","venue":null,"work_id":"604c6a3b-b6f5-4f92-a3b9-e7f6a05066bd","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.268759Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:c91299b7ef47da4d4b1a6a4bfce4ab4b8a8aebb7c756412c5475b9edce1a683e","observation_id":"f57e0b9c-59cf-41f1-8993-0601c061da3d","resolution":{"observed_at":"2026-08-06T16:39:11.793813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.600009Z","title":"Fmak: A dataset of key and mode annotations for the free music archive — extended abstract,","venue":null,"work_id":"136837fe-2967-4e1e-b686-a9a2d638ff1e","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.358580Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:e65fd50bc69133e275e2d13c92a6687ca4bc501ab6c6cf58cd2f14b6941a56d1","observation_id":"fb7b11a9-cf16-4914-bc9f-73a996418e02","resolution":{"observed_at":"2026-08-06T16:39:11.672849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.429704Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":"e163ef2a-b153-4951-8cc1-dcefbef8bc7f","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.454741Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:80eaec850be5838c9f7f1cd4833bef55290c070707306ce41d48606c44234440","observation_id":"393583d8-0ce4-4acb-9abe-90f78d0c1ea2","resolution":{"observed_at":"2026-08-06T16:39:11.533105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.274449Z","title":"Two datasets for tempo estimation and key detection in electronic dance music annotated from user corrections,","venue":null,"work_id":"08a4d1ec-1721-40d4-a3c2-b394852318ad","year":2015},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.556145Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:af0b5827a474b6b87711492abb8fbacda45192f6dbd5c061874e5ab078cda146","observation_id":"3063df87-6c82-4bd2-a98a-4edb867b5bb5","resolution":{"observed_at":"2026-08-06T16:39:11.347013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.078591Z","title":"mir eval: A transparent implementation of common mir metrics","venue":null,"work_id":"b428c915-ea44-4080-90cc-840f533967c4","year":2014},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.677788Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:3b0f9092b2fc78e778d117be97feec8d2e5efb60edb2dfb0653f4b93b544618a","observation_id":"ba2be996-a008-4fa1-b968-c597459a6d6d","resolution":{"observed_at":"2026-08-06T16:39:11.165774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.876900Z","title":"A review of rhythm description systems,","venue":null,"work_id":"2ad5ac39-bd43-4005-aa3a-8975f17e4b72","year":2004},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.776398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:0f295556e2c1c3011171d91fcdf566f8b70e541a8d7bddacd0f888bdf2ef49c2","observation_id":"62925702-eec5-4920-b9c8-4065d1b5b725","resolution":{"observed_at":"2026-08-06T16:39:10.976116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.683197Z","title":"Gtzan-rhythm: Extending the gtzan test-set with beat, downbeat and swing annotations,","venue":null,"work_id":"cafa4277-aaa0-4b1e-bd22-fa8f3dc61162","year":2015},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.901899Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b16ef5f7b5399f3cb13b13ded58601572ff3401b8fa223d89f4559ed51b9e649","observation_id":"3ba7d9b7-59eb-4f66-a93e-aa8c1812e7e7","resolution":{"observed_at":"2026-08-06T16:39:10.785159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.477344Z","title":"Schubert winterreise dataset: A multimodal scenario for music analysis,","venue":null,"work_id":"86922354-1121-4723-b013-412435a9bbf4","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:10.024726Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:34b1c74b3153424229d0dd07b448760219b9a6903655fb6da18141deacc3d2ac","observation_id":"fb905377-11eb-4d42-9753-ac852c47c827","resolution":{"observed_at":"2026-08-06T16:39:10.578157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.252233Z","title":"RWC music database: Popular, classical, and jazz music databases,","venue":null,"work_id":"550b6565-154f-40ce-b1e4-f6429246aadb","year":2002},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:10.142767Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:0d03bc1e1efcf3eb7cb4f0e39c365d1fb4770cd4bf9459b2bc5bde2b87b4391c","observation_id":"2ed7c51a-01ef-4468-9312-d07b6765a3a5","resolution":{"observed_at":"2026-08-06T16:39:10.328692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:11:41.560166Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.12996."}