{"as_of":"2026-08-20T13:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b19146a6c7270fccd1050fca8fed1a30273365116508d067cbb989bdb119ca3c","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T22:50:19.910504Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06929/citation-record","integrity":"/paper/2607.06929/integrity","json":"/paper/2607.06929/citation-record.json","paper":"/paper/2607.06929"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":"2301.11325","doi":"10.48550/arxiv.2301.11325","metadata_source":"pith","pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MusicLM: Generating Music From Text","venue":"cs.SD","work_id":"15e6566e-1c36-468f-966e-823248cbf87f","year":2023},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:f530fa58ae948aecef5de26e94d862b5e525d5a8a99747e69fad9ed473eea186","observation_id":"1072641c-65d8-42b1-8537-ad07252dc834","resolution":{"observed_at":"2026-07-09T22:56:37.696138Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.46452+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.46452+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.08638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.699753Z","title":"Yue: Scaling open foundation models for long-form music generation.arXiv:2503.08638","venue":null,"work_id":"d0baf14e-f5a5-426c-bc66-4abebd8513e5","year":2025},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:65f0fbd358c6592ec347656b9506ca612bf105b30f5dd00ce81c874906b3822d","observation_id":"44298672-28fe-4ed1-b597-0e77f43a5107","resolution":{"observed_at":"2026-07-09T22:56:37.701417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-16T15:25:26.441326Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":"2306.05284","doi":"10.48550/arxiv.2306.05284","metadata_source":"pith","pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Strongly Recommend Advancing","venue":"cs.SD","work_id":"4b90222e-9c2e-41db-925e-e8dd0f3a18ee","year":2023},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:b532b43ea44d6f523408bb5313cbfa6c191f786c5f228c6b025473550a8e023f","observation_id":"600d09f4-f8de-4494-9ec8-54884b5f3f2b","resolution":{"observed_at":"2026-07-09T22:56:37.707451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11521","last_updated":"2023-04-23T03:02:24Z","snapshot_observed_at":"2026-08-17T22:13:37.044083Z","submitted_at":"2023-04-23T03:02:24Z","title":"An Order-Complexity Model for Aesthetic Quality Assessment of Homophony Music Performance","version":1},"cited_work":{"arxiv_id":"2304.11521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11521","snapshot_observed_at":"2026-07-09T22:56:37.672882Z","title":"An Order-Complexity Model for Aesthetic Quality Assessment of Homophony Music Performance","venue":"cs.SD","work_id":"01debc54-1e09-4af2-90e8-cca437c407fa","year":2023},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2304.11521","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:5deb348f1798bad0ab8bfca705df184190fd3415489d7936dfcd81cb8b315e64","observation_id":"e7f9d0d1-e9b9-4121-a88e-17fbe8afea2a","resolution":{"observed_at":"2026-07-09T22:56:37.674070Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10127","last_updated":"2026-04-11T09:44:39Z","snapshot_observed_at":"2026-08-11T07:19:28.315587Z","submitted_at":"2026-04-11T09:44:39Z","title":"VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation","version":1},"cited_work":{"arxiv_id":"2604.10127","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10127","snapshot_observed_at":"2026-07-09T22:56:37.668187Z","title":"VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation","venue":"cs.CV","work_id":"8f6ee422-1bfa-43eb-8ea3-04f3dce00966","year":2026},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2604.10127","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:8ea2a47fdbbed0c0ab0a9b98c9bf484046d928c35dab7cbf745cdaf6435017c5","observation_id":"f846dc8d-16f9-4d8f-af17-f167e909f6d7","resolution":{"observed_at":"2026-07-09T22:56:37.669414Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10811","last_updated":"2025-03-24T02:05:18Z","snapshot_observed_at":"2026-08-18T18:51:14.782062Z","submitted_at":"2025-01-18T16:21:03Z","title":"MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation","version":2},"cited_work":{"arxiv_id":"2501.10811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10811","snapshot_observed_at":"2026-07-09T22:56:37.677472Z","title":"MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation","venue":"cs.SD","work_id":"a0a19dae-6017-4572-b0ad-505115947e6a","year":2025},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2501.10811","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:4fa7fedc97f1856b0d1fe21b5c04bb15d271909db4e5ee8c0e74687204ac91af","observation_id":"59ce9b40-46a9-4d32-bdd8-1ed7ce3ca9e2","resolution":{"observed_at":"2026-07-09T22:56:37.678628Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-20T10:52:40.332252Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":"2505.10793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-07-09T22:56:37.679926Z","title":"Songeval: A benchmark dataset for song aesthetics evaluation","venue":"eess.AS","work_id":"5ad9ecc6-62c4-4e76-92e6-cacef751ad78","year":2025},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:6a0705679ace61c404203961cd767c3628d673cc2be855ab7fee3ce805f2d2ac","observation_id":"d667087a-b95b-4c98-8d1d-e65143c5955e","resolution":{"observed_at":"2026-07-09T22:56:37.681071Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:cffc76ab1aa729ff46150b9bb3a39e6c9bbebe0303adde40bee0e18ec400c810","observation_id":"d964627b-e420-4bcf-9b05-9f5d78d2e872","resolution":{"observed_at":"2026-07-09T22:56:37.666824Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":"2006.11477","doi":"10.48550/arxiv.2006.11477","metadata_source":"pith","pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"URL http://proceedings.mlr.press/ v37/allamanis15.html","venue":"cs.CL","work_id":"453ebac7-2aaa-4384-b2aa-2f73ad059753","year":2020},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:efe3088aa064e7ff407732e41efd45337038c87784eef6e853657474e85d8ed9","observation_id":"5f366497-13ab-40eb-81e1-dc16c74b7c3e","resolution":{"observed_at":"2026-07-09T22:56:37.686760Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T00:08:08.626994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T00:08:08.626994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-17T12:58:40.139613Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":"2501.01108","doi":"10.48550/arxiv.2501.01108","metadata_source":"pith","pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Haina Zhu, Yizhi Zhou, Hangting Chen, Jianwei Yu, Ziyang Ma, Rongzhi Gu, Yi Luo, Wei Tan, and Xie Chen","venue":"cs.SD","work_id":"48366d59-00f5-4520-b358-abd9b902cd3a","year":2025},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:f20486c2db02e80552ff05365303564beb03e2696941518f1804e3d5c5dce51d","observation_id":"898bec03-8a77-490c-93c9-935918f5a392","resolution":{"observed_at":"2026-07-09T22:56:37.689183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-20T05:49:02.872593Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":"2306.00107","doi":"10.48550/arxiv.2306.00107","metadata_source":"pith","pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training","venue":"cs.SD","work_id":"8ca81655-3a26-4090-9e0e-9dd15160c862","year":2023},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:a5034940a6283dfcd03f5957442f19c02952677b51e8f52695431216f9fc889a","observation_id":"6dfb6e8a-eceb-49a8-86e2-e512d2929b61","resolution":{"observed_at":"2026-07-09T22:56:37.693891Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10211","last_updated":"2020-08-23T11:35:41Z","snapshot_observed_at":"2026-08-12T19:49:09.064060Z","submitted_at":"2019-12-21T06:53:14Z","title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition","version":5},"cited_work":{"arxiv_id":"1912.10211","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.10211","snapshot_observed_at":"2026-07-09T22:56:37.702722Z","title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition","venue":"cs.SD","work_id":"2d1f190f-2582-4f80-8c4b-3d9e4e20baaa","year":2019},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/1912.10211","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:d1a5655d7e0a59d25e23309abe9628c5c893302759b7e49e58271ec98ec30b87","observation_id":"78d1d03f-b467-40ad-987b-e1ac16b2d8a7","resolution":{"observed_at":"2026-07-09T22:56:37.704915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00874","last_updated":"2022-02-02T04:49:14Z","snapshot_observed_at":"2026-08-16T17:24:12.630977Z","submitted_at":"2022-02-02T04:49:14Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","version":1},"cited_work":{"arxiv_id":"2202.00874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.00874","snapshot_observed_at":"2026-07-09T22:56:37.675185Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","venue":"cs.SD","work_id":"a196a57a-d6b8-4658-8800-846914828164","year":2022},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2202.00874","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:360774f90ec76a95dc59a2468484c3af7e49a72dfe9ba4479649127a344a3fa9","observation_id":"2006652f-8513-41f3-a7e3-23792a6fb7ef","resolution":{"observed_at":"2026-07-09T22:56:37.676298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-16T16:16:42.565130Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":"2211.06687","doi":"10.48550/arxiv.2211.06687","metadata_source":"pith","pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":"cs.SD","work_id":"7200ddfe-1f8b-4745-8f2f-7d7dcecf6a46","year":2022},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:de3111587c2811f5bf96c71c31e372e255e23fcbe482c1adf6ef5cc152766db2","observation_id":"b51faf86-aaf9-4d13-bebe-22df0c5875a7","resolution":{"observed_at":"2026-07-09T22:56:37.698704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:9686e1fffa8af552e9be4eb1862beb459a13c11668773d215f2f9b0ac13e32b1","observation_id":"d12fc94d-a7a1-498d-9425-c935bf44bf23","resolution":{"observed_at":"2026-07-09T22:56:37.671742Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:03.600265Z","title":"In: Zong, C., Xia, F., Li, W., Navigli, R","venue":null,"work_id":"8d675bdd-79ca-48d6-9163-fc17ce0e8ece","year":2024},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:677dc77d99ff328a8ea2f61cbd05d5a6b97d00299261b80fea127973f88266b5","observation_id":"f71dce6b-3382-45ae-8e88-1d384566a4c6","resolution":{"observed_at":"2026-07-09T22:56:37.576043Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09871","last_updated":"2024-06-13T13:36:28Z","snapshot_observed_at":"2026-08-16T14:18:21.270142Z","submitted_at":"2024-02-15T10:55:01Z","title":"MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music","version":4},"cited_work":{"arxiv_id":"2402.09871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.09871","snapshot_observed_at":"2026-07-09T22:56:37.690375Z","title":"MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music","venue":"cs.SD","work_id":"5972c9da-ecd2-4699-b6a1-6bc0ea9382aa","year":2024},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2402.09871","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:2b58bd6bb1c5d7649c7dc48d978802c93be79aa594149bc5f57f7b510ed879b8","observation_id":"b7a178b7-dd9b-4d32-8089-5881920c0e1d","resolution":{"observed_at":"2026-07-09T22:56:37.691467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T22:50:19.910504Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.06929"},"observation_digest":"sha256:cca281ca6b69306559548931be6225c81ba7c50df43b1af43184f75b95c75644","observation_id":"51ab03d3-e8b9-42c9-9972-1da17493b4bf","resolution":{"observed_at":"2026-07-09T22:56:37.684247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06929","last_updated":"2026-07-08T02:49:29Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T20:43:49.691551Z","submitted_at":"2026-07-08T02:49:29Z","title":"MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2607.06929."}