{"as_of":"2026-08-17T17:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03e1224a71a9b2ef5cd53636082c740d98041d1a9b7587d41911d664848d5498","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:53:18.015252Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:53:15.843405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12222","snapshot_observed_at":"2026-08-03T09:53:15.843405Z","title":"Our frame- work outperforms two strong baselines across all four stan- dard metrics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.843405Z"},"links":{"cited_paper":"/paper/2601.12222","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7ef7a7aeb6cb13f2a82ec1675b715ff9413051a3efc5be1684e78b72f3215c51","observation_id":"28e5def6-3a69-4942-955f-01106ae65b38","resolution":{"observed_at":"2026-08-03T09:53:15.843405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.12222/citation-record","integrity":"/paper/2601.12222/integrity","json":"/paper/2601.12222/citation-record.json","paper":"/paper/2601.12222"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.766397Z","title":"This highlights the urgency for automated song aesthetics evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.766397Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:3c1c3abaf315750b2b7a79d8992727e9e82c06b8c8e786074dd4a30f1998f323","observation_id":"b7405806-77a9-40c0-9151-de434ba94455","resolution":{"observed_at":"2026-08-03T09:53:15.766397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.898451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.898451Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:e014bae48cae86362844e2add8abf70e3cf994efec4355b29e83482c7c4a6dbd","observation_id":"6b9eee91-095f-4f41-a56d-3f092280d4a2","resolution":{"observed_at":"2026-08-03T09:53:15.898451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12222","snapshot_observed_at":"2026-08-03T09:53:15.843405Z","title":"Our frame- work outperforms two strong baselines across all four stan- dard metrics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.843405Z"},"links":{"cited_paper":"/paper/2601.12222","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7ef7a7aeb6cb13f2a82ec1675b715ff9413051a3efc5be1684e78b72f3215c51","observation_id":"28e5def6-3a69-4942-955f-01106ae65b38","resolution":{"observed_at":"2026-08-03T09:53:15.843405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.987946Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.987946Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:a2171bd03405acfd15c9e23f332f3b688ee4f65ca4ce3fab22f9ce8fcd7b43d1","observation_id":"6cbd7d0f-c4a0-4891-99ff-df24604e2729","resolution":{"observed_at":"2026-08-03T09:53:15.987946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.933102Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.933102Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:1e352bf85f3246045f1cf24e8c1df52fb18c66955fbd5442099d530ff5a518c2","observation_id":"702cce5f-3306-4178-9229-f9048c362e89","resolution":{"observed_at":"2026-08-03T09:53:15.933102Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.591925Z","title":"Musiceval: A generative music dataset with expert rat- ings for automatic text-to-music evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.591925Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:4cb821497c31c645818d8d1a95af66d45b40568cda23911b868768e4ba197f65","observation_id":"ea79b601-4054-4930-9b40-565d6bca1f48","resolution":{"observed_at":"2026-08-03T09:53:16.591925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.089451Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.089451Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:06de4108928e0d61b1c036416f362165a876c9e857884f60319b2de5b9852a5a","observation_id":"b6bf4394-ebdf-4294-8c0e-85c4502f22c5","resolution":{"observed_at":"2026-08-03T09:53:16.089451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.806089Z","title":"However, these studies mostly do not target full-length song aesthetics evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.806089Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:c7c298b173b4380552617605dc28ab52ec6064d578ac3b6ce571bb3ac85abb3e","observation_id":"37942e44-ed09-4f36-9d98-dac668ad1b02","resolution":{"observed_at":"2026-08-03T09:53:15.806089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.169145Z","title":"Ldnet: Unified listener dependent mod- eling in mos prediction for synthetic speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.169145Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:28e5170c3d3e8b28464042691dfa13855699dbcdf07a50a3cb3d1d968982929a","observation_id":"17f71b31-c5a4-4901-a927-9e71fd295ea9","resolution":{"observed_at":"2026-08-03T09:53:16.169145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.236180Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.236180Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:5ff7817a1e46dad4feb3a6c3719c28c08e4492c6938e33a7b9422cb12f8d85d6","observation_id":"d4cfbd10-8a22-405e-9cf2-3efbae58ffa7","resolution":{"observed_at":"2026-08-03T09:53:16.236180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.299735Z","title":"Pitch-and-spectrum-aware singing quality assessment with bias correction and model fu- sion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.299735Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:2cc73aecf402a23d7ff11b42c7368aba92d2f5e5293e207415fd1ecaf89b14ec","observation_id":"2b1d64be-1e71-42cd-8b71-bbffef20880d","resolution":{"observed_at":"2026-08-03T09:53:16.299735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.429516Z","title":"End- to-end automatic singing skill evaluation using cross- attention and data augmentation for solo singing and singing with accompaniment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.429516Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:cb522aad1b1549b3b0d306b21212b2b2192b8e144413dfacd57d00773bb0df32","observation_id":"a10ba54a-1c1e-49ac-aae4-b5efe1f27d56","resolution":{"observed_at":"2026-08-03T09:53:16.429516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-03T09:53:16.690620Z","title":"The audiomos challenge 2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.690620Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:e342d966bed81364ebcf481b6bdd4b303e6a4effecc40e4f6c47dfd72c42a023","observation_id":"08935185-338f-4cbd-a06d-1242a073ac96","resolution":{"observed_at":"2026-08-03T09:53:16.690620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.750745Z","title":"Mm- mos: Multi-domain multi-axis audio quality assess- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.750745Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:1d875fbf2c92f498ef01caec99a0dcea368579d4baee98b4edf6d3191b76bfc4","observation_id":"3a901e94-5d4c-499a-b71d-94067222f9fe","resolution":{"observed_at":"2026-08-03T09:53:16.750745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-17T16:15:29.907985Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-03T09:53:16.809406Z","title":"Meta au- diobox aesthetics: Unified automatic quality assess- ment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.809406Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:9ffff0120cb41ad5ad121855df3a25928fd5d6dafe52f8395f750fc3cb2dce0a","observation_id":"c06d3fcd-d518-4eb5-bc67-a7ce980af0e0","resolution":{"observed_at":"2026-08-03T09:53:16.809406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-15T21:01:03.472765Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-08-03T09:53:16.885407Z","title":"Songeval: A benchmark dataset for song aesthetics evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.885407Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:75a2beb143d84fc9a603d2d3e46b89eed39656c635c93e318015e7df37239848","observation_id":"99d3aa96-020d-4d69-b566-d6b70846536d","resolution":{"observed_at":"2026-08-03T09:53:16.885407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.977985Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.977985Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:d946669f2379bf9d75ce6794cce47542a84b04f7233c516b5ea7c0511bba222f","observation_id":"4653ee49-b08f-45d8-9268-1313cfc42ab7","resolution":{"observed_at":"2026-08-03T09:53:16.977985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-17T12:58:40.139613Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-03T09:53:17.035715Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.035715Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:29add03ad2c01404783e83f87534923181b6f75e6f12149de195ed1b05096853","observation_id":"17484b94-1b38-4d80-bc7d-a3ef2264da95","resolution":{"observed_at":"2026-08-03T09:53:17.035715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.070696Z","title":"Cbam: Convolutional block attention module,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.070696Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:218b8cf50e1efc6a517bc7cd6794c9dad0d3f7f0a94c4a03ea8397208671176d","observation_id":"93dcecb5-14d0-417f-b9e3-b4715020a88e","resolution":{"observed_at":"2026-08-03T09:53:17.070696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.140292Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.140292Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:dc0c92aed39e8e2ddceb254aba0a450d45d71767b7e12f42d96133eb12a1cb6c","observation_id":"78ea390a-8489-46ea-b467-1628e38268ce","resolution":{"observed_at":"2026-08-03T09:53:17.140292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.238396Z","title":"Perceiving longer sequences with bi-directional cross- attention transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.238396Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:efb191dfe3f67a49984347e7652853d3e90a0da3478a7da869e164ce2818d5f1","observation_id":"6790b825-1cfc-4ff6-af6a-61e8e1407f45","resolution":{"observed_at":"2026-08-03T09:53:17.238396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.401352Z","title":"A hierarchical de- pression detection model based on vocal and emotional cues,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.401352Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7cac45db9586e1a6dd1b172d7683c489f4b7473d5dc78872b708d756e981ee88","observation_id":"6f43bb73-d39d-4a57-8256-ef87a8adb9e0","resolution":{"observed_at":"2026-08-03T09:53:17.401352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.519523Z","title":"Generalization ability of mos predic- tion networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.519523Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:e374598d758d194055fa73786275ce3a81dc6dd08e0b5832e04a8dc76db1ea9d","observation_id":"c466f080-c757-400d-9a82-d98609a7bc1d","resolution":{"observed_at":"2026-08-03T09:53:17.519523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.705420Z","title":"The voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.705420Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:8a0185439385213fd1ad6ec3c022684834209646e9e33648024f30b8715a1768","observation_id":"3f5fd9d6-7dab-4516-a51a-97895b31a49a","resolution":{"observed_at":"2026-08-03T09:53:17.705420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12203","last_updated":"2021-11-24T00:10:35Z","snapshot_observed_at":"2026-08-16T17:39:46.662059Z","submitted_at":"2021-11-24T00:10:35Z","title":"KUIELab-MDX-Net: A Two-Stream Neural Network for Music Demixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12203","snapshot_observed_at":"2026-08-03T09:53:17.817175Z","title":"Kuielab-mdx-net: A two-stream neural network for music demixing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.817175Z"},"links":{"cited_paper":"/paper/2111.12203","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:e5d6dd08fa81b74b257ac3a265c4d2613cd59d9f45e0b0e76dfcf6760aae2ce5","observation_id":"c7fbf6b8-7ecb-4764-9616-b8ef4d518f91","resolution":{"observed_at":"2026-08-03T09:53:17.817175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:18.015252Z","title":"The voicemos challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:18.015252Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:1f8cda5629c9983fe4ae99737d8e03b7412ad24ab953c631098fb0e55831bd77","observation_id":"e783e582-dc98-4ab4-8397-0f925ded92d6","resolution":{"observed_at":"2026-08-03T09:53:18.015252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2601.12222."}