{"as_of":"2026-08-10T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10e992fe5f75d57d278d849a7bfca23324dd7fd5e2c6f8b6bc7412617945e8ad","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:16:56.451078Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05899/citation-record","integrity":"/paper/2506.05899/integrity","json":"/paper/2506.05899/citation-record.json","paper":"/paper/2506.05899"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T10:16:54.146491Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.146491Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:2f963c9047df6521ffaad6467c34e46ab63f642f892bdea58f2a1fc8992101ec","observation_id":"7bc31a3e-2706-46af-8798-ee2fc057ec8a","resolution":{"observed_at":"2026-08-07T10:16:54.146491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T10:16:54.194385Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.194385Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:35e9d33411c5141db2b3d305152236e4d3532a5da5262944d92ab70002bc501f","observation_id":"ad315d80-4b72-4627-83d5-86978052c1e7","resolution":{"observed_at":"2026-08-07T10:16:54.194385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.548016Z","title":"Fast timing- conditioned latent audio diffusion,","venue":null,"work_id":"83c70d40-e7b3-4dea-8b51-c7bf68cc4258","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.243298Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:f71d4453affe5b08faf5409e26a771599fc2ee6a92656f8d66df9a2920335433","observation_id":"bcc3cde5-97b3-4695-8872-6c514b116744","resolution":{"observed_at":"2026-08-07T10:16:59.613505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.384128Z","title":"Musiceval: A generative music dataset with expert ratings for automatic text-to-music evaluation,","venue":null,"work_id":"4f0969bb-9ccd-487e-8c21-c4eaccff39a7","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.337412Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:ae7c1a39087c3fe94702c39ec6e666e9b16949c00ce44edcedcf8df1d786ed43","observation_id":"c2eda0e4-5e05-4345-8d6b-d655fcd3f419","resolution":{"observed_at":"2026-08-07T10:16:59.450106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.248724Z","title":"SSL-MOS: A Self-Supervised Learning Based Approach with A Transformer Target Model For MOS Pre- diction,","venue":null,"work_id":"6f2934bc-d9f7-48ff-8f93-5232006baed7","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.454075Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:0fb6261ada933a9fa9b3c07196b8327e2fa458b33fef060de8fa983dde4cfc1b","observation_id":"faae7500-a287-40ef-b230-0f8e7653af5a","resolution":{"observed_at":"2026-08-07T10:16:59.291059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.108455Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"a3525554-ab62-4585-b555-4152c67ed63d","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.513674Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:a367db6684808cc03c2ceebebb73789e9713d1b3933f23f67d3c153d5b5de3a7","observation_id":"c88a3958-4fb3-4d70-9463-13037c7bb64e","resolution":{"observed_at":"2026-08-07T10:16:59.161316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.970510Z","title":"MOSNet: Deep learning based objective assessment for voice conver- sion,","venue":null,"work_id":"ac03f78c-439e-4fdb-8f60-cd9e19dd9538","year":2019},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.583734Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:ca7f18ad90ea1998eef2f47c034743d7960822076c50a5dd618328c5ddcdd397","observation_id":"009ebc16-5eae-417e-a12e-54ec420aee6e","resolution":{"observed_at":"2026-08-07T10:16:59.028276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:54.648042Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.648042Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:f9764afeed99bee77871185cbaa307e77a3005c13ddcbbab5cb032b4723d3754","observation_id":"9d4e82e1-9659-4400-b67a-79047a6b82c5","resolution":{"observed_at":"2026-08-07T10:16:54.648042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T10:16:54.739123Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.739123Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:591005b814375d0e5a320ed3bbda9b184d233a3df897bb69e1a1a67815a396bb","observation_id":"ab3abf6f-2794-4f18-af57-8b4cd7e9445c","resolution":{"observed_at":"2026-08-07T10:16:54.739123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.821717Z","title":"Efficient optimal transport algorithm by accelerated gradient descent,","venue":null,"work_id":"1fb48336-d0e7-41ad-8cbb-2ec75562cbee","year":2022},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.811164Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:63321bf2bf5be0bf5bd552b8c04691de69eaf898563a310cc137b0d7f6b51cb8","observation_id":"f12e455d-4998-41ec-b50a-b64df0ffd3f0","resolution":{"observed_at":"2026-08-07T10:16:58.868162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:54.921831Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.921831Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:1bb3ebc12237e39befa91c3e8f7214856cbb59395ac841d62acd276081533a9f","observation_id":"eceb604f-d319-4102-b005-320ad57c850d","resolution":{"observed_at":"2026-08-07T10:16:54.921831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-07T10:16:55.010659Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.010659Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:19d10f396547b0f10c1427cd4b0ab5056d4f07cfa0269a86287ca0cee222dac3","observation_id":"2fb0be64-6805-4edd-bb43-a0989960304e","resolution":{"observed_at":"2026-08-07T10:16:55.010659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.648516Z","title":"Simple and controllable music generation,","venue":null,"work_id":"02b8f7da-db25-4762-a853-af36437b5cc4","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.126990Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:f2faeb6cd8d0e24362be1fd5d5f40fc4701abf14d32b2ecd9cbc4370ca9745ea","observation_id":"6cf873c1-3055-466d-8794-ed5457ae00cb","resolution":{"observed_at":"2026-08-07T10:16:58.722622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.438131Z","title":"Mo ˆusai: Efficient text-to-music diffusion models,","venue":null,"work_id":"8aa672ce-ea2b-4773-aed7-cb7014309b39","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.247126Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:febaee290dfefacdf1175aa5b39afcd55774323180494d0803f20ca563deb87f","observation_id":"b117bfbd-7da0-466e-a6db-321892dbb1ee","resolution":{"observed_at":"2026-08-07T10:16:58.515398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.288278Z","title":"Musicmagus: Zero-shot text-to-music editing via diffu- sion models,","venue":null,"work_id":"995879ac-59f3-4d45-9441-a42fcbef94cb","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.371848Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:a9a48776eff7d931ed61ba7e8aed41f886d3429a34876235393c9eb64db511e1","observation_id":"110b80d9-f855-4f71-a97d-7964703822bf","resolution":{"observed_at":"2026-08-07T10:16:58.341182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-07-06T18:41:18.308899Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-07T10:16:55.490675Z","title":"High fidelity text-guided music generation and editing via single-stage flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.490675Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:3eb7538939fbea14d8775a21e0364d0fe63adeca0b2c785472995d1bd42b2d36","observation_id":"32b714ee-bd08-48cd-a7fa-e2067ef54485","resolution":{"observed_at":"2026-08-07T10:16:55.490675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01546","last_updated":"2023-08-03T05:35:37Z","snapshot_observed_at":"2026-08-09T18:02:06.315597Z","submitted_at":"2023-08-03T05:35:37Z","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01546","snapshot_observed_at":"2026-08-07T10:16:55.607323Z","title":"Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.607323Z"},"links":{"cited_paper":"/paper/2308.01546","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:1ea2708d13200f5f6c56687c45d006bfca22ff910db6e4e73d59a42f9f1bae7b","observation_id":"948aa870-0d5d-40a3-8c25-d567d71de983","resolution":{"observed_at":"2026-08-07T10:16:55.607323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.060688Z","title":"Mospc: Mos prediction based on pairwise comparison,","venue":null,"work_id":"02ffd010-14d1-4470-a2c0-0e52e55eaac3","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.727593Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:68786d2ff8a0f7e8a0ab652f48a34d31c8646c2bca253c552d2c3d286e59baca","observation_id":"fcda9ac2-ff87-4e34-9b23-1215077a15cb","resolution":{"observed_at":"2026-08-07T10:16:58.187547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.773083Z","title":"Resource-efficient fine- tuning strategies for automatic mos prediction in text-to-speech for low- resource languages,","venue":null,"work_id":"21d4ff57-9202-43d1-bacc-67ade25cf4d3","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.786881Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:5d7aa37d4c8fa4c67ade8a9d63a955eb6aa5d252ead7ede5b5ff324cffdda061","observation_id":"e78a8927-adc8-4697-9afa-7ca3b1b274bc","resolution":{"observed_at":"2026-08-07T10:16:57.910254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.538744Z","title":"Zero- shot out-of-domain is no joke: Lessons learned in the voicemos 2023 challenge,","venue":null,"work_id":"748a6ef4-bcb8-4844-bc1c-c38b5b11f36f","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.905504Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:7216c8867c033d208d24c13856fb81fe68104ef20fbc8bdc13b1d3e519ef187d","observation_id":"622b45c8-a352-4575-9197-7d1cc3bbd279","resolution":{"observed_at":"2026-08-07T10:16:57.645210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20447","last_updated":"2025-04-29T05:45:09Z","snapshot_observed_at":"2026-08-07T15:58:21.855370Z","submitted_at":"2025-04-29T05:45:09Z","title":"APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20447","snapshot_observed_at":"2026-08-07T10:16:56.066230Z","title":"Apg-mos: Auditory percep- tion guided-mos predictor for synthetic speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.066230Z"},"links":{"cited_paper":"/paper/2504.20447","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:c6e75a5836b90f22640aa3b87f3acfca01c96b17548baefd9054aed8af93e2d5","observation_id":"83e39c97-ec97-486e-a77b-473dd56ec2ef","resolution":{"observed_at":"2026-08-07T10:16:56.066230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-09T18:53:22.800809Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":"2501.09291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T10:16:56.891207Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","venue":"cs.MM","work_id":"08482a98-9bb9-4481-b462-647de195b437","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.175634Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:f4b7a2c183d36b2913209b3d07cf6c5985bc2fc08f76884a75edeaacf563388a","observation_id":"0e99131c-60e1-43be-b897-8b27fd569fc6","resolution":{"observed_at":"2026-08-07T10:16:57.039584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13880","last_updated":"2025-05-27T09:36:03Z","snapshot_observed_at":"2026-08-07T15:42:34.315042Z","submitted_at":"2025-05-20T03:34:53Z","title":"U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding","version":3},"cited_work":{"arxiv_id":"2505.13880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13880","snapshot_observed_at":"2026-08-07T10:16:56.616742Z","title":"U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding","venue":"eess.AS","work_id":"e1691a71-5f25-4264-8914-f18d568cdda0","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.294362Z"},"links":{"cited_paper":"/paper/2505.13880","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:55883ef762af2c8e6afe098643a55a4129a0c58962fb5f43bc1e452ed5489f53","observation_id":"44d951d0-8696-4fcf-921d-c7575a48ecc7","resolution":{"observed_at":"2026-08-07T10:16:56.749500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.281530Z","title":"Cmot: Cross-modal mixup via optimal transport for speech translation,","venue":null,"work_id":"f9058637-b2ba-4666-9501-4f8539a8d43a","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.451078Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:7461fbe2180803ca3e5dc6c788410abb0ba7edb01b9ca01b40f5c87db8d3da65","observation_id":"258d12b3-f868-4a2d-b655-afd4cdcc71fe","resolution":{"observed_at":"2026-08-07T10:16:57.395890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.05899."}