{"as_of":"2026-08-13T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16696fc4ad3aa37a5d76f9d3737f1894a360400022c99386bbd51260ef3123c2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:22:17.991759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:02.613334Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-12T17:22:17.991759Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and- language evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-13T00:55:05.278603Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.991759Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:0d020757655badaaef5d27b3fff5967463bf45d5eace84d86f5519baf4b82b54","observation_id":"1f262fcf-3f34-4c01-86fd-2ff4870db5d6","resolution":{"observed_at":"2026-08-12T17:22:17.991759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-08T12:43:30.185010Z","title":"Manco, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07461","last_updated":"2025-05-16T07:57:01Z","snapshot_observed_at":"2026-08-13T01:29:07.381115Z","submitted_at":"2025-02-11T11:12:19Z","title":"JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:43:30.185010Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2502.07461"},"observation_digest":"sha256:e88a1c5ac8d69cfd98b440d07d4b5799a8fe51d07475f639cbaa5354c6252635","observation_id":"9d8b9043-fede-4b54-9170-38bcae5d84d3","resolution":{"observed_at":"2026-08-08T12:43:30.185010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-07T18:32:14.401660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10362","last_updated":"2025-05-18T16:25:19Z","snapshot_observed_at":"2026-08-09T04:24:18.854597Z","submitted_at":"2025-02-14T18:42:25Z","title":"CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:14.401660Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2502.10362"},"observation_digest":"sha256:ee44262a143685018181b8747ebe5ea40c89f37d70e3d42bfd7891ee8f8882b2","observation_id":"a68a2f30-0c45-4f9d-8cf9-a75673cb0a67","resolution":{"observed_at":"2026-08-07T18:32:14.401660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-07T00:59:51.335865Z","title":"The song describer dataset: a corpus of au- dio captions for music-and-language evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.335865Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:8f56fb4db836efed2b85da6b1fd516e284b9631e97680470825fa789bfc96d05","observation_id":"b0b1ea75-6461-43bb-b90d-d39239aead62","resolution":{"observed_at":"2026-08-07T00:59:51.335865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:99c539a4e6133a9637b3d3e3348f8b79cc17c2779dee10bdea5759d0bcf85714","observation_id":"23506fd1-0fb3-435a-9970-dc4b148b33bd","resolution":{"observed_at":"2026-05-19T02:41:59.652868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2601.02954","last_updated":"2026-05-10T15:03:28Z","snapshot_observed_at":"2026-08-11T15:36:41.247431Z","submitted_at":"2026-01-06T11:54:47Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T16:58:42.970074Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2601.02954"},"observation_digest":"sha256:66308afa048077d624da0946d189fa42a5b3cfc89997797038ea1bef82dbaf7f","observation_id":"2397a433-d135-40b7-b557-229c1112bfb3","resolution":{"observed_at":"2026-05-16T17:01:07.810950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2605.15831","last_updated":"2026-05-15T10:35:49Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T10:35:49Z","title":"Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T18:47:32.003545Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2605.15831"},"observation_digest":"sha256:c36016a4eb24e4477cdd16696a57d32231f6a480396346bb1b30123c095dba0c","observation_id":"82cf1f16-55b0-4018-8b40-bda4867ef943","resolution":{"observed_at":"2026-05-19T18:47:43.065618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2605.16681","last_updated":"2026-05-15T22:34:52Z","snapshot_observed_at":"2026-08-01T12:57:25.699552Z","submitted_at":"2026-05-15T22:34:52Z","title":"A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T20:26:59.049472Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2605.16681"},"observation_digest":"sha256:dd58d3298821e76259ac9fc885bff36e858576738671a76898487f6aee67da82","observation_id":"649a36ce-6a6c-45d1-8bbb-8fa105090041","resolution":{"observed_at":"2026-05-19T20:27:53.657717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2605.22717","last_updated":"2026-05-21T16:54:07Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:54:07Z","title":"Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T03:24:50.604019Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2605.22717"},"observation_digest":"sha256:ce1d955afdec47b8b7df60f30b301628aac483aae7fd0a79db1a7775d9779b59","observation_id":"ae836264-960f-4412-890f-5f47563a8555","resolution":{"observed_at":"2026-05-22T03:25:59.054740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-06T08:41:01.968593Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:bc0dbccdea0d5e315dffa05c8b42adb100467ea1d840617a31b224b58d1fcf50","observation_id":"edb468fa-1a64-4ee8-9930-1f0500ee287b","resolution":{"observed_at":"2026-07-04T11:59:50.467880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":"2311.10057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-04T18:40:02.613334Z","title":"The song describer dataset: a corpus of audio captions for music-and-language evaluation.arXiv:2311.10057","venue":null,"work_id":"c0c79322-6dea-405f-8a29-2e9646bef687","year":2023},"citing_paper":{"arxiv_id":"2606.24307","last_updated":"2026-06-23T08:37:15Z","snapshot_observed_at":"2026-08-11T16:07:58.334135Z","submitted_at":"2026-06-23T08:37:15Z","title":"Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-25T22:42:57.448084Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2606.24307"},"observation_digest":"sha256:37bfde18127762de4526203332871efccf3019b7d2a4d011d01352879ba4cc85","observation_id":"5f130d50-2282-4358-a6f6-44c436bd308e","resolution":{"observed_at":"2026-07-04T18:40:02.615144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-07-30T14:08:14.319931Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and-language evaluation.arXiv preprint arXiv:2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-10T00:25:40.913179Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.319931Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:a69fda7ccdc9142f504ab3c3a7f85817a52661e2429e6ae84d5113f155a98ac8","observation_id":"2b28ed80-085f-4378-ae10-419229f8d8a2","resolution":{"observed_at":"2026-07-30T14:08:14.319931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-01T10:17:24.791254Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and-language evaluation.arXiv preprint arXiv:2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-10T00:25:40.913179Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:24.791254Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:95c2909e133eaf6729b9c02b5f4585e875cc41d73e9f96a7264edffd2a96b1f3","observation_id":"6a7be74d-50e3-4437-a25c-bb32e0a5353e","resolution":{"observed_at":"2026-08-01T10:17:24.791254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-10T04:13:06.240719Z","title":"The song describer dataset: a corpus of au- dio captions for music-and-language evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06634","last_updated":"2026-08-06T23:02:06Z","snapshot_observed_at":"2026-08-12T23:10:57.041477Z","submitted_at":"2026-08-06T23:02:06Z","title":"From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T04:13:06.240719Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2608.06634"},"observation_digest":"sha256:502e9170f04275983f49c2965462863fdf97394507f53c61d8d3e0e4de9ce0b7","observation_id":"957478e6-6a9a-4725-8f78-531460eaa4af","resolution":{"observed_at":"2026-08-10T04:13:06.240719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-11T14:54:55.201613Z","title":"The song describer dataset: A corpus of audio captions for music-and- language evaluation.CoRR, abs/2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T09:19:28.402152Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.201613Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:94d2a60115cc0c5b7cf8f87be91da2257f63a048904158021beee2acb71ab6ce","observation_id":"b68f9f84-a28b-4284-9d43-227b77b4bca7","resolution":{"observed_at":"2026-08-11T14:54:55.201613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.10057/citation-record","integrity":"/paper/2311.10057/integrity","json":"/paper/2311.10057/citation-record.json","paper":"/paper/2311.10057"},"outbound":[],"paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2311.10057."}