{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d3efe1a2a88446d133feb3093b799b0c940d85fc4474ac72c1640caa7b2683b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:36:58.861961Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:36:58.680579Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:36:58.919922Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"cited_work":{"arxiv_id":"2507.07764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07764","snapshot_observed_at":"2026-08-06T18:36:58.919922Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","venue":"cs.SD","work_id":"94a75125-ef8a-4c6a-9cc9-128b4727c2f2","year":2025},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.680579Z"},"links":{"cited_paper":"/paper/2507.07764","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:d55517498014745269c3e52af1cec93e48992a70137499711939814cceab30e4","observation_id":"4d58c5a9-f745-42ae-af63-f8ab1724d28e","resolution":{"observed_at":"2026-08-06T18:36:58.925752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07764/citation-record","integrity":"/paper/2507.07764/integrity","json":"/paper/2507.07764/citation-record.json","paper":"/paper/2507.07764"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"cited_work":{"arxiv_id":"2507.07764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07764","snapshot_observed_at":"2026-08-06T18:36:58.919922Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","venue":"cs.SD","work_id":"94a75125-ef8a-4c6a-9cc9-128b4727c2f2","year":2025},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.680579Z"},"links":{"cited_paper":"/paper/2507.07764","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:d55517498014745269c3e52af1cec93e48992a70137499711939814cceab30e4","observation_id":"4d58c5a9-f745-42ae-af63-f8ab1724d28e","resolution":{"observed_at":"2026-08-06T18:36:58.925752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.465495Z","title":"grass” versus “sand","venue":null,"work_id":"f028e55f-b39a-46dc-bb69-212e64b22809","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.684264Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:3b626678c786eca3d797cb0a54bf964d572cc55466ed1c700a0d00ae5fbebbd1","observation_id":"21a9d760-f539-44b9-bf9b-f451be889239","resolution":{"observed_at":"2026-08-06T18:36:59.468696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.455962Z","title":"[13] and Vahidi et","venue":null,"work_id":"13b75e45-dacf-41ce-b91b-a91578ace658","year":1977},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.687436Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:6810d0467dad0a32c491a15a3e0fc0fe001edd22990e0255fc4b37fef3e4dd89","observation_id":"3f264bcc-79ca-43f4-ba59-411246531da8","resolution":{"observed_at":"2026-08-06T18:36:59.458948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.435978Z","title":"We choose to report triplet agreement instead, as it is a more intuitive metric to interpret than the other two","venue":null,"work_id":"01385bdf-5d64-4b3f-827c-10afa29b71f4","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.694685Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:d47cc8a2e219cee34c04d084d1c01eb944025863428c917881dd66e02adc9e0a","observation_id":"4c42faf4-44e9-49c1-ba62-1f14dd48e108","resolution":{"observed_at":"2026-08-06T18:36:59.440097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.426137Z","title":null,"venue":null,"work_id":"ab4cc027-3b91-43b8-87f8-87e454501e18","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.697917Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:139f81b299fcd897cb9bef5dc5ec379ac45e5fc20c825206df8b3858b4edb311","observation_id":"3a2ab18a-adca-42b9-9102-d73d6a2aea9a","resolution":{"observed_at":"2026-08-06T18:36:59.429431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.415431Z","title":null,"venue":null,"work_id":"ab65790f-78d3-4086-b573-ccabb04c79f4","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.701117Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:fa06a178dc956c4b6a832bf97a371289d37c17bcc16acec89b92898b3a55cb6f","observation_id":"27428951-4c7b-4d03-89fa-2780caa54953","resolution":{"observed_at":"2026-08-06T18:36:59.419510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.703881Z","title":"This work is supported by the EPSRC UKRI Centre for Doctoral Training in Artificial Intelligence and Mu- sic (grant number EP/S022694/1)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.703881Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:00d80dc15496d5a2c44e0d289e213d9583ceaf0972fbb7f6bfc6ee3b69b6d052","observation_id":"0cabdfbb-42f6-427f-9cad-5ad7d0d7d267","resolution":{"observed_at":"2026-08-06T18:36:58.703881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.328499Z","title":"Timbre space as a musical control struc- ture,","venue":null,"work_id":"48e409a0-c0da-45ae-8ae6-9b779f6c4024","year":1979},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.730744Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:6bb57291eb12c5386715a604f15b7fc25f9f79ccc6c1165a324d22b58e4ef115","observation_id":"b13c45fc-493d-455f-955b-ba5d23169219","resolution":{"observed_at":"2026-08-06T18:36:59.331488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.405954Z","title":"From clarinet control to timbre perception,","venue":null,"work_id":"11a3972b-4c89-4d6d-9b60-df8f0c9a63a3","year":2010},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.706867Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9c530826e2bb64099bc8f364d92e0ba8b309245ee3da7484ab20db1b5b9e75ea","observation_id":"ed9fb144-040f-4fef-9701-fd080c5689ed","resolution":{"observed_at":"2026-08-06T18:36:59.409112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.397097Z","title":"Music in our ears: the biological bases of musical timbre perception,","venue":null,"work_id":"67697b82-f62b-4a5e-89ba-ade982e8e54e","year":2012},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.709430Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:6a6840a1bdb730fb443efc7e0fad94a81ee7ac6cdafe8a9c8dcf45fcadf95581","observation_id":"ef5c04ba-c8e7-41f8-9c5c-e448e5b299dd","resolution":{"observed_at":"2026-08-06T18:36:59.400302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.387148Z","title":"An in- terlanguage unification of musical timbre: Bridging semantic, perceptual, and acoustic dimensions,","venue":null,"work_id":"ec322939-8d86-41bf-a325-74bc2eaddf41","year":2015},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.712277Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:3e5050ed9717b96d3e7a6fa2654ef9cf02f59c094eabf2e4338aafde642ee776","observation_id":"c6c9ab90-86b6-42c1-810a-d7301c9eef1f","resolution":{"observed_at":"2026-08-06T18:36:59.390475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.376927Z","title":"The perceptual representation of timbre,","venue":null,"work_id":"54e54854-61bf-4225-9879-dba986ad06d0","year":2019},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.715080Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9bf558b426ac0ac447fbcbd6690564e34e2de8d58a6fc6ec3a4c0658c6e20d52","observation_id":"6184c584-7ac8-4524-a395-541dc75f0ea2","resolution":{"observed_at":"2026-08-06T18:36:59.380538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.366665Z","title":"Acoustic structure of the five perceptual dimensions of timbre in orchestral instrument tones,","venue":null,"work_id":"ee6595c4-e175-44ab-9b97-4f685335c4b1","year":2013},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.719462Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:0ec06f30281c1f08718328b9ecfdd2e30391a4369b63469e61ee45d45225733e","observation_id":"8a3eb368-2814-43c1-a8a0-db83f2e99adb","resolution":{"observed_at":"2026-08-06T18:36:59.370665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.356425Z","title":"Neural au- dio synthesis of musical notes with wavenet autoen- coders,","venue":null,"work_id":"3207aad8-1911-4b57-b6fa-485367250d12","year":2017},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.722677Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:3da377c9fc486353b12f5364601fafb46e3fca2ab3797d86e9abd80b1648b844","observation_id":"dc7ac105-070b-432b-8e31-f5b8e680ee37","resolution":{"observed_at":"2026-08-06T18:36:59.359978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.346168Z","title":"DDSP: Differentiable digital signal processing,","venue":null,"work_id":"b1603945-12e5-4689-b704-816a49c1ec7b","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.725439Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:f755e761fbde6a9c10c3d3ed983b85053c8afba20d673b4c23e8d6cbd936acdb","observation_id":"b0e23782-208d-4c81-930c-3c161f8942f5","resolution":{"observed_at":"2026-08-06T18:36:59.349572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.252496Z","title":"Timbre dissimi- larity metrics,","venue":null,"work_id":"34d9ecd9-d778-4f18-83f7-56feaa4e4b0a","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.753737Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:53e29ba692fcb1ea36065e5b197da265b7b8262b308dd9355e50be2ecdd1b2a5","observation_id":"5e262ed1-f9d6-4e9d-b343-61ca98c80c1d","resolution":{"observed_at":"2026-08-06T18:36:59.255243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.243354Z","title":"A differentiable perceptual audio metric learned from just noticeable differences,","venue":null,"work_id":"c229db6b-c39b-46ea-a125-30a7ec392092","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.756915Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:5a4fbf8ed6a3178da41ddcd2315d22785aa6c1b91c0d477458a6df21ed9a776e","observation_id":"b3ea3803-ad72-4e67-bc96-390ee45e6528","resolution":{"observed_at":"2026-08-06T18:36:59.246463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.319732Z","title":"Generative timbre spaces with variational audio synthe- sis,","venue":null,"work_id":"729e47c1-1653-44f1-bac9-3973e2858fab","year":2018},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.733354Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:91940e1e98674f3c766b2f02322b3a1f151a0af30cb1ddd7b5dfc5ff3209a7e5","observation_id":"260430ac-1971-491f-8d60-d64ef1542079","resolution":{"observed_at":"2026-08-06T18:36:59.322613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.310236Z","title":"Time–frequency scattering accurately models auditory similarities between instru- mental playing techniques,","venue":null,"work_id":"b9764f8f-d65c-47f2-b96f-083a741046d5","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.736096Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9c68648e266e55243196c6086598c35143f34839fe1b09e752c0b0fe94d44b27","observation_id":"c6e3b248-7d3e-4827-9ab2-99c134a41677","resolution":{"observed_at":"2026-08-06T18:36:59.313835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.301793Z","title":"Free sorting task,","venue":null,"work_id":"56556cb9-b66d-4e21-8fd8-e0e7f9900f4a","year":2014},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.738717Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:378bdd5a60d0bf9da076a9f9bba4edb5d125d08e4cede6c35c6f01d697aa1658","observation_id":"713156b3-1e30-4721-b1c3-0703c614e60b","resolution":{"observed_at":"2026-08-06T18:36:59.304590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.292614Z","title":"Perceptual musical simi- larity metric learning with graph neural networks,","venue":null,"work_id":"34000f16-1c26-4064-b2c6-d3991bf52c20","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.741580Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e22a2382354f3498b1cda98bf08ef4475ac67d0b3b8df2e739f7d4b288f6060c","observation_id":"a1e33ae8-92c5-41e6-bd22-3430f783f8bb","resolution":{"observed_at":"2026-08-06T18:36:59.295819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.282653Z","title":"Learning metrics on spectrotemporal modulations re- veals the perception of musical instrument timbre,","venue":null,"work_id":"67f83bd2-e444-42f4-80b3-e36981918006","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.744230Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:7f385a57911af5f168dc71476565d04ff6f77478b8cb8ff6220b7013c797c089","observation_id":"91322ee0-d39f-47d5-b1c3-c7da611df263","resolution":{"observed_at":"2026-08-06T18:36:59.285931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.271993Z","title":"On the robustness of mu- sical timbre perception models: From perceptual to learned approaches,","venue":null,"work_id":"e77d6aab-b0f6-42bf-a603-e30901b1c567","year":2024},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.747362Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:b77ed3477be54f3381748765b21c43832b7b47a01b0f61ad27f822ff3f24cc42","observation_id":"43a1bf73-06d9-4362-a35f-dd83376b3860","resolution":{"observed_at":"2026-08-06T18:36:59.276158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.262668Z","title":"Acous- tic representations for perceptual timbre similarity,","venue":null,"work_id":"b6108706-0ba9-44ef-b950-637b8013cf0a","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.751122Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:697f449ea64a5b1043647665a5df03e2b5a2bd516bfe53a55843ddf854ef2131","observation_id":"1ab47ee6-3ad7-44e7-9946-dd69869ac8d6","resolution":{"observed_at":"2026-08-06T18:36:59.265587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.169748Z","title":"Isolating the dynamic attributes of musical timbrea,","venue":null,"work_id":"4c4613f0-46a6-4f6e-aecc-b9ea5e9514df","year":1993},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.782630Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:ec66f5f6358b962d6be3b68f01efc035f74f822b5e63a72c630653b7a66eaa6a","observation_id":"19f577fc-98ff-4944-a3f2-f470487423a2","resolution":{"observed_at":"2026-08-06T18:36:59.172595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.159523Z","title":"Opolko and J","venue":null,"work_id":"a12ff1a5-aefb-4ada-a0f1-101e26ecf7aa","year":1987},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.785463Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:613f8086086c2734b3fddd62e1bf5ac8a0ab20e0374e75067899ee1834227b6c","observation_id":"bffe6cec-7c9d-4bb1-9829-8fa3e5393366","resolution":{"observed_at":"2026-08-06T18:36:59.162667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.233726Z","title":"Cd- pam: Contrastive learning for perceptual audio simi- larity,","venue":null,"work_id":"cd4757b3-ba4c-457e-99ef-4d5dcfce8672","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.759905Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:3472db4daedc6dfc4c1971213df945a30bd2e2330fe336098b505096b195678b","observation_id":"8d54478f-02ef-426c-a628-fbf922b3b02a","resolution":{"observed_at":"2026-08-06T18:36:59.236907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.224252Z","title":"The unreasonable effectiveness of deep fea- tures as a perceptual metric,","venue":null,"work_id":"60383644-fff9-42ae-94e9-68bc30a7b1d7","year":2018},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.762647Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:818876f191e7e5a40177d02c4f4ce7bfcbd4bfc4cbc144fe50f64393d9f720f6","observation_id":"0fffcc33-174e-4aed-a656-eb14eaf49465","resolution":{"observed_at":"2026-08-06T18:36:59.227547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.214359Z","title":"Dreamsim: Learning new dimen- sions of human visual similarity using synthetic data,","venue":null,"work_id":"9b6248d6-a48b-4048-9d4a-1a340bf5d164","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.765889Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:5f49c75a995957284d618dfca130b418f266ce2727dec3491cddc226b00e50b5","observation_id":"867b3abd-7b1d-4ea8-b773-d8d898b9a95e","resolution":{"observed_at":"2026-08-06T18:36:59.218000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.205364Z","title":"Improving neural network representations using human similarity judgments,","venue":null,"work_id":"3994eb67-79a0-4261-b9ad-13746c2a8133","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.769812Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e3f2509317e2522fffbb32e5d1ff5a387ce0daeb19ce6c797f2f9ecbc70da3dc","observation_id":"f9fdc42a-475d-4387-9bde-2bf0a648ed99","resolution":{"observed_at":"2026-08-06T18:36:59.208353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.196499Z","title":"Things-data, a multimodal collection of large-scale datasets for investigating object representations in human brain and behavior,","venue":null,"work_id":"f34385d1-90b0-4c64-9c0d-6e89536b925b","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.774180Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:d3872c6e6c9b0f4010869344f906ad706f2158bdd1ec02c32d2909eb5c6f9d8d","observation_id":"ea926a09-7f56-4ecf-a5df-c50fa8b35f5c","resolution":{"observed_at":"2026-08-06T18:36:59.199770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.187134Z","title":"Multidimensional perceptual scaling of musical timbres,","venue":null,"work_id":"c3bc1c27-90f0-4409-b61f-479046ff1c72","year":1977},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.777120Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:2799a9b3cbe1ebbb523e7647f6f4687b38cb5a23af2304a2699a8d272c710ace","observation_id":"407b7681-cb8e-4409-8151-188bca9a0c36","resolution":{"observed_at":"2026-08-06T18:36:59.190549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.178578Z","title":"Perceptual effects of spectral modifications on musical timbres,","venue":null,"work_id":"77c758a5-5c69-49a0-b105-eb8adfa764ec","year":1978},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.780042Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:b14cde84c741d0ae2826579ae8347375ce07989eab8e0236c8730af52fc4d98d","observation_id":"9e787ca1-04fd-42cc-b22f-e5570ce2e486","resolution":{"observed_at":"2026-08-06T18:36:59.181397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.082656Z","title":"Tim- bre space representation of a subtractive synthesizer,","venue":null,"work_id":"ec0edda5-a0d0-4687-b450-b030134bd151","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.812133Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:7aa3f745a76d1cc1e24e87a639407dad84e650f976cedebddacc05210179be80","observation_id":"f9394321-0ef4-43de-b375-e8f5236c0442","resolution":{"observed_at":"2026-08-06T18:36:59.085817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.446136Z","title":"While some dynamic variations can be observed, loudness is typically reported to have been normalized by expert listeners","venue":null,"work_id":"b19b35a6-5f5a-4f48-b5de-05c8dd1521cc","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.690528Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:2e2c5b7011d1c8e2361137bbdc216d26044cd6f1ade4b872b26c0ab1a90b5c99","observation_id":"e744213d-1208-4a17-91cc-fcaac773e984","resolution":{"observed_at":"2026-08-06T18:36:59.449895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.149950Z","title":"Perceptual scaling of synthesized musical timbres: Common dimensions, specificities, and latent subject classes,","venue":null,"work_id":"68e90bb8-93e2-4951-9975-aec2613606fc","year":1995},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.788046Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9fc413c819cf8253d40a609d7c531870c9daffe5e548368af29e974ec02a13ac","observation_id":"a1d26859-7daa-48ac-95e0-ed08819e1be5","resolution":{"observed_at":"2026-08-06T18:36:59.152866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.140540Z","title":"A common perceptual space for harmonic and percussive timbres,","venue":null,"work_id":"a2642a39-4b46-4b0b-b3b6-f8283f46a730","year":2000},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.791807Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:5b9ffdc9072db109767603518686f3408478e076ad4e8f7387f82f06b0ca6606","observation_id":"8b84a18e-1501-4fdb-8e06-a7a9acb82f17","resolution":{"observed_at":"2026-08-06T18:36:59.144098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.131354Z","title":"RWC music database: Music genre database and mu- sical instrument sound database,","venue":null,"work_id":"2bcf0661-66d4-4040-a119-de31ff89f8c0","year":2003},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.795026Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:0f96f789eec78bbdc43ac36be3398a6295afc29739a7cdf77eb9eba33df09cc2","observation_id":"064f6951-85cc-4682-b4c7-fc7f6ea8c213","resolution":{"observed_at":"2026-08-06T18:36:59.134166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.121533Z","title":"Opolko and J","venue":null,"work_id":"8f471c6b-30a1-4a8e-ab63-e55696133a3c","year":1987},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.798554Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:1b39ca3eaf81b754bfb1665d137d92a45b596baf839ca729043831344e4db262","observation_id":"4f815ff7-34bb-4317-9c6e-61796420cccd","resolution":{"observed_at":"2026-08-06T18:36:59.123980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.112292Z","title":"Acoustic and categorical dissimilarity of musical tim- bre: Evidence from asymmetries between acoustic and chimeric sounds,","venue":null,"work_id":"47f9d68c-78c8-4a95-8a03-c845abb895b9","year":1977},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.801745Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9b8c94d4241e98314ca33fee04632f6e43d852cb1e9284cb414638a1a7955be0","observation_id":"ffefdcde-3ca6-4474-8add-8c1b01e8b78a","resolution":{"observed_at":"2026-08-06T18:36:59.115310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.102189Z","title":null,"venue":null,"work_id":"50978296-3098-41aa-b233-f962328a23cb","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.805038Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9e1efbff93063e59febbbbeab93392b5ff96f7bda207125632e17eac9a0f1fb4","observation_id":"b8d056f8-8fb9-495b-8160-69eb82793b27","resolution":{"observed_at":"2026-08-06T18:36:59.105928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.092492Z","title":"Brightness perception for musical instrument sounds: Relation to timbre dis- similarity and source-cause categories,","venue":null,"work_id":"8ee71562-0451-415f-a441-598101ecf438","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.808756Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:148e6bbc03cd7a238aa412d87235e91f9039eb6267881902c1aadd9badd980df","observation_id":"493fe897-970c-4737-8390-dcae890f45d1","resolution":{"observed_at":"2026-08-06T18:36:59.095886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.997372Z","title":"Joint time– frequency scattering,","venue":null,"work_id":"366418c8-2d6f-42aa-8b56-26cbdacd946f","year":2019},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.838126Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:bf122c570bc1a268c2ae53c61e0d972838bd5487cfa8a13d928b79e8e2b93d61","observation_id":"da169174-1e02-4fdb-8ea2-572942f25794","resolution":{"observed_at":"2026-08-06T18:36:59.000165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.073524Z","title":"pyloudnorm: A simple yet flexible loudness meter in python,","venue":null,"work_id":"c1e1e27d-28b0-4b22-b740-071e69c06ca2","year":2021},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.814758Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:4a27194554c85c65ac65c9347257adaafe48285b8ba004081b87a0dd77f1c445","observation_id":"9ccba66c-6a72-4ae6-a509-472b2e9d8047","resolution":{"observed_at":"2026-08-06T18:36:59.076437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.063296Z","title":"TorchMetrics - Measuring Repro- ducibility in PyTorch,","venue":null,"work_id":"04c14113-b4ad-4aff-853b-c66cfe7a7f88","year":2022},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.817819Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e90f20d724f7955c389129f1044502c0ccaeff5f2e9e0a64f4b7aad33c2481f8","observation_id":"0d66b09a-c9c3-438b-9c17-0f49e1a25d98","resolution":{"observed_at":"2026-08-06T18:36:59.067184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.053591Z","title":"Hyperbolic image embeddings,","venue":null,"work_id":"c3c745b1-f648-4259-b670-68b5698c48e6","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.820856Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:5b9553fd67357756eca88b6320f95b0466198222ef9742ceb28a7abf10c27fc7","observation_id":"7f32aa2d-9797-4aa5-9c39-f7e6e09a632f","resolution":{"observed_at":"2026-08-06T18:36:59.056869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.044678Z","title":"Adapting frechet audio distance for generative music evaluation,","venue":null,"work_id":"3e9d6816-ebb3-4f75-813b-371a6f623314","year":2024},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.823364Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:1e012880734b099da066663b9a7a1774c16a194fbdc3173d4feedb74b3dd87c7","observation_id":"a741b94c-0110-4504-b916-cfd12bb39fa0","resolution":{"observed_at":"2026-08-06T18:36:59.047649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.034545Z","title":"Deep resid- ual learning for image recognition,","venue":null,"work_id":"fc8b44ed-08cc-459d-bb19-3285c285fb6d","year":2016},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.826198Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:7e356e03d0517f69405a18af43d88dc8db00edd23b97f39837afce17e1af0fe3","observation_id":"a8b1cf02-1ef2-48d3-9158-a7613a3fc841","resolution":{"observed_at":"2026-08-06T18:36:59.037962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.025254Z","title":"Image style transfer using convolutional neural networks,","venue":null,"work_id":"6c25b4f1-b29a-4948-9f86-109fbb82a01d","year":2016},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.828777Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:c8aac335ca58aae7459b0ac17acdc1c682e1d27f9ba222fa826e146a45075a48","observation_id":"0646fb30-9360-47e7-bbd7-9bcfd873b712","resolution":{"observed_at":"2026-08-06T18:36:59.028198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.016068Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization,","venue":null,"work_id":"6c2d575e-3b0a-486c-a6a4-cc06511ae7f2","year":2017},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.831139Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:9aa5d0e64cab01bae3e4288a3a488130965e81003028194a6c3844f92e9c3db4","observation_id":"fd3b7f84-536a-42c9-8eec-4658919923e1","resolution":{"observed_at":"2026-08-06T18:36:59.019176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.006654Z","title":"Kymatio: Scattering transforms in python,","venue":null,"work_id":"69756ea3-8251-4ab4-a48a-0efecd642769","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.835006Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:1920d383e860f48bd59d911c4318ee63950582807d78c33ca63d3496e2031249","observation_id":"7eedff74-ad9d-4b16-8a5c-0f92f4e44c51","resolution":{"observed_at":"2026-08-06T18:36:59.009634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-06T18:36:58.841041Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.841041Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e0f121e7fdc5aa9ee9bde857e1933f6789290a1f37a718c708677d700aa2e09c","observation_id":"8c7295bf-8c98-4fc3-92bc-ed14beb24e5f","resolution":{"observed_at":"2026-08-06T18:36:58.841041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.987127Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"3d17b171-341b-48f0-8623-1ba9924f7768","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.843961Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:eb428473230b53c0316bde24d4906a28cac9c17faa47ee56f72125a5b0f86142","observation_id":"d4a3cb11-d2c3-4c4a-812a-7c9676397a09","resolution":{"observed_at":"2026-08-06T18:36:58.990443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T18:36:58.847114Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.847114Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:6fb57909a14814baaea0e852cad95f2dd87788c11eefba0c74a251d12632d50f","observation_id":"fb84d5aa-d730-4e61-9b86-a438fa67f758","resolution":{"observed_at":"2026-08-06T18:36:58.847114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.975685Z","title":"High-fidelity audio compression with im- proved rvqgan,","venue":null,"work_id":"dfa91e88-39a7-411c-a290-4ab5616f1dd2","year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.850721Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:ad1c90fdf13f4eb1b47dbbfee58ca1a09ff0d3839723d36e33953e96c64d0282","observation_id":"feb209ac-43a1-43e7-a382-0b1f4de197b3","resolution":{"observed_at":"2026-08-06T18:36:58.979365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.965583Z","title":"Music2latent: Consistency autoencoders for latent audio compression,","venue":null,"work_id":"19bae76d-22a6-4f6c-8b0c-1786f15bf0f1","year":2024},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.853998Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:be1a6066413323eb2edacf795660b1604902d3145c19199e45dcd3544d8e090c","observation_id":"a7f6b7ec-7879-4521-88ce-1700817fd7d8","resolution":{"observed_at":"2026-08-06T18:36:58.968651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.954434Z","title":"Learning complex basis functions for invariant representations of audio,","venue":null,"work_id":"5ff389d0-2528-4182-8101-2a373710fceb","year":2019},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.856677Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:c3f2a6ff0ebdd31839ae80bc6798996a8486f4d9dd86464968bad91e99ab7913","observation_id":"d74b70dd-2d8a-4c4f-b01a-9ce7411d75d2","resolution":{"observed_at":"2026-08-06T18:36:58.957744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.944795Z","title":"Maps-a piano database for multipitch estimation and automatic transcription of music,","venue":null,"work_id":"cb5a6e36-0e9a-4ed0-86ab-796f3a0aa2fc","year":2010},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.859146Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:7037e6dd9508a705c87a36d035d69cf0628d96f024cef334264d108196e836c6","observation_id":"f8690965-7c15-4afe-9b4f-2ba69619e6a3","resolution":{"observed_at":"2026-08-06T18:36:58.947874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:58.933447Z","title":"I’m sorry for your loss: Spectrally-based audio distances are bad at pitch,","venue":null,"work_id":"f619088d-c187-4e9b-8ec1-b84241e80803","year":2020},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.861961Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:e620e0f8ebdff2c3ec06727f4a780b92e6c3215bbf170cc042f59bee936fa26a","observation_id":"abb8d2c5-63f3-478c-9369-3eca8c0f5b44","resolution":{"observed_at":"2026-08-06T18:36:58.937329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:36:59.337254Z","title":"Available: https://openreview.net/ forum?id=B1x1ma4tDr","venue":null,"work_id":"7c3ac67f-50cf-4c1b-8108-95fcc82a84df","year":null},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.728060Z"},"links":{"citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:f31fb1185028692eaddd4e41521ca4d86361ce3b54bffd2613874a17107efe38","observation_id":"6ad20e14-4c52-4be0-8fe2-12b7618a400b","resolution":{"observed_at":"2026-08-06T18:36:59.340187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T00:17:40.498954Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.07764."}