{"as_of":"2026-08-10T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63bdc376ae37b4bd3e3acddb801f0140eb23f5723b69fec1121e80e3ccd8d5af","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:50:12.369547Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:52.441021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:13:54.931212Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9ad018104bc610cac30dce64d4d1bf3658d4c1791116cdfffcd0a8b1ad58a341","observation_id":"0c1d265d-c18e-4906-bc15-45305326e970","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":"2607.03806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-08-07T00:13:54.931212Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","venue":"eess.AS","work_id":"97c10890-2639-4f0a-b3a2-9c47eecadfe6","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.441021Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:5292660895e8b9461fbc6a875c760e6ce3b0ad727ec1d1f231cad25bb329e9a3","observation_id":"4e582ce5-864a-400c-aeb7-2df1822df112","resolution":{"observed_at":"2026-08-07T00:13:55.009060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03806/citation-record","integrity":"/paper/2607.03806/integrity","json":"/paper/2607.03806/citation-record.json","paper":"/paper/2607.03806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:53142085bce7d8eef153de5c80dd568df8fceb5e10566cd8d2dbeee9a5de5657","observation_id":"ee41af6b-b509-468e-a9c8-52051b886ea7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9ad018104bc610cac30dce64d4d1bf3658d4c1791116cdfffcd0a8b1ad58a341","observation_id":"0c1d265d-c18e-4906-bc15-45305326e970","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:0ffa6454b6d2201dbb0d1ce42af89239c1b0537768091099273ac4d69b23345b","observation_id":"9afe3d18-4a72-4e49-b4f0-e265b94a17eb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:500e38eb062ed399125f2f1293e22bf242327983c0e0766ce2ce25e8035a36f4","observation_id":"2b0b683f-ee34-4d91-afa5-a3bdb39f988a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:f2c8e66d2cb835c22249629a73a4b83d12b7dc3792820486ddd5b89b59da98ee","observation_id":"94e8013b-e411-49a8-a644-9acbe548d16f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Clap: Learning audio concepts from natural language su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:72a44d9d7887448e8c8466c1cd49259312850a4b9edb9b7e48d24d13cfd841cd","observation_id":"c43f89b3-2115-4c6d-abdf-8e0b5db0669a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:ea554503377913ce51df2d57ac6caa4813bcd4c62dfc9349398d5241bbcb162f","observation_id":"75b4cc02-c330-495f-aa8e-30680802d67f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14076","last_updated":"2025-04-18T21:00:50Z","snapshot_observed_at":"2026-08-07T16:01:01.023329Z","submitted_at":"2025-04-18T21:00:50Z","title":"Transformation of audio embeddings into interpretable, concept-based representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14076","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Transformation of audio embeddings into interpretable, concept-based representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2504.14076","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:a1f1961e79a8811e9841061ebd27c4ba3a9a5f704f78ee1c48889e71af219202","observation_id":"fc246ef7-dc97-4383-9a25-f9ad0bdfbd67","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Drcap: Decoding clap latents with retrieval- augmented generation for zero-shot audio captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:3be53b28830de56cc720b26d4bb654cdae0466064bab338a2a86232be4f3f1d1","observation_id":"08bc8b6a-c8c9-41c7-b703-9bada44dfc68","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Pam: Prompting audio-language models for audio quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c4ba3164941bdfa9e9fdd9d861355187d63cff8f0ffefb475da71509381fab92","observation_id":"ed783ea8-c6ee-422c-950f-b554e330752f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Listen through the sound: Generative speech restoration leveraging acoustic context representation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:e587762bddbe9f76f7e0da76e338333884df3928e981fb193008482f5d39311a","observation_id":"23d867f7-1456-46c5-8f08-1997fb49bb2c","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Text2FX: Harnessing clap embeddings for text-guided audio effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:004ca5b72cbc849ef354740557b310e1446d71c7b589f1acfe0f3609532cee5e","observation_id":"db2e4b33-a4f4-4b31-82b7-c027e54eb08a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Multimodal room impulse response generation through latent rectified flow matching,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:7d07694f05f0afc727f5594fa8a379aa68afad2d804b4fa0d655744b064d4534","observation_id":"3cc318aa-ce88-44f7-97ee-0cf007adb98a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"TokenSynth: A token-based neural synthesizer for instrument cloning and text-to-instrument,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:40a96975987a5dc2d9e2cf1a6bf72f38ee9c75596a4b565b73a1eb5f288df3aa","observation_id":"1df08775-dc71-416b-bd7b-b0f14cb7c6d7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"FlowSynth: Instru- ment generation through distributional flow matching and test-time search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:ae7125c1e4d10bf8b91af6bc3783c95fc006f8240b8c7ad52a9331edfa1d3dd5","observation_id":"e491dff7-07f1-42c7-924e-9745797aeb1b","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Make-An-Audio: Text-to- audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:f8da8bb7236a36867e2bd53db89a80b2d08845d2a17ce95900ebf600743e280e","observation_id":"85b5dae5-4529-4102-9e0f-73eb8b07c0d9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"T-clap: Temporal-enhanced contrastive language-audio pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:69a0f2ee57827ca557c1cc0f55a46212cadc99cdf207bf80939cada1ee28a97f","observation_id":"b7f7264e-6808-4ec7-894b-cd738a4f4437","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Spatial-clap: Learning spatially-aware audio–text embeddings for multi-source conditions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9076a3ac3d3da01abfda6f194607404935ce639a4c5bcfa719f8b8985573cd5a","observation_id":"5bb71a8c-7804-49d7-ab52-0963347a7ac9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Probing the information encoded in x-vectors,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:8e0103f74815cc16af279ab85d3309e7a6513ad29321f700832bc383afae0d5e","observation_id":"3859c217-7c4e-4788-ba24-51d24cab14c7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-09T05:46:01.132153Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Audiolens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9e4f929b2293dab40da833377ddc553f2f43124065e67421252a8dc4fd7d8454","observation_id":"81c5aee3-dbe6-4897-8bb8-a06c1a164750","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Causal tracing of audio-text fusion in large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:2d52dd15898ff461f896599dd4fa98b617569fdce9d42ff8fea89f174537bb9e","observation_id":"0de9bca0-1c3d-4e85-806f-6d8ce1a21a95","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"AND: Audio network dissection for interpreting deep acoustic models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:4d623d0af51f217b98bef61e68b315b284023c75a4790c475e4bec467b1146c2","observation_id":"5fcd47f9-1234-46b4-8011-2037130c5740","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Do joint language- audio embeddings encode perceptual timbre semantics?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:48016daae557e150ae2ceb9086b9084f22f21ac2ae026b66f2d11bd52dff7728","observation_id":"0c16cf67-d7fa-42f4-ad13-c04e14a69f56","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Evaluating foundation models on timbre-related cognitive tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:5ccca1a805480f015f501d7f22ba34a0918ddd79c7085e2948f1b16bb97cd53a","observation_id":"4266ee53-5c2f-44a2-b1c7-e91a0c3834b8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Investigat- ing the sensitivity of pre-trained audio embeddings to com- mon effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:05c529160ab76876417ee89afc9c079a1b563afda64e5e92078c1c33f63ca4bd","observation_id":"c23d28e3-d8aa-4561-8803-b4eb153d1a10","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Fx-encoder++: Extracting instrument-wise audio effects representations from mix- tures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:5cbba45b8bb7c61ca2ff59bf476455cb94fb0bb0049e32b820765737dde1fe81","observation_id":"562feb02-a6d2-441c-9abc-281e1e49de45","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Large-scale contrastive language-audio pre- training with feature fusion and keyword-to-caption aug- mentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9f1e915f29557ebbd5a67f07753276efb1ff5e8956c608844bac985e1404337e","observation_id":"cf9844ae-7077-471c-baa2-c515c754ebda","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:22d3baa68c0d281c82cb8060e378d3842ef243e11b90617121e0db127d5b381c","observation_id":"887db5df-2e21-4ed7-940f-fe81b566c3ef","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"New method of measuring reverberation time,","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:8c12fc6803e040b67ee13861d811b6124dfc962e3af4c52a5bfd8954ec35a139","observation_id":"ad824632-2204-47d6-b632-dd91f8ad6ed8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Algorithms to measure audio programme loudness and true-peak audio level,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:ea7c9c37dce741ecbcbbfe73f21d40107c0ccf5b0a956c945fc3f012051d0c40","observation_id":"4dd43220-ea83-490e-b905-f58616170a66","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Müller,Fundamentals of Music Processing: Audio, Anal- ysis, Algorithms, Applications","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:57436ca09bd83a11c2208a1f54ebc371f9d382ef9f7763a6357395701f755317","observation_id":"dedcc5e8-d506-4d15-bac9-42870b0d35eb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c36fad56038811a207b10864af6258924033b8c96f9e77f9c61596fb1c5885e6","observation_id":"c6c75ea2-cd55-4574-a8af-1f2337fcd36f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Schölkopf and A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:848aca944889a1ab1c4f048ff69570429dab10a8c8773c8304e2e40c60124f67","observation_id":"ea7efda3-219e-4dc2-859e-53b931ad400d","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Neural audio synthesis of musi- cal notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:01545ad713695b6bc923f6242eac101a45cb32a8cf83c565ea696d1e902f8444","observation_id":"5131fc46-3202-4e66-8491-2bd7096d42f9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:60ef73306ab33b75c7fbac30adfb0c38714c0caba19c9c4eebc068ece81d9931","observation_id":"0d31c327-9087-4455-afa3-82b559705cfe","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"MUSDB18-HQ - an uncompressed version of musdb18,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:2a8eabff0d3a5d48c18daf5d35858e270d6807c4c60849cdeace6775dc277b14","observation_id":"3f06b495-8be4-4f06-b7c7-898278dd178a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03448","last_updated":"2025-12-27T19:25:03Z","snapshot_observed_at":"2026-08-07T12:43:01.213682Z","submitted_at":"2025-08-05T13:49:04Z","title":"SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03448","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"SonicMaster: Towards controllable all-in- one music restoration and mastering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2508.03448","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:41f1e408a1df14ba01e8cdd0d519b754f606035deee9f88788200f7c06384f3f","observation_id":"d8cfdff0-45b2-4cfa-9fa9-f1917c37da25","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"gpurir: A python library for room impulse response simulation with gpu acceleration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:8e5fcaad438e6ede98981000b8676bbedf6df8415b7f193ca81374375c8759cd","observation_id":"10d1efbb-3543-4ca9-9761-43e7d8b0a21b","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised train- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:530682647a5ef17e3d360934032191251d573f188e5ca88be753c4f697faea16","observation_id":"410bb847-7bfc-42c3-b526-1bd5c8aaa7c9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech rep- resentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:57c0c03f9cce46bbc9000828d0f3b8873cbef47c85c5e2c77785446caae904aa","observation_id":"333eccd9-2ec5-4d40-a919-7b0996d5e515","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Wavlm: Large- scale self-supervised pre-training for full stack speech pro- cessing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9ac62727c0130ff9ca4134202a314acb59ffb15cb804b829e6dca63199270a71","observation_id":"cc421c45-9586-4933-bc57-32dba69ac8cb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:1b166f40973cce2fa91c188cb129b209f777d7dd7c813709f581ee3fe91f7050","observation_id":"78ccc18b-dad3-48f5-8fd8-2b05e1246ce8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:d6765175495e5190d80da1939becb433b32f2705ba890c9e4b37ad3bef58477d","observation_id":"2d5cde8c-4c29-488e-a4a4-98805a57bbaa","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Adapting Fréchet audio distance for generative music eval- uation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:26603374b6e649b92cfcf793ebb3cd570edfe6c575b73c7ea7bb1da77cc50fcb","observation_id":"0921a447-7848-4038-a8ab-6309bdfd3484","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2607.03806."}