{"as_of":"2026-08-20T23:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f135b8d97c716f95301356a5cef5ca9d720185356e8c909bb27fbe0fa056ff9f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:40:31.434228Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:47:06.204617Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-11T05:40:31.434228Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-17T03:23:52.366822Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.434228Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:1bbe72948e44d761ae08e87694c4b9621187e1a2ddc3cba260d4a6c506362752","observation_id":"04e40ff3-35ce-45d5-b695-55f1dfd1d640","resolution":{"observed_at":"2026-08-11T05:40:31.434228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-11T00:45:19.707054Z","title":"Natural language supervision for general-purpose audio representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-19T08:38:11.019942Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.707054Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:db7b3723e6d66b3f6b05621c773d94fe6b52240e621366eb3a6039efcf53ddba","observation_id":"e0fe67b9-e09e-4f8e-bbc3-5ba7e3f01ba1","resolution":{"observed_at":"2026-08-11T00:45:19.707054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-10T22:40:22.027219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-17T12:58:40.139613Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:22.027219Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2501.01108"},"observation_digest":"sha256:cf48c043005cb66889a2f4e5cac24cacaa16e32ebbc0c976ea5307816dd4b782","observation_id":"f511dc3a-e8e6-436d-94a1-c67322a83b80","resolution":{"observed_at":"2026-08-10T22:40:22.027219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T05:58:02.280500Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-17T05:27:48.664917Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.280500Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:6469964b0f12e71977bbe8ef8ce14759b6a453ae3c3177d572017de3bcfd4252","observation_id":"b97ce92b-dd08-458a-a942-8ba4a2e442af","resolution":{"observed_at":"2026-08-07T05:58:02.280500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T00:23:16.501373Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-17T17:54:21.638768Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.501373Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:ce5a537b25a628b7918764a5a3fb982a58aad8a01c694240e190170daabae40e","observation_id":"56e5fd14-df51-4958-83a5-9fbf72c1ac10","resolution":{"observed_at":"2026-08-07T00:23:16.501373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-06T18:36:58.841041Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07764","last_updated":"2025-07-10T13:41:59Z","snapshot_observed_at":"2026-08-20T13:59:06.029704Z","submitted_at":"2025-07-10T13:41:59Z","title":"Assessing the Alignment of Audio Representations with Timbre Similarity Ratings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:58.841041Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2507.07764"},"observation_digest":"sha256:33644ead0a0b9e917d440de5b8788bfb41a51865979d673d8b6f0d6defda3da8","observation_id":"8c7295bf-8c98-4fc3-92bc-ed14beb24e5f","resolution":{"observed_at":"2026-08-06T18:36:58.841041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T17:56:51.732238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-14T16:19:43.372797Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:51.732238Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:030ab5d717de14feb61dc78be10851d52713808d26bbc364f4da2e01b7bcfcab","observation_id":"d0df0562-3026-4658-90ea-b6d7ec5705da","resolution":{"observed_at":"2026-08-05T17:56:51.732238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T11:41:37.651853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-15T02:03:40.133783Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.651853Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:6590ef931ddd015caa78591a236fe8e47c891e608faf8ba6d6131eda3aa400a2","observation_id":"f6cfd9a2-ca3e-476d-a1b4-21d2210b9d49","resolution":{"observed_at":"2026-08-05T11:41:37.651853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-03T19:00:14.134519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-18T02:45:42.623538Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.134519Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:df61c57d4b9173388b7da108c5a0c3a154ba7831a8d7c81b7a2a07d189021328","observation_id":"ac7a9a48-9cd1-43a8-ae44-9dccf9fa0056","resolution":{"observed_at":"2026-08-03T19:00:14.134519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":"2309.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-07-02T15:47:06.204617Z","title":"InProceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR 2017), pages 316–323","venue":null,"work_id":"3fc22ec9-6fb2-45f1-a160-8f23a225bdfb","year":2017},"citing_paper":{"arxiv_id":"2604.20847","last_updated":"2026-02-10T15:24:41Z","snapshot_observed_at":"2026-08-13T21:56:30.113672Z","submitted_at":"2026-02-10T15:24:41Z","title":"Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T02:39:46.434831Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2604.20847"},"observation_digest":"sha256:08e2730ae90f4cc150dbbb8d8b2418a3378ae436ae3fed76f79a092db7acae97","observation_id":"e94647d9-cd93-430c-936c-48719fd21b48","resolution":{"observed_at":"2026-05-16T02:40:30.841192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":"2309.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-07-02T15:47:06.204617Z","title":"InProceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR 2017), pages 316–323","venue":null,"work_id":"3fc22ec9-6fb2-45f1-a160-8f23a225bdfb","year":2017},"citing_paper":{"arxiv_id":"2606.06615","last_updated":"2026-06-04T18:05:39Z","snapshot_observed_at":"2026-08-12T07:11:51.254088Z","submitted_at":"2026-06-04T18:05:39Z","title":"FIGMA: Towards FIne-Grained Music retrievAl","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T23:32:09.401023Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2606.06615"},"observation_digest":"sha256:2dd4e6761910466249db5eb63d4cabe469cc2fe06441f720298eb41175bc896e","observation_id":"a1fde89a-d60c-4ce4-a1db-b92907dcca09","resolution":{"observed_at":"2026-07-02T15:47:06.206175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.05767/citation-record","integrity":"/paper/2309.05767/integrity","json":"/paper/2309.05767/citation-record.json","paper":"/paper/2309.05767"},"outbound":[],"paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T20:01:36.189957Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2309.05767."}