{"as_of":"2026-08-19T19:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48cf751950591284114b47ee8b6905d0d3cfd8f82bdf214380c2a3aaf79fe624","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:56:46.342431Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:15:06.622581Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:12.629815Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-02T18:11:35.194361Z","title":"Audio-JEPA : Joint-embedding predictive architecture for audio representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15553","last_updated":"2026-07-27T17:51:19Z","snapshot_observed_at":"2026-08-06T19:44:18.918530Z","submitted_at":"2026-03-16T17:13:27Z","title":"Self-Distillation of Hidden Layers for Self-Supervised Representation Learning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T18:11:35.194361Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2603.15553"},"observation_digest":"sha256:001beb544d6219241bdbd07490c24a563b29b4a2ee799774f4f5ee8e3c9814b5","observation_id":"72f1a689-e70f-43c9-9a42-817712dc2b54","resolution":{"observed_at":"2026-08-02T18:11:35.194361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.01909","last_updated":"2026-06-01T08:46:11Z","snapshot_observed_at":"2026-08-14T02:59:01.918432Z","submitted_at":"2026-06-01T08:46:11Z","title":"Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T12:54:49.511047Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.01909"},"observation_digest":"sha256:7636377046a4e861729c051abde80ac36b4b938a210a93a971e330c170e84ddb","observation_id":"27c28636-ee95-4fc2-9ef2-e1271c8ca576","resolution":{"observed_at":"2026-07-02T01:06:23.815592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.25713","last_updated":"2026-06-29T06:39:51Z","snapshot_observed_at":"2026-08-16T00:50:43.206732Z","submitted_at":"2026-06-24T11:26:38Z","title":"Frequency-Aware Self-Supervised Music Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T19:25:54.322923Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.25713"},"observation_digest":"sha256:95750ba55cf07cb25e3b38fb70e966aaa351dc9ba45ebb7b919d05ac84cc4498","observation_id":"d5760ae9-19fb-428a-aad5-0ae7642e0cc4","resolution":{"observed_at":"2026-07-04T20:50:12.631693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.25713","last_updated":"2026-06-29T06:39:51Z","snapshot_observed_at":"2026-08-16T00:50:43.206732Z","submitted_at":"2026-06-24T11:26:38Z","title":"Frequency-Aware Self-Supervised Music Representation Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T10:04:11.233115Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.25713"},"observation_digest":"sha256:2eb87571a0d86e9f7bbd584d8a0e6cf9eb14d20d205508f942124f16975a0059","observation_id":"1bb2d02d-8af9-44e5-8425-e017f2a60551","resolution":{"observed_at":"2026-06-30T10:04:35.643472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-01T22:46:06.299864Z","title":"Audio-JEPA: Joint-Embedding Predic- tive Architecture for Audio Representation Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16350","last_updated":"2026-07-17T05:28:22Z","snapshot_observed_at":"2026-08-14T03:36:12.798074Z","submitted_at":"2026-07-17T05:28:22Z","title":"Joint-Embedding Predictive Architecture for Sensor-based Activity Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:46:06.299864Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2607.16350"},"observation_digest":"sha256:c8618479aaff0362e81b70e68b329d832481577fc379d97a8b7690b56fec5efa","observation_id":"8b7c4702-41a1-4256-b744-ec10d5d77758","resolution":{"observed_at":"2026-08-01T22:46:06.299864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-01T06:12:42.365990Z","title":"Audio-jepa: Joint-embedding predictive archi- tecture for audio representation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-18T16:50:41.104519Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.365990Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:a0cf6af0ed675f060ffed76489cb05f1d81f19254ef491a609c0259d9a24646e","observation_id":"163f1b05-700e-4916-8794-06d0bdd0842c","resolution":{"observed_at":"2026-08-01T06:12:42.365990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-06T00:40:22.852047Z","title":"Proceedings of the IEEE International Conference on Multimedia and Expo (ICME) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01049","last_updated":"2026-08-02T07:32:46Z","snapshot_observed_at":"2026-08-17T01:36:19.622749Z","submitted_at":"2026-08-02T07:32:46Z","title":"FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-06T00:40:22.852047Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2608.01049"},"observation_digest":"sha256:1c10781dcfd3176e479c01c7f6f7ece7269c423e7d136da920fb45459b4b780b","observation_id":"d67cc45a-d8e6-42ec-9e0e-eab62d207d31","resolution":{"observed_at":"2026-08-06T00:40:22.852047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-15T15:15:06.622581Z","title":"arXiv preprint arXiv:2507.02915 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01310","last_updated":"2026-08-02T15:26:21Z","snapshot_observed_at":"2026-08-19T05:25:08.487294Z","submitted_at":"2026-08-02T15:26:21Z","title":"FATE: Frame-Level Audio-Visual Temporal Embedding","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-08-15T15:15:06.622581Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2608.01310"},"observation_digest":"sha256:b38ff2fc7c95374153acb710b0787a994b21008efe3bf61d92b11ffb90b21a7c","observation_id":"9e4fb628-aff5-4fb9-968a-da07888529a3","resolution":{"observed_at":"2026-08-15T15:15:06.622581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-07T15:44:33.047406Z","title":"arXiv preprint arXiv:2507.02915 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06062","last_updated":"2026-08-06T14:07:26Z","snapshot_observed_at":"2026-08-17T15:47:44.516135Z","submitted_at":"2026-08-06T14:07:26Z","title":"Bar-JEPA: Extracting Values from Bar Chart with Joint-Embedding Predictive Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:44:33.047406Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2608.06062"},"observation_digest":"sha256:cf3cc5f0290fd54b35667097f8515d91aef352b1b404eb77c1c83bbc0bb390c0","observation_id":"1c325d45-a496-43b1-8277-e3b12ce316d7","resolution":{"observed_at":"2026-08-07T15:44:33.047406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02915/citation-record","integrity":"/paper/2507.02915/integrity","json":"/paper/2507.02915/citation-record.json","paper":"/paper/2507.02915"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-17T11:07:54.315530Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-06T22:56:46.224028Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.224028Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:fecedd01f6d631369ba273e88ee40a215ddb2790c6e295648f347415a51c33bb","observation_id":"2f1a916e-e772-4f3d-8282-a493595b354f","resolution":{"observed_at":"2026-08-06T22:56:46.224028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11957","last_updated":"2023-09-08T02:31:24Z","snapshot_observed_at":"2026-08-16T15:06:27.876661Z","submitted_at":"2023-08-23T06:57:00Z","title":"CED: Consistent ensemble distillation for audio tagging","version":2},"cited_work":{"arxiv_id":"2308.11957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.11957","snapshot_observed_at":"2026-08-06T22:56:47.263424Z","title":"CED: Consistent ensemble distillation for audio tagging","venue":"cs.SD","work_id":"add87fbb-4402-4e6f-8723-46baafc2873c","year":2023},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.227882Z"},"links":{"cited_paper":"/paper/2308.11957","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:b531edfbe0f0931cb1bd0b6f5a51f4d693a796a201c092306d9c27dc812f2eb3","observation_id":"9ceb76b9-7dbc-4c05-9baa-86471b24b068","resolution":{"observed_at":"2026-08-06T22:56:47.266196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-16T13:44:18.074840Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-06T22:56:46.230938Z","title":"Scaling up masked audio encoder learning for general audio classifi- cation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.230938Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:e6b7d9db49c1b2636f082ddefa85f92a91e3efb6e19129e1eda31cbc96977c37","observation_id":"b46a13a5-5276-415c-a05e-6a163b4ef094","resolution":{"observed_at":"2026-08-06T22:56:46.230938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06095","last_updated":"2024-04-09T07:57:08Z","snapshot_observed_at":"2026-08-17T03:03:10.324108Z","submitted_at":"2024-04-09T07:57:08Z","title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","version":1},"cited_work":{"arxiv_id":"2404.06095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.06095","snapshot_observed_at":"2026-08-06T22:56:47.247617Z","title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","venue":"eess.AS","work_id":"69a078fd-1f2a-4481-91b3-c594a0d0ed71","year":2024},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.234160Z"},"links":{"cited_paper":"/paper/2404.06095","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:5f8fedffb2185da04ac4dd86b9f4372a74ac51c1690522493e7e88cbb4529600","observation_id":"79718107-558b-4fc2-916e-de189db3939b","resolution":{"observed_at":"2026-08-06T22:56:47.251153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-06T22:56:46.237565Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representa- tions","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.237565Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:dd3cf77feecf9faa3e65b7173b7e6964b7a530ec860026611b04b4bf7e6a1941","observation_id":"fb09b00d-30d2-47af-9ac9-1eb9bb433875","resolution":{"observed_at":"2026-08-06T22:56:46.237565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.241459Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.241459Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:41070530e984192c32b208e78b57190d519d9208957aad85c4ce2e92c2acb51a","observation_id":"8461dad3-f481-4f9a-8785-b4b94006be8c","resolution":{"observed_at":"2026-08-06T22:56:46.241459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-19T16:59:51.434888Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-06T22:56:46.244140Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.244140Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:199459f6a27dbdd444f46797ff041869d6e6e02d04a22e3f1cfa69af30ce2fe1","observation_id":"4615b1ab-4aa0-48a8-b010-a13417829438","resolution":{"observed_at":"2026-08-06T22:56:46.244140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.336621Z","title":"Efficient Self-super- vised Learning with Contextualized Target Representations for Vision, Speech and Language","venue":null,"work_id":"70c9ce3d-d204-4455-82e9-06dd32f91c95","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.247277Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:96d1519817db27668af198a5a672e37fafd5417b97aa0ef38aaf87c7fd04b28b","observation_id":"148ab8b8-5667-4689-ba24-ac83137fca14","resolution":{"observed_at":"2026-08-06T22:56:47.339338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.329428Z","title":"A Path Towards Autonomous Machine Intelligence Version 0.9.2, 2022-06-27,","venue":null,"work_id":"06a5405b-1343-45ad-a9c9-13fe65ed50ea","year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.249998Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:4cb95ad7ba7d308904ba61944ce6e76f4e7b6a24f1c60877ca09cd29d452239b","observation_id":"e1896868-56f7-43f6-85f3-e72bd47c4294","resolution":{"observed_at":"2026-08-06T22:56:47.332558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-16T16:01:20.302377Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-06T22:56:46.252958Z","title":"Self-Supervised Learning from Images with a Joint- Embedding Predictive Architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.252958Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:e8695f9b12e13f2ac88a8273d7bb2f6654e4750636aa122d6e853803e1b3b3ba","observation_id":"02ad345b-f45c-48aa-a64c-c36c78f35ebb","resolution":{"observed_at":"2026-08-06T22:56:46.252958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-17T22:50:34.371081Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-06T22:56:46.256060Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.256060Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:59c1a3984728818626c17249da6a05e1a0a27c2f3bc1ccd20b626f7f3c55bbf8","observation_id":"ba276dbc-f849-4046-b967-aaad6c0b2f1f","resolution":{"observed_at":"2026-08-06T22:56:46.256060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.322230Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","venue":null,"work_id":"e1a825b5-afb6-46d3-95dc-19ad119a1815","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.259155Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:06eb26794d793ace1b470639169b9e2f24281a0364b1b0de68a4ad431119b9c0","observation_id":"0220be99-caa1-4cc6-aafe-1062babe05ec","resolution":{"observed_at":"2026-08-06T22:56:47.325028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02514","last_updated":"2024-08-05T14:34:40Z","snapshot_observed_at":"2026-08-16T13:28:27.554177Z","submitted_at":"2024-08-05T14:34:40Z","title":"Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation","version":1},"cited_work":{"arxiv_id":"2408.02514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02514","snapshot_observed_at":"2026-08-06T22:56:47.133363Z","title":"Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation","venue":"cs.SD","work_id":"052b8ddd-a4f0-4cf6-a526-c1bdc3d6ebf2","year":2024},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.261794Z"},"links":{"cited_paper":"/paper/2408.02514","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:7b16999f96107f8fb80fcb1be6ae7362081bdfb9d9b989cec5f29255fd2ac5c4","observation_id":"4346d857-951e-48c1-a778-886ee9227d0c","resolution":{"observed_at":"2026-08-06T22:56:47.136557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-08-16T16:46:12.763729Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-06T22:56:46.264640Z","title":"Masked Autoencoders that Listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.264640Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:163ad3f93acd53ac03d9f5f68bed8d8891d9a3a5b35d2a255098fe9c600b6e9e","observation_id":"f0292ae4-b77a-4c7d-af57-a5001062a6ac","resolution":{"observed_at":"2026-08-06T22:56:46.264640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.267285Z","title":"A Dataset and Taxonomy for Urban Sound Research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.267285Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:c31cf990e5ae5f0cb4f99be47aa652b7f7cce4770009058474ea6734a409958b","observation_id":"c7a8b073-5e16-4d78-8d5c-3c06e9d4e34a","resolution":{"observed_at":"2026-08-06T22:56:46.267285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.270842Z","title":"VoxCeleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.270842Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:c1e19e3a96324b83d870b530d1d7964a8ed2a2ff2a98b4d5f2e0270e0d432e5b","observation_id":"3f63ad7f-c74a-4ac1-9f15-6748b3153b20","resolution":{"observed_at":"2026-08-06T22:56:46.270842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.273343Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.273343Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:eda05e8a09ea0d9ba5b1c39ad446a4a111265ba87ff51f411d82ccde8f0e768d","observation_id":"2c3fbb49-5d1e-4fb5-8a87-4c07d3fb9534","resolution":{"observed_at":"2026-08-06T22:56:46.273343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.314030Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","venue":null,"work_id":"e69bfe77-2a11-4139-bb21-7d99d8eb1bec","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.276048Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:703cc4e7d4ad287415f5c5b61c1c3ffdd751509b065b190e09e58d447d2ef4ee","observation_id":"48c91fef-02c3-4ea6-b197-ebc56a608317","resolution":{"observed_at":"2026-08-06T22:56:47.317711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06380","last_updated":"2025-03-09T01:34:28Z","snapshot_observed_at":"2026-08-16T12:51:52.661057Z","submitted_at":"2025-03-09T01:34:28Z","title":"TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems","version":1},"cited_work":{"arxiv_id":"2503.06380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06380","snapshot_observed_at":"2026-08-06T22:56:46.985746Z","title":"TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems","venue":"cs.CV","work_id":"ccee505b-775a-49f0-aa88-26d1c2d8ad88","year":2025},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.278586Z"},"links":{"cited_paper":"/paper/2503.06380","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:a2efdc189f7150355bff817ae18efd1b22a4101ef4f383fcca96ff856e252c5d","observation_id":"7e524576-c9a8-49e3-b7e4-fb065bb0e736","resolution":{"observed_at":"2026-08-06T22:56:46.989062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05774","last_updated":"2025-02-25T22:03:28Z","snapshot_observed_at":"2026-08-16T12:55:13.231989Z","submitted_at":"2025-02-25T22:03:28Z","title":"GeoJEPA: Towards Eliminating Augmentation- and Sampling Bias in Multimodal Geospatial Learning","version":1},"cited_work":{"arxiv_id":"2503.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05774","snapshot_observed_at":"2026-08-06T22:56:46.972707Z","title":"GeoJEPA: Towards Eliminating Augmentation- and Sampling Bias in Multimodal Geospatial Learning","venue":"cs.LG","work_id":"7ff493ef-e60e-46ad-bc0f-83f0f44ca6ab","year":2025},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.282310Z"},"links":{"cited_paper":"/paper/2503.05774","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:de410a02c76009502042f85f86562402cd1601e09975f40d362289dc277fb9bf","observation_id":"6463c55d-7c7d-4db6-932f-8ac0213d3ecf","resolution":{"observed_at":"2026-08-06T22:56:46.976297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.306560Z","title":"Bootstrap your own latent: A new approach to self- supervised Learning","venue":null,"work_id":"dc473bab-b7aa-4ca6-9ee2-a8a6ee832831","year":2006},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.284987Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:9bfc514036c769e77136aa267c290b9c588863a9242d82541dc23221a0fcfa1d","observation_id":"62a306d7-63fc-405c-8557-b8c1a04d2a8a","resolution":{"observed_at":"2026-08-06T22:56:47.309278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T22:56:46.287631Z","title":"Decoupled Weight Decay Regulariza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.287631Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:af209918769024e89ef21548668240102278f2c6c015b6eeead4e291f87fb3d9","observation_id":"a7d97c8e-cda5-4076-80b0-a38f88d9d71d","resolution":{"observed_at":"2026-08-06T22:56:46.287631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.299614Z","title":null,"venue":null,"work_id":"5aaa0aec-6866-479a-84a1-f35ac7dbae50","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.290010Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:fa7df40d12feae8187f5bb4ab056de8b1db5c8d31ebb67575073eee21c04cc72","observation_id":"43fa2dff-f79e-4711-a5f3-4176d3548695","resolution":{"observed_at":"2026-08-06T22:56:47.302159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09387","last_updated":"2019-10-21T14:06:01Z","snapshot_observed_at":"2026-08-10T12:14:01.060108Z","submitted_at":"2019-10-21T14:06:01Z","title":"Clotho: An Audio Captioning Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09387","snapshot_observed_at":"2026-08-06T22:56:46.295352Z","title":"Clotho: An Audio Captioning Dataset","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.295352Z"},"links":{"cited_paper":"/paper/1910.09387","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:2266794fb68038b7dd770b9b49c383afa9f64a9bba0a03a3171622af0275fb14","observation_id":"84372658-ed8d-4e29-b5b9-d66d883a3b6b","resolution":{"observed_at":"2026-08-06T22:56:46.295352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.298919Z","title":"CREMA-D: Crowd-sourced Emotional Multimodal Actors Dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.298919Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:6141a3b7f6d28683e5b88f3dd838bea871a90b66c5e73d309653740118f82911","observation_id":"0365b6ed-a8e6-48e8-a8ea-880de64dcfe8","resolution":{"observed_at":"2026-08-06T22:56:46.298919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3758/s13428-014-0464-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Generating an item pool for translational social cognition research: methodology and initial validation,","venue":"Behavior Research Methods","work_id":"9a1b74c1-45cf-4f14-8a1e-30e3d0901823","year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.301331Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:aa9d109fe2737a3ddd918eb82a454990da889dee8cadbd205905de45d194c578","observation_id":"eaef854a-9b7d-40d9-9227-e85ca872837c","resolution":{"observed_at":"2026-08-06T22:56:46.365463Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.284281Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":"f980b153-7a7e-4be6-a880-407458697be9","year":2019},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.304258Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:ceeeb007a75b4f2d941908ecdf542f828fe9c9543a6f8f6633a292518e8d6cf6","observation_id":"2c57c113-8cee-43b9-b57c-71e60fb42b58","resolution":{"observed_at":"2026-08-06T22:56:47.287063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.276992Z","title":"Sound event detection in synthetic domestic environments,","venue":null,"work_id":"7775a091-2ad6-45e5-b9a6-ef1497542e32","year":2020},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.306811Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:3378bc1f75b35ef0dc44a93957d4f00610651ad9759184cde74dbb29123883a3","observation_id":"ad610024-4d77-49cf-a3ca-defdbfe393ad","resolution":{"observed_at":"2026-08-06T22:56:47.279730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.309460Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.309460Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:8f5af8ed5b72bbb015f10d7640f3bc22a0615c7103064c34a83c31b806b2f230","observation_id":"971823ec-6826-4d3f-b24e-acbbf1fad5a3","resolution":{"observed_at":"2026-08-06T22:56:46.309460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-06T22:56:46.311880Z","title":"FMA: A Dataset For Music Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.311880Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:c1abaeb6f3cbe4cb26f699e0cda809105bf0e715e39431658ee2cfb26b9287da","observation_id":"9226004b-7c4c-4480-ba4e-5aa60fa31cbb","resolution":{"observed_at":"2026-08-06T22:56:46.311880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-08-17T14:02:58.750016Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-06T22:56:46.314564Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.314564Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:9c43b794216d805b184d2f95bbc5b47b4d0b3766bb85061a0d35214cbffe5419","observation_id":"6e457330-e699-4686-be90-3df5856309b2","resolution":{"observed_at":"2026-08-06T22:56:46.314564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-16T19:16:33.203758Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-06T22:56:46.317985Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.317985Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:a79e4706952b8238ec2e4a2d3d061f67aa0ad6f767d0a0067114e33683e60bfb","observation_id":"bee0be84-1bd7-4e1e-a8d3-fcb2c2b3ce93","resolution":{"observed_at":"2026-08-06T22:56:46.317985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1216072","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.815122Z","title":"LibriCount, a dataset for speaker count estimation","venue":null,"work_id":"f2ef92d7-32c8-45ca-8647-4647bb7cc34f","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.321292Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:1d2407594032993d36dcfe90cdfac60d470644743553ebcc2668baed24670f04","observation_id":"2d5917d5-1fd9-460d-9a4a-134bdf7d73b6","resolution":{"observed_at":"2026-08-06T22:56:46.821091Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.323549Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.323549Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:1b4481047ea3b15ba5bd54b65dc5aa0deaff4f6555e978bc1d891d40cf161cc9","observation_id":"e17815ff-6608-4292-9d68-a67f2e4f04ae","resolution":{"observed_at":"2026-08-06T22:56:46.323549Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01279","last_updated":"2017-04-05T06:34:22Z","snapshot_observed_at":"2026-08-16T13:47:28.328154Z","submitted_at":"2017-04-05T06:34:22Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.01279","snapshot_observed_at":"2026-08-06T22:56:46.327119Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.327119Z"},"links":{"cited_paper":"/paper/1704.01279","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:d62036b59a169158d956890478fea96fc146dbbd9122a7ac43f65660a477333c","observation_id":"f75daadd-0aeb-4571-a049-2a7d46df962b","resolution":{"observed_at":"2026-08-06T22:56:46.327119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1188976","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.700175Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS)","venue":null,"work_id":"0d8bd3ae-6e86-4d28-a2e9-1ecd90c405a3","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.329589Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:34a2123d32ec26eacbb51525a987efd7660c80db4b368b472c117a01e2012274","observation_id":"25bd55ea-7fa6-40bd-8e6e-ed354dceb3b8","resolution":{"observed_at":"2026-08-06T22:56:46.703751Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1340763","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.619884Z","title":"Vocal Imitation Set v1.1.3 : Thousands of vocal imitations of hundreds of sounds from the AudioSet ontology","venue":null,"work_id":"7d99f6d5-1289-4e06-9be2-51e9fc80f84f","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.332120Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:96a224ae1388d5574ddd4f67777b4ae4d3644588d9fc09a6ff5dd9f90f96e240","observation_id":"32864c85-9e8c-409f-8116-41152284d54f","resolution":{"observed_at":"2026-08-06T22:56:46.623337Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.334390Z","title":"Vocalsound: A Dataset for Im- proving Human Vocal Sounds Recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.334390Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:8f318bc015fb0ddbeb5bee2d2cc4720a677a051a1d5c001d799c1100456a84fc","observation_id":"614e6a51-cad4-40d4-b9bc-255abbffd4eb","resolution":{"observed_at":"2026-08-06T22:56:46.334390Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1472379","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.482926Z","title":"voxlingua33 in WebDataset Format","venue":null,"work_id":"013a2f7b-b6c3-47d2-a6e7-f48c89f5fc78","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.336713Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:d3b4fed85a1b22030855ce22361f4706dba62462c867691e0c66cd47b5517f03","observation_id":"26837dd3-70f9-4a23-89b5-4790b3d9fb14","resolution":{"observed_at":"2026-08-06T22:56:46.486803Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05674","last_updated":"2023-09-09T02:18:17Z","snapshot_observed_at":"2026-08-16T15:02:07.658494Z","submitted_at":"2023-09-09T02:18:17Z","title":"ConvFormer: Plug-and-Play CNN-Style Transformers for Improving Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":"2309.05674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05674","snapshot_observed_at":"2026-08-06T22:56:46.388234Z","title":"ConvFormer: Plug-and-Play CNN-Style Transformers for Improving Medical Image Segmentation","venue":"eess.IV","work_id":"f8ba9fb0-e465-413f-85a6-adafa2ba1011","year":2023},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.338990Z"},"links":{"cited_paper":"/paper/2309.05674","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:c6912bfcb20ebd41bf8d4a65f6f95a027a57b3b54f301862c187e33afa293a44","observation_id":"ab31d341-a210-4f98-a294-fbf0fd3e9782","resolution":{"observed_at":"2026-08-06T22:56:46.392405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13452","last_updated":"2024-12-01T05:55:44Z","snapshot_observed_at":"2026-08-16T16:21:33.097774Z","submitted_at":"2022-10-24T17:59:57Z","title":"MetaFormer Baselines for Vision","version":4},"cited_work":{"arxiv_id":"2210.13452","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.13452","snapshot_observed_at":"2026-08-06T22:56:46.378061Z","title":"MetaFormer Baselines for Vision","venue":"cs.CV","work_id":"4db43e60-6e1d-4789-9d66-dc23e434544e","year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.342431Z"},"links":{"cited_paper":"/paper/2210.13452","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:b80ba6aa28129a0720ea1d51def1fa0affe81f5d028fd0d034adb9bc8369ae08","observation_id":"dbd8b5b8-6aed-4331-a344-773037ffc781","resolution":{"observed_at":"2026-08-06T22:56:46.381208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.291638Z","title":"Available: https://datashare.ed.ac.uk/handle/ 10283/853","venue":null,"work_id":"0bc0afda-0d76-43d4-a4e3-5db1b0aa9302","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.292291Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:b9365455d807269bcece4359596b5883fca56284141612c3378eb4c9395edf75","observation_id":"b4a2ae34-ed58-4a95-8c26-9d91d823260f","resolution":{"observed_at":"2026-08-06T22:56:47.294245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T14:49:46.058264Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":12,"verified_fuzzy":8},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 9 inbound Pith citation observations for arXiv:2507.02915."}