{"as_of":"2026-08-09T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be3e7b0e61b4a6292258cde5c6ee6b8af8c6192391addecbd903254af3023695","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:53.805682Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01560/citation-record","integrity":"/paper/2608.01560/integrity","json":"/paper/2608.01560/citation-record.json","paper":"/paper/2608.01560"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-08-09T04:19:26.146382Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-07T00:13:52.600060Z","title":"Niklas Muennighoff, Nouamane Tazi, Loïc Magne, and Nils Reimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.600060Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:565d81f112ea425111f9d742e32155c030fd2f40c9da927a6d71bd4e2f5616f7","observation_id":"a028c132-d4b3-4f80-80f1-0c0b5f449658","resolution":{"observed_at":"2026-08-07T00:13:52.600060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-07T00:13:52.736101Z","title":"Yu Pan, Yanni Hu, Yuguang Yang, Wen Fei, Jixun Yao, Heng Lu, Lei Ma, and Jianjun Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.736101Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:65727589e809335f097ac41750ece0bac92db3a51691172affc67e9adff2aa35","observation_id":"c1dd2c93-60cf-432a-8602-9c63e3541725","resolution":{"observed_at":"2026-08-07T00:13:52.736101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07848","last_updated":"2023-12-04T06:27:50Z","snapshot_observed_at":"2026-07-06T15:42:06.758676Z","submitted_at":"2023-06-13T15:28:10Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07848","snapshot_observed_at":"2026-08-07T00:13:52.886296Z","title":"Joshua Robinson, Ching-Yao Chuang, Suvrit Sra, and Stefanie Jegelka","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.886296Z"},"links":{"cited_paper":"/paper/2306.07848","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:38049ca25cfa7d7aa928bdefa9f5054be3c085574c99e6486d555c2f0b81e999","observation_id":"af0f95bd-1df9-460e-b0bc-12c42e17a5bf","resolution":{"observed_at":"2026-08-07T00:13:52.886296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-07T00:13:53.022159Z","title":"Joshua Robinson, Li Sun, Ke Yu, Kayhan Batmanghe- lich, Stefanie Jegelka, and Suvrit Sra","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.022159Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:e7ac077b85e62f1cab11b499fff75cee96f9fe55e820e58c23f4385338d2400e","observation_id":"b83880a0-f5fe-4558-b0a9-e50d9f4fb031","resolution":{"observed_at":"2026-08-07T00:13:53.022159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11230","last_updated":"2021-12-19T11:16:33Z","snapshot_observed_at":"2026-08-07T21:50:05.546907Z","submitted_at":"2021-06-21T16:22:43Z","title":"Can contrastive learning avoid shortcut solutions?","version":3},"cited_work":{"arxiv_id":"2106.11230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11230","snapshot_observed_at":"2026-08-07T00:13:54.582345Z","title":"Can contrastive learning avoid shortcut solutions?","venue":"cs.LG","work_id":"a09a5a5a-ab6e-48ca-b5cd-c3dd4e0b1157","year":2021},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.147059Z"},"links":{"cited_paper":"/paper/2106.11230","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:0de5a5af339a83331e53ce35458a388cacbd95953c79ad84d1fe2761dff1a9f5","observation_id":"2ecaa0ab-8f4b-4b27-8021-f1f2fa36a7cd","resolution":{"observed_at":"2026-08-07T00:13:54.693089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-06T07:56:47.796949Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"cited_work":{"arxiv_id":"2607.18666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.18666","snapshot_observed_at":"2026-08-07T00:13:54.329150Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","venue":"cs.CL","work_id":"19fee096-0f69-40cc-b740-63a03a75e90b","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.298988Z"},"links":{"cited_paper":"/paper/2607.18666","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:27afdda7aef63d96b0d21bd45492a89c93d6b2a7c20ddfb9e92970b2b234c431","observation_id":"b21b671d-365c-4e1d-b228-490938aed096","resolution":{"observed_at":"2026-08-07T00:13:54.384676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-02T19:54:31.470003Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-07T00:13:53.628346Z","title":"Jihai Zhang, Xiang Lan, Xiaoye Qu, Yu Cheng, Mengling Feng, and Bryan Hooi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.628346Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:283e17c6f32788665baf5442e1acf1705f9607e38893a48b3eb511f7829ee808","observation_id":"70845207-61b5-4aad-b78c-9e1cd873b88c","resolution":{"observed_at":"2026-08-07T00:13:53.628346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11816","last_updated":"2024-07-15T14:28:46Z","snapshot_observed_at":"2026-08-07T14:15:29.921371Z","submitted_at":"2024-02-19T04:13:33Z","title":"Learning the Unlearned: Mitigating Feature Suppression in Contrastive Learning","version":3},"cited_work":{"arxiv_id":"2402.11816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11816","snapshot_observed_at":"2026-08-07T00:13:53.975852Z","title":"Learning the Unlearned: Mitigating Feature Suppression in Contrastive Learning","venue":"cs.CV","work_id":"7fc6bafa-b391-4e61-82b0-c293080dcd4f","year":2024},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.805682Z"},"links":{"cited_paper":"/paper/2402.11816","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:7e88deeba2a3bdbc3c55a1e79ac07bb0cf262879c223e2b2a8302c9d69c12b65","observation_id":"3227e367-80fd-4445-8a81-e303308d8d4e","resolution":{"observed_at":"2026-08-07T00:13:54.118372Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-07T00:13:53.463904Z","title":"Yusong Wu, Ke Chen, Tianyu Zhang, Yuchen Hui, Marianna Nezhurina, Taylor Berg-Kirkpatrick, and Shlomo Dubnov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:53.463904Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:f52fdffd7782dbd4b3e8f678c0f480f2b9b959d376d4b5e5b0af4cd0a40115e4","observation_id":"8ad9a670-8b50-45a1-967c-068b9e1b39d1","resolution":{"observed_at":"2026-08-07T00:13:53.463904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07780","last_updated":"2023-11-21T15:22:43Z","snapshot_observed_at":"2026-08-07T19:55:47.722613Z","submitted_at":"2020-04-16T17:18:49Z","title":"Shortcut Learning in Deep Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07780","snapshot_observed_at":"2026-08-07T00:13:52.229065Z","title":"Aditya Kusupati, Gantavya Bhatt, Aniket Rege, Matthew Wallingford, Aditya Sinha, Vivek Ramanu- jan, William Howard-Snyder, Kaifeng Chen, Sham Kakade, Prateek Jain, and Ali Farhadi","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.229065Z"},"links":{"cited_paper":"/paper/2004.07780","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:1e5e7228699998895bad99ea8c3bf39161fa9bedce346aab9cd1f2f9953aec2f","observation_id":"9dc3efa2-3379-46a4-b513-be2467aff359","resolution":{"observed_at":"2026-08-07T00:13:52.229065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.02803","last_updated":"2021-10-23T18:25:17Z","snapshot_observed_at":"2026-08-07T15:46:24.764042Z","submitted_at":"2020-11-05T13:19:48Z","title":"Intriguing Properties of Contrastive Losses","version":3},"cited_work":{"arxiv_id":"2011.02803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.02803","snapshot_observed_at":"2026-08-07T00:13:55.243611Z","title":"Intriguing Properties of Contrastive Losses","venue":"cs.LG","work_id":"0e8a4180-8b43-471b-9b97-3ce4c01302e4","year":2020},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.926174Z"},"links":{"cited_paper":"/paper/2011.02803","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:1d8884fa227ad2d9bf336a24aee6b6277054bd482c12bd856d8efee7e2ed9ae4","observation_id":"8003aa6a-11dc-4ec3-aa4a-76703c8b9a1d","resolution":{"observed_at":"2026-08-07T00:13:55.346283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13147","last_updated":"2024-02-08T03:21:26Z","snapshot_observed_at":"2026-08-09T09:31:29.895012Z","submitted_at":"2022-05-26T04:33:56Z","title":"Matryoshka Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13147","snapshot_observed_at":"2026-08-07T00:13:52.324203Z","title":"Steven R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.324203Z"},"links":{"cited_paper":"/paper/2205.13147","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:bf924ffde608962b52a271cd1abd36bb35f86cbc096629d90841230f3b1516fa","observation_id":"9d98e0ee-b112-4a56-8aa4-8e6287efff0e","resolution":{"observed_at":"2026-08-07T00:13:52.324203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-08-09T13:10:40.818885Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-08-07T00:13:52.065013Z","title":"InIEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.065013Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:4fd326bcf49a9912b017fdee73d84ec3eeae9c3e13ea96e2bb804db48e949475","observation_id":"9ba6b2d1-d4f9-4aef-b18a-41944a65099a","resolution":{"observed_at":"2026-08-07T00:13:52.065013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17510","last_updated":"2024-07-31T21:02:12Z","snapshot_observed_at":"2026-08-04T04:04:53.743132Z","submitted_at":"2024-02-27T13:50:34Z","title":"Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17510","snapshot_observed_at":"2026-08-07T00:13:51.851266Z","title":"InTransactions on Machine Learning Re- search (TMLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.851266Z"},"links":{"cited_paper":"/paper/2402.17510","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:b85116a9ab107b3b2b8e1210e2f5fe22de9c23e392e12a6fe366ce2bc7ca0a2e","observation_id":"52b56ada-bc48-42b5-8437-6b8dd70795af","resolution":{"observed_at":"2026-08-07T00:13:51.851266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-08T16:59:04.689844Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":"2607.03806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-08-07T00:13:54.931212Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","venue":"eess.AS","work_id":"97c10890-2639-4f0a-b3a2-9c47eecadfe6","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.441021Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:5292660895e8b9461fbc6a875c760e6ce3b0ad727ec1d1f231cad25bb329e9a3","observation_id":"4e582ce5-864a-400c-aeb7-2df1822df112","resolution":{"observed_at":"2026-08-07T00:13:55.009060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T21:51:58.608541Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2608.01560."}