{"as_of":"2026-08-22T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a7ab6bc7db893e2934554425a39daf754cb8c474fc4c971143368f0e10297fd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:24.734968Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:20.642492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T07:57:44.414977Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17690","snapshot_observed_at":"2026-08-06T23:34:20.642492Z","title":"One of these five is the Con- trastiveTransformer we propose","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.642492Z"},"links":{"cited_paper":"/paper/2506.17690","citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:1cd4d5d3f3c966de03ae42cda816b73c434c75138cdd6e38af8318bd0055f7f2","observation_id":"8a5b2c6f-d30a-4812-ae58-262c5d11c13b","resolution":{"observed_at":"2026-08-06T23:34:20.642492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"cited_work":{"arxiv_id":"2506.17690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17690","snapshot_observed_at":"2026-07-03T07:57:44.414977Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings,","venue":null,"work_id":"47dedc4e-47f9-4ce8-85a1-a2e503556696","year":2025},"citing_paper":{"arxiv_id":"2606.10781","last_updated":"2026-06-09T12:33:59Z","snapshot_observed_at":"2026-08-02T04:49:14.009832Z","submitted_at":"2026-06-09T12:33:59Z","title":"Recovering the Zipfian Distribution in Unsupervised Term Discovery","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:37:46.853400Z"},"links":{"cited_paper":"/paper/2506.17690","citing_paper":"/paper/2606.10781"},"observation_digest":"sha256:445ba08928e0bafc3dbf54e5d2477f366b0e617ebaff12fe6285b8aa700d6553","observation_id":"17c1bd09-9974-465f-b9ae-8d97e0f96e5f","resolution":{"observed_at":"2026-07-03T07:57:44.416993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17690/citation-record","integrity":"/paper/2506.17690/integrity","json":"/paper/2506.17690/citation-record.json","paper":"/paper/2506.17690"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:33.735011Z","title":null,"venue":null,"work_id":"ea8b3703-a256-40b6-8410-f33570da1178","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.582057Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:5c54f0e03d22dd33ec02827d28b0759cd9b67c65de3a02d4a8a6647e39d25903","observation_id":"3d543db5-6ca1-44d5-adcd-eee6f7427f48","resolution":{"observed_at":"2026-08-06T23:34:33.846251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17690","snapshot_observed_at":"2026-08-06T23:34:20.642492Z","title":"One of these five is the Con- trastiveTransformer we propose","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.642492Z"},"links":{"cited_paper":"/paper/2506.17690","citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:1cd4d5d3f3c966de03ae42cda816b73c434c75138cdd6e38af8318bd0055f7f2","observation_id":"8a5b2c6f-d30a-4812-ae58-262c5d11c13b","resolution":{"observed_at":"2026-08-06T23:34:20.642492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:33.533628Z","title":null,"venue":null,"work_id":"0764512a-dbca-4ee6-be7f-71a1b1089a64","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.711949Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:37350912d887745942aed88daeb38785594cd5f1ec54e0e12353546c087a3ee3","observation_id":"7c72f640-8b73-429e-acce-db69b8357baa","resolution":{"observed_at":"2026-08-06T23:34:33.656505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:33.159899Z","title":null,"venue":null,"work_id":"a7342776-162a-4fa2-bce8-4f28b3e4531b","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.779117Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:28267ef9063033961cfe8c3ab48a1293274e728ce102db86618fbdcae9d4ab91","observation_id":"94a4fd6a-35cd-4fd3-b3eb-178250b105f0","resolution":{"observed_at":"2026-08-06T23:34:33.337547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:32.917277Z","title":"Pre-trained models For meanpooling and subsampling as described in Section 2.2, we consider four pre-trained self-supervised models from the wav2vec2.0 and HuBERT families [25, 26]","venue":null,"work_id":"a0cdcdb4-2df1-4ef9-8f9e-98b00d86c6a9","year":1920},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.835578Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:bdccc0f0f9d4717ac710d9c6829f8869e10caacf96a3f5430b6b85cbafbec23a","observation_id":"2276d44f-c272-499c-8d75-ec9f12c13148","resolution":{"observed_at":"2026-08-06T23:34:33.016126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:32.727350Z","title":null,"venue":null,"work_id":"b6c698ae-b0c8-48d9-a8a5-55ef780bbc3a","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:20.958896Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:744d135bad456d49caf6ee137aa1f1ec040e1e7461bef97c6d142e78bcc15ecb","observation_id":"71a1f494-7a67-42ef-aa7a-62871f85c910","resolution":{"observed_at":"2026-08-06T23:34:32.803926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:32.422984Z","title":"The AWEs produced by this transformer are then used to encode speech in the target language","venue":null,"work_id":"4036c54c-ea21-436a-932d-fcca3eaba580","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.052060Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:b04c7667898fd04838e4262722b6330710a31a6014cdc68e0328a379d4402f83","observation_id":"47eac02a-e27e-400d-9839-526058712f6e","resolution":{"observed_at":"2026-08-06T23:34:32.562870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:32.210673Z","title":"We also thank the DW Ackermann Bursary Fund and Telkom South Africa for support","venue":null,"work_id":"85d7feef-4d9c-4954-8545-aca5824965fd","year":null},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.139942Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:4d4985d22666ff42ddb294d85116f908d78a13586e59d830861b0db2d26021fe","observation_id":"8dacbc54-fec8-45db-b49d-9e91ef3641cb","resolution":{"observed_at":"2026-08-06T23:34:32.317455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:32.045652Z","title":null,"venue":null,"work_id":"2d644e79-6622-40e3-9dca-b41886d1224f","year":2017},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.246951Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:015d72942d9967174af9b031064f2de104ede43ae5ce315853931a494ffd4cfb","observation_id":"ecc49e82-836e-42b1-a990-917fe08a9d2e","resolution":{"observed_at":"2026-08-06T23:34:32.123176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:31.868344Z","title":"Feature learning for efficient ASR-free keyword spot- ting in low-resource languages,","venue":null,"work_id":"01ba49dd-e878-4d16-bb17-94b628413fde","year":2022},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.336029Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:ce081ef46b7c793298b6a23f499227459c652b6ef68825d14001215d9e1580d1","observation_id":"4332a72a-2fe1-4f04-b85c-ef225b762c32","resolution":{"observed_at":"2026-08-06T23:34:31.974957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:31.747028Z","title":"Unsupervised spoken keyword spotting via segmental DTW on Gaussian posteriorgrams,","venue":null,"work_id":"e37f8ec4-21a9-4bfe-ae59-3854fd92dc9c","year":2009},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.424939Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:2940abfac30af58da77b4a0a8df020e34430a8577c3b7b1640aec3c300c9ca00","observation_id":"bed53b08-7505-4862-8f19-349c4b3f6a1a","resolution":{"observed_at":"2026-08-06T23:34:31.814370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:31.582064Z","title":"Fast ASR-free and almost zero-resource keyword spotting using DTW and CNNs for humanitarian monitoring,","venue":null,"work_id":"a3af79f5-d9a8-4793-ac4b-7df2209fcc9c","year":2018},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.568145Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:fa9453815b5e1edfbfcbb32f7062237c0e29cef52b752ea28f482ac27e677e27","observation_id":"e0db45ca-d94d-4684-854d-55bb59a0b33c","resolution":{"observed_at":"2026-08-06T23:34:31.654260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:31.358653Z","title":"ASR- free CNN-DTW keyword spotting using multilingual bottleneck features for almost zero-resource languages,","venue":null,"work_id":"8db48fbf-c388-4421-aa71-67794deb066b","year":2018},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.677936Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:d72dbf8c18c288c25643bdf342f94be42f7e27909c402c6c47b046c397a5ed73","observation_id":"5ae43782-635d-4d9d-a574-b969edcac892","resolution":{"observed_at":"2026-08-06T23:34:31.476823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:31.147222Z","title":"Feature exploration for almost zero-resource asr-free keyword spotting using a multilingual bottleneck extractor and correspondence autoencoders,","venue":null,"work_id":"912f9895-fa63-4f87-a30a-fe483f117b2b","year":2019},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.771050Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:f67e406bb3ab2281405cf082cfd54a23ef5f23ad046f39d27ea723756229eb28","observation_id":"e7288748-c049-407a-b89f-f231af7c5896","resolution":{"observed_at":"2026-08-06T23:34:31.242657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:30.953284Z","title":"Low-resource ASR-free key- word spotting using listen-and-confirm,","venue":null,"work_id":"c8bda040-b0a8-4a7b-a118-77e6ea0d3406","year":2023},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:21.914582Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:bcdc7f16bd9aa79c0ea79425978dc44a957fa5ad73f90bc24404f09fe4799fb2","observation_id":"ad6a8738-10bc-472c-a1ff-7ec658bd4244","resolution":{"observed_at":"2026-08-06T23:34:31.065222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:30.702701Z","title":"Fixed- dimensional acoustic embeddings of variable-length segments in low-resource settings,","venue":null,"work_id":"e08e05ac-bb7a-4ffa-83c3-03d46675c32f","year":2013},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.036700Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:b7b6ce731d3ab18bfa474cfea1a120a1e41c2ea5672f0d12ba7fcf1802a33490","observation_id":"804d738b-6a46-48bb-8f65-26d18411dd83","resolution":{"observed_at":"2026-08-06T23:34:30.807154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:30.306172Z","title":"Acoustic span embeddings for multilingual query-by-example search,","venue":null,"work_id":"b89a4001-7cee-4deb-92cd-efc86f373767","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.146550Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:93848fbf11912a990d4127266835dcc99b0fbf54e56718a0af5edf1f1437a53b","observation_id":"a781b04c-5f33-4d16-92ce-c2f583a9355e","resolution":{"observed_at":"2026-08-06T23:34:30.445728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:30.077871Z","title":"Audio word2vec: Unsupervised learning of audio segment repre- sentations using sequence-to-sequence autoencoder,","venue":null,"work_id":"66a7756a-bf26-44a1-8e99-edc6437d10c3","year":2016},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.268526Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:e9725229ca5e0523f2873ebcb4567125b806ecbf9905554eb4fa338354ed0774","observation_id":"97784a63-56dd-43d9-968b-3bfd39891c87","resolution":{"observed_at":"2026-08-06T23:34:30.195208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:29.901134Z","title":"Truly unsupervised acoustic word embeddings using weak top-down constraints in encoder-decoder models,","venue":null,"work_id":"888345fd-d6b9-4d3a-84d4-848b021474ae","year":2018},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.386554Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:ab65910b0e85e3e64fa9d5cc430e528ddec67bd458493ac5b612c15eebe18e8e","observation_id":"6717668b-312e-4459-bd6c-3e9d2ff05ebc","resolution":{"observed_at":"2026-08-06T23:34:29.973293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:29.610034Z","title":"Discriminative acoustic word embed- dings: recurrent neural network-based approaches,","venue":null,"work_id":"c8b7ab16-8453-4217-aabd-cf40874d2ec9","year":2016},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.533170Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:ece887d3ea51c1c72e801af76b2a3ef8830d8ccab53b08b5290d299ab2f07911","observation_id":"9bad9526-f1eb-4797-8c6c-d73949a21c3e","resolution":{"observed_at":"2026-08-06T23:34:29.716811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:29.304898Z","title":"A comparison of self-supervised speech representations as input features for unsupervised acoustic word embeddings,","venue":null,"work_id":"4df25110-15a2-4f94-bc3c-547786d069c2","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.606215Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:eb1d6accb45187734f9b51871f2f62b2939ba8018a896ef16f5961cc89e31ae8","observation_id":"f551748e-1b22-4914-8d97-f08e0c2be945","resolution":{"observed_at":"2026-08-06T23:34:29.456418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:28.965126Z","title":"Acoustic word em- beddings for zero-resource languages using self-supervised con- trastive learning and multilingual adaptation,","venue":null,"work_id":"60dcd2a3-5eb9-4bba-8cbf-1285b05164ba","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.712764Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:721daac1f5a53f62d261a0285900e74f0fe3344ee25d99d0d724daae82b0d8ba","observation_id":"dd9d3966-2f4c-4dc0-bd0b-0afbd66e57ad","resolution":{"observed_at":"2026-08-06T23:34:29.124954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:28.681539Z","title":"Self-supervised acoustic word embedding learning via correspondence transformer encoder,","venue":null,"work_id":"bf422ff9-70a3-4571-a7d4-121f9bf3c539","year":2023},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.811144Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:8d71f48299bd24ce1f46febba62810eb0c6f14b7594491a32944fc272717a9fb","observation_id":"391df6ef-9ae4-4a57-8299-7374af587b15","resolution":{"observed_at":"2026-08-06T23:34:28.808829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:28.357533Z","title":"Improved acous- tic word embeddings for zero-resource languages using multilin- gual transfer,","venue":null,"work_id":"95c57c63-98b5-4af6-b591-fdd232fd0595","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:22.989809Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:ab56161d6b657ccb59079769be02eb9fadfee5e186315c0d3e2e0d933ef828b0","observation_id":"60395cf7-1c9e-4b26-98c5-3705aada9f0e","resolution":{"observed_at":"2026-08-06T23:34:28.505935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:28.153097Z","title":"Multilingual transfer of acoustic word embeddings improves when training on languages related to the target zero-resource language,","venue":null,"work_id":"01932eb9-b4cd-418a-8fd1-dff35ed77062","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.107290Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:dea19d42a53176150e7f599abd07a7fa2b9f4d9584513c29c3e8efcb097ebfb2","observation_id":"decd7506-a03f-463e-b863-adbdcf692fa6","resolution":{"observed_at":"2026-08-06T23:34:28.247058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:27.772035Z","title":"Analyzing acoustic word embeddings from pre-trained self-supervised speech models,","venue":null,"work_id":"7d623ae0-56ff-44a6-abbc-b85abcf3d69a","year":2023},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.215514Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:9bb577e3366c5cca682d295a894e0fb0996296f1451c13af36246a76cfbbfa26","observation_id":"6e092636-7599-4b40-bde4-5e21f789b065","resolution":{"observed_at":"2026-08-06T23:34:27.915229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:27.412957Z","title":"Acoustic word embeddings for untranscribed target languages with con- tinued pretraining and learned pooling,","venue":null,"work_id":"4fc18821-c6ce-42cd-aac4-15cf22246238","year":2023},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.357184Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:7aa88c98d62fa1860d36ccdf9d4edb98f3d86fe583cf6cf1493e8ece844c7963","observation_id":"f97bfc77-4c22-476e-99a3-82bfc860af6f","resolution":{"observed_at":"2026-08-06T23:34:27.549598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:27.186592Z","title":"Towards hate speech detection in low-resource languages: Comparing ASR to acoustic word embeddings on Wolof and Swahili,","venue":null,"work_id":"e025f04f-546d-4965-9070-07fcfecb57b0","year":2023},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.457074Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:e1cb895a8102e6eb9e201c7347b2e0c3d27d470162a68c2091d161906f19aa4c","observation_id":"f36a344c-8f8a-4699-b5cc-4af0c08e006b","resolution":{"observed_at":"2026-08-06T23:34:27.340918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:27.009697Z","title":"Attention is all you need,","venue":null,"work_id":"c187f7f0-df53-410d-8e74-ee2d3093c70d","year":2017},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.533048Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:cff07e7ba2a10928e6879295d1a8d21d181a415e248667d439b2350ccdbd66fb","observation_id":"2cabb23c-a16e-4d7d-bf8d-bc98f597a866","resolution":{"observed_at":"2026-08-06T23:34:27.109077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:26.868947Z","title":"BERT: pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":"ad80929b-3d60-49c3-8ae8-e7b91da331c6","year":2019},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.687887Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:d0faca1360ab6df3ea7e0abe2e3ea062fc6ac993a5933dde56536964e686c512","observation_id":"5efbe4f5-dc7f-43fd-8b88-f7ea0477f45f","resolution":{"observed_at":"2026-08-06T23:34:26.931212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:26.639479Z","title":"The NCHLT speech corpus of the South African lan- guages,","venue":null,"work_id":"c23e8c98-d4c8-46fd-905b-53ea045bffb2","year":2014},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.804315Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:d9ff3427d3fe8af3763a62957e08faa23b64c1f4101dc2c8ecbd2bf9dc0c9a69","observation_id":"5419e6ba-8da4-4817-b514-0aab5f1602ef","resolution":{"observed_at":"2026-08-06T23:34:26.791602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:26.407827Z","title":"Common Voice: A massively-multilingual speech corpus,","venue":null,"work_id":"78941357-a560-416d-b223-7d1db270622a","year":2020},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:23.912503Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:f2d184831a73e58c375e6cc5081527bc278d514c22a0ee7069d0c8d2da37b722","observation_id":"a93c2790-1ade-4955-830c-3d1498dc949a","resolution":{"observed_at":"2026-08-06T23:34:26.524988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:26.190245Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"3dadca75-a527-429a-9d37-6a0a2246989b","year":2020},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.031768Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:d03114315e31374d74cb928f90b64a37f266088c33a2deb472d634742335c2ad","observation_id":"cad04715-bd02-404f-a08e-dab2fad84cd0","resolution":{"observed_at":"2026-08-06T23:34:26.263852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:25.979430Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":"6f6f4f03-4ea8-4faa-ba70-ffd2b33cf704","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.141984Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:223ec12b346f58ff243a82939d5a1422d33f2f7067e3fef333751eb5ec3221c9","observation_id":"0fdbfea5-2367-4ca2-bdea-9100e41a8a3f","resolution":{"observed_at":"2026-08-06T23:34:26.079354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:25.747693Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"039a2b19-8a8f-4f13-9f56-b81f8bc43fb0","year":2022},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.269029Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:6cbe8dd8c85f179477cc6d3fac0f5aeda4dd8a7f61d8f9dcc45a2471bc9d48a4","observation_id":"1b35bc14-8162-4aa9-a9a4-4761b3a4da83","resolution":{"observed_at":"2026-08-06T23:34:25.866213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:25.519421Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":"31510c12-8d81-487e-add1-6756bc0ac290","year":2024},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.399201Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:e5d64539a90b981f4aa1c1bddba9d39c34499284c20294e5bdcfd943d82f1557","observation_id":"e1ebc566-077b-44f6-8e16-d2b9d3f65eeb","resolution":{"observed_at":"2026-08-06T23:34:25.645718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:25.327403Z","title":"Montreal forced aligner: Trainable text-speech align- ment using kaldi,","venue":null,"work_id":"57d2e79f-73d9-493e-b29f-b38dfc22b297","year":2017},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.471007Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:4fe7669ecbf06436ccd1aac1b02e9f327d6828c66f205d007f3a489a7715fd9a","observation_id":"9d38f61b-bfb8-4f90-9c5d-8ea5f7128488","resolution":{"observed_at":"2026-08-06T23:34:25.386880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:25.073692Z","title":"Rapid evaluation of speech representations for spoken term discovery,","venue":null,"work_id":"86a8d902-7cb7-4857-afb3-9e2d8bbcd3ce","year":2011},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.586825Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:6fb8f1f8dba4b7de343970ad7bb68e968c11a70ab3b9bc91a2f16d0f063ad5e6","observation_id":"22cee52e-e14e-4138-8649-7e78f68f08bf","resolution":{"observed_at":"2026-08-06T23:34:25.192818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:24.842792Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":"a5725f68-0b3d-46b2-b0eb-0101d9ba6fb3","year":2021},"citing_paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:24.734968Z"},"links":{"citing_paper":"/paper/2506.17690"},"observation_digest":"sha256:9c12e3d3bb45a6e79f4cef7fa0c23f11babd77f1fdd6bda6a46cd7c1b3677d13","observation_id":"30b677a2-061c-479b-9ee9-ea0a3f86fec5","resolution":{"observed_at":"2026-08-06T23:34:24.949123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17690","last_updated":"2025-06-21T11:47:05Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T18:52:00.818169Z","submitted_at":"2025-06-21T11:47:05Z","title":"Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2506.17690."}