{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:EABTYED3Z3PACTGK75LWX3T4OX","short_pith_number":"pith:EABTYED3","schema_version":"1.0","canonical_sha256":"20033c107bcede014ccaff576bee7c75c179e7741a34d8f9736969b179223cbb","source":{"kind":"arxiv","id":"2211.10661","version":1},"attestation_state":"computed","paper":{"title":"Phonemic Adversarial Attack against Audio Recognition in Real World","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","eess.AS"],"primary_cat":"cs.SD","authors_text":"Jiakai Wang, Qinghong Yang, Xianglong Liu, Zhendong Chen, Zixin Yin","submitted_at":"2022-11-19T11:01:21Z","abstract_excerpt":"Recently, adversarial attacks for audio recognition have attracted much attention. However, most of the existing studies mainly rely on the coarse-grain audio features at the instance level to generate adversarial noises, which leads to expensive generation time costs and weak universal attacking ability. Motivated by the observations that all audio speech consists of fundamental phonemes, this paper proposes a phonemic adversarial tack (PAT) paradigm, which attacks the fine-grain audio features at the phoneme level commonly shared across audio instances, to generate phonemic adversarial noise"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2211.10661","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2022-11-19T11:01:21Z","cross_cats_sorted":["cs.CR","eess.AS"],"title_canon_sha256":"42d418b77c06ce6fe5de7190b30139403c76c583e5984c9796396aee55ef4774","abstract_canon_sha256":"495e7070e1adae23127d51aaf71950cad669d5870ae1d4b5517292f9ecba8268"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:17:32.837666Z","signature_b64":"u+fQE8uyJYZBlgSXWDgIJJ7i2ph/5VPlhjuw9P71j3KiQAWLnjDSXc1ogg+sUZ2M/fiGAaw8BHAjjK5b9TjoDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"20033c107bcede014ccaff576bee7c75c179e7741a34d8f9736969b179223cbb","last_reissued_at":"2026-07-05T05:17:32.837249Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:17:32.837249Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Phonemic Adversarial Attack against Audio Recognition in Real World","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CR","eess.AS"],"primary_cat":"cs.SD","authors_text":"Jiakai Wang, Qinghong Yang, Xianglong Liu, Zhendong Chen, Zixin Yin","submitted_at":"2022-11-19T11:01:21Z","abstract_excerpt":"Recently, adversarial attacks for audio recognition have attracted much attention. However, most of the existing studies mainly rely on the coarse-grain audio features at the instance level to generate adversarial noises, which leads to expensive generation time costs and weak universal attacking ability. Motivated by the observations that all audio speech consists of fundamental phonemes, this paper proposes a phonemic adversarial tack (PAT) paradigm, which attacks the fine-grain audio features at the phoneme level commonly shared across audio instances, to generate phonemic adversarial noise"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2211.10661","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2211.10661/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2211.10661","created_at":"2026-07-05T05:17:32.837305+00:00"},{"alias_kind":"arxiv_version","alias_value":"2211.10661v1","created_at":"2026-07-05T05:17:32.837305+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2211.10661","created_at":"2026-07-05T05:17:32.837305+00:00"},{"alias_kind":"pith_short_12","alias_value":"EABTYED3Z3PA","created_at":"2026-07-05T05:17:32.837305+00:00"},{"alias_kind":"pith_short_16","alias_value":"EABTYED3Z3PACTGK","created_at":"2026-07-05T05:17:32.837305+00:00"},{"alias_kind":"pith_short_8","alias_value":"EABTYED3","created_at":"2026-07-05T05:17:32.837305+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.11521","citing_title":"Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models","ref_index":104,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX","json":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX.json","graph_json":"https://pith.science/api/pith-number/EABTYED3Z3PACTGK75LWX3T4OX/graph.json","events_json":"https://pith.science/api/pith-number/EABTYED3Z3PACTGK75LWX3T4OX/events.json","paper":"https://pith.science/paper/EABTYED3"},"agent_actions":{"view_html":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX","download_json":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX.json","view_paper":"https://pith.science/paper/EABTYED3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2211.10661&json=true","fetch_graph":"https://pith.science/api/pith-number/EABTYED3Z3PACTGK75LWX3T4OX/graph.json","fetch_events":"https://pith.science/api/pith-number/EABTYED3Z3PACTGK75LWX3T4OX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX/action/storage_attestation","attest_author":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX/action/author_attestation","sign_citation":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX/action/citation_signature","submit_replication":"https://pith.science/pith/EABTYED3Z3PACTGK75LWX3T4OX/action/replication_record"}},"created_at":"2026-07-05T05:17:32.837305+00:00","updated_at":"2026-07-05T05:17:32.837305+00:00"}